8月底的AI圈出现了一种很魔幻的错位:一边是开源大模型不要钱地往外扔,强到让人想在自家电脑上跑一个;另一边是显卡和内存价格涨到让人肉疼,装机党直呼"最贵装机季"。想上车的人被架在中间:模型白给了,跑模型的硬件却在历史上最贵的位置。
这篇文章就把这两条线拆开算清楚:现在本地跑AI到底到了什么水平、你手里的电脑能不能直接上、要不要为它花新钱、花的话怎么花不亏。
先看清楚:这一个月开源模型到底卷成了什么样
只看8月这一个月的时间线,密度高得离谱:
8月14日,阿里开源Qwen3.8-27B,27B全参数,发布当天社区就喊出"一张4090就能跑";
8月15日,智谱发布GLM-5.3,8月27日又把GLM-5.3-Flash开源;
8月19日,Ornith-1.5系列开源,9B、35B-A3B、397B三个尺寸,MIT协议;
8月27日前后,Kimi K3宣布免费开源;
8月28日,腾讯混元Hy4 preview发布并当天开源权重:770B总参数、每token只激活49B、1M上下文,Apache 2.0协议;
8月31日,DeepSeek开源V4家族首个多模态模型V4-Flash-Vision。
再加一个大背景:中国开源大模型累计下载量已突破100亿次,居全球首位,调用量榜单连续多周霸榜。微博知乎上已经有人开始横评"五个月内出现的六款百万级上下文开源MoE模型",总参数从176B排到1.6T。知乎

对普通用户来说,最关键的不是参数量,而是两件事:
第一,27B这个级别的模型,回答质量已经接近旗舰闭源模型。B站有UP主把Qwen3.8-27B和顶级闭源模型放到同一堆"祖传屎山代码"面前修BUG,结论是"它确实慢、确实啰嗦,但活儿能交出来"——而且跑它的机器就在你桌子底下。B站在Artificial Analysis的智力指数上,Qwen3.8-27B已经和GPT-5.6 Luna打出了同一个分数。知乎

第二,也是真正改变购买决策的:量化和推理优化技术,把硬件门槛拆掉了一大截。27B模型Q4量化后大约18GB,按老经验要24G显存才舒服;但现在16G显存的卡跑Q3量化能到约40 token/s,甚至有UP主用服役8年的RTX 2070(8G显存),靠层卸载、KV-Cache量化加MTP推测解码,硬是把27B跑了起来。B站实测数据大致是:5090约157 token/s,二手3090约53 token/s,Mac约30 token/s——50 token/s已经超过正常人的阅读速度了。B站
换句话说,"跑本地AI=买顶级显卡"这个等式,在2026年8月之后不成立了。
再看硬件这一头:涨价不是错觉,是全面的
模型这边越免费,硬件那边越涨价,原因其实是同一件事:AI把存储产能吸走了。三星、海力士、美光把产能优先分给利润率高得多的HBM(AI芯片用的高带宽内存),消费级显存和内存颗粒供给收缩,一路传导到显卡、内存条、固态硬盘,甚至手机。
具体的涨价幅度,媒体和社区的数据能对上:
内存端:研究机构数据显示,2026年以来DRAM、NAND价格较2025年底上涨80%—90%;消费级DDR5内存涨幅超400%,有说法称一年内涨了近五倍;手机存储现货三个月涨超300%,DRAM甚至超过SoC成了旗舰手机里最贵的元器件。知乎
显卡端:7月底英伟达向授权AIB厂发出新一轮涨价通知,华强北多家商户一度全面封仓;RTX 50系列普遍涨超1000元,热门型号数日涨数百元;RTX 5060从2599元的价位被拉到3200元以上,京东一度下架显卡重新定价,到9月初技嘉AORUS款5060已标价4099元;连复产的RTX 3060 12G都在欧美涨了约45%,价格反超更新的RTX 5050。微博微博
连黄仁勋自己都说,GPU的涨价速度"超过陈年佳酿",现在买显卡更像投资。

影视飓风那条评论很说明问题:他们去年把剪辑电脑升级到5080/5090、内存加到96G起步,当时觉得贵,今年回头看"反而是节省了巨大成本"。微博这就是这轮行情最扎心的地方——早买的不仅没亏,还在保值。
三笔账,决定你现在该做什么
第一笔账:你手里这台电脑,可能已经能跑了
先别急着掏钱。按社区实测和知乎攻略的共识,显存(VRAM)是唯一的核心指标,CPU、主板都是配角。知乎对号入座:
8G显存(4060、2070这一档):9B级量化模型流畅跑,日常问答、写作、代码助手够用;27B要靠极限量化加卸载硬上,能跑但体验打折。
16G显存(5060 Ti 16G、4060 Ti 16G):当前的甜点档。27B的Q3/Q4量化能跑起来,速度可用,这是"进阶本地AI"的最低舒适线。注意别买8G版5060 Ti,跑9B都在边缘。
24G显存(4090、二手3090):27B全质量舒服跑,这才是真正的进阶门槛。二手3090是目前性价比路线,但水很深,后面细说。知乎
32G显存(5090,约4万元):27B跑到157 token/s,还能勉强上72B的极限压缩版。这是工作站逻辑,不是玩家逻辑。
Mac用户:M系列大内存Mac能"装下"大模型,但统一内存带宽不如显存,输出速度约30 token/s——能用,不快。今年4月后M5芯片优化明显提速,已经有Mac mini用户实测11个本地模型并给出"不上云"的折中方案。手里已有Mac的直接装LM Studio试,专门为了跑模型去买Mac仍然不推荐。B站
什么都没等的老电脑(16G内存、核显):可以跑0.8B—9B的小模型体验流程,但说实话意义不大,不如直接用云端免费额度。

内存条本身:有独显的话16GB够用,32GB更稳,纯CPU推理才需要64GB起步。硬盘至少1TB NVMe固态——27B量化版一个文件就18GB,你想多存几个模型切换,空间很快就吃掉。
第二笔账:本地和云端,到底谁省钱
这笔账不能一概而论,取决于你的用量和场景:
轻度使用(偶尔问答、写个文档):云端完胜。DeepSeek、GLM、豆包的免费额度加上各家新模型的免费期,足够覆盖,本地小模型的能力反而不如免费云端。知乎上"本地部署划算还是付费买Token划算"的讨论里,高赞观点就是:非敏感、非高频场景,免费AI已经能覆盖本地小模型的绝大多数能力。知乎
重度使用(Agent跑任务、VibeCoding、批量处理):本地开始划算。云端按token计费,Agent一晚上烧掉几十上百元很常见;本地是一次性硬件投入加电费,token彻底自由。B站9月初那条"本地模型开发FPS游戏,0元享上亿Token"的实操视频,演示的就是这个逻辑——把项目拆成模块,27B模型全程占用不超上下文,零成本干完。B站
隐私刚需:不是算钱的事。有用户分享过真实场景:跟公司合作时合同明确禁止把私密数据上传云端AI,这时候本地部署是唯一解。合同文档、财务数据、医疗记录、私人对话,跑在自己机器上不出网线,这个价值对特定人群是刚需,对其他人是伪需求。小红书
情绪价值和折腾乐趣:本地模型不排队、不断供、不受审核策略波动影响,社区魔改版、LoRA、整合包玩法极多。这部分人买的不是算力,是"自己的AI"这件事本身。
一个容易被忽略的反证:27B级别的开源模型普遍有"思考过长"的毛病,Qwen3.8-27B刚发布时就被泼冷水"很强、很难伺候、很难用"——开了深度思考不限制长度,200K上下文能给你烧穿,实际使用需要配合思考压缩版或调参。B站B站B站也有2万播放的"劝退"视频,认为27B对普通用户没意义。B站所以"本地模型已经平替云端旗舰"这个说法要打七折:能干活,但要伺候。
第三笔账:真要花钱,现在是好时机吗
大概率不是,但要看你买哪一档。
先说利空:这轮涨价的根源是HBM挤占产能,而新产能落地需要时间,知乎上悲观预测认为价格要2028年底才可能明显回落,"等等党等到天荒地老"的段子就是这么来的。知乎
再说利好,9月初出现了几个值得盯的刹车信号:
群智咨询报告显示,三季度DRAM、NAND价格虽仍环比上行,但涨幅明显放缓,部分存储芯片环比涨幅已收窄到10%以内;三星、海力士股价较6月峰值分别回落约30%和42%。知乎
上游覆铜板厂商建滔已连续近两个月没发涨价函,社区判断接下来大概率横盘或小涨。知乎
长鑫存储的产能预计年底落地,双十一可能有一波好价窗口。
结合这两面,我的判断是分档的:
现在最不该做的,是为了跑AI去追高买新显卡新内存。涨价30%—40%之后入手,等于替这波周期站岗。
如果你的需求是"想体验、想学习":零成本方案先行。已有16G以上显存或大内存Mac的,直接装Ollama(会命令行)或LM Studio(纯小白,图形界面),拉一个Qwen3.8-27B的量化版试两周。两周后瓶颈会自己暴露:是模型不够聪明(等新模型就行,不用花钱)、速度太慢(才需要升级显存)、还是根本没用几次(那什么硬件都不用买)。这个"先试后买"的顺序,在硬件高位期尤其重要。
如果你的需求是刚需(隐私、重度token消耗):刚需等不起,但也别买在情绪高点。16G显存档的5060 Ti是当前入场甜点位;预算紧的可以看二手24G的3090,它跑27B有53 token/s,性价比仍在,但要做好翻车预算。
如果你本来就计划年底换整机:把内存和固态的需求一次性配足(32G内存起步、1TB NVMe起步),宁可现在多花一点买齐,也别指望半年后补便宜货——涨价周期里挤牙膏式升级最亏。

避坑清单:这四类钱,涨了也别花
魔改大显存卡(2080Ti改22G这种):小作坊换显存颗粒,脱焊、掉驱动、烧供电都是常态,底子大概率是服役多年的矿卡,无官方保修只有店保。涨价周期里这类卡卖得最欢,坑也最深。
为了跑模型买A卡:A卡显存大价格香,但本地推理生态是CUDA的天下,ROCm本质在做兼容翻译,性能打八折,新模型首发经常不支持。N卡报错网上有答案,A卡报错可能直接废掉。"高显低能"四个字,社区已经说倦了。
英伟达DGX Spark这类"AI专用盒子":128GB统一内存听着猛,但内存带宽只有273GB/s,跑27B输出约13 token/s,便秘级体验,还只支持Ubuntu、不能打游戏。这是研究工具,不是消费级产品。知乎
预算堆错地方:CPU买个i9、主板堆料、RGB拉满——对本地推理几乎无增益。显存>内存容量>NVMe硬盘>其他,顺序别乱。
值得继续盯的四个信号
这个领域的变量太多,与其给一个"买/不买"的死结论,不如给你四个观察哨:
双十一的显卡和内存价格:供给端其实已经在松动——长鑫的全球DRAM份额刚刚突破10%。知乎如果刹车信号兑现,年底会有明确的入场窗口;如果继续涨,说明产能缺口比预期严重,等等党策略要重新评估。
Qwen4架构的Flash-Next(传125B+51B参数)正式发布后的内存门槛:新架构如果继续走高显存路线,16G档用户会再次被甩开;如果官方出消费级优化版,甜点档会重新洗牌。B站
量化技术的进展:NVFP4、DFlash、MTP这类技术每前进一步,"够用"的硬件门槛就降一截——今年8G显存能跑27B在两年前是不敢想的。软件进步是硬件涨价最好的对冲。
你自己的使用记录:先用免费云端和现有设备跑两周,统计一下你真实的token消耗和场景。大部分人会发现,自己需要的不是本地部署,而是把免费额度用明白。

最后说句实话:开源模型的军备竞赛对我们是纯利好,模型只会越来越强、越来越便宜,这一头永远不用急着上车;硬件价格周期才是真正需要择时的部分。让子弹再飞一会儿,先用零成本方案验证自己的真实需求——这可能是2026年这个秋天,本地AI玩家最划算的一笔操作。