这周关注本地大模型的朋友,心情大概率是反复横跳的。
一边是模型端集体过年。8月14日,阿里开源了Qwen3.8-27B:Apache 2.0协议、原生多模态、262K上下文, Unsloth在Hugging Face上一次性提供了超过20种GGUF变体,涵盖Q4_K_M、Q5_K_M、Q6_K、Q8_0、IQ4_XS以及UD系列等多种量化方案。知乎同一周,蚂蚁inclusionAI的Ling 3.0系列也放出了无删减的APEX量化版本,稀宇的MiniMax H3等开源模型相继跟上。
另一边是硬件端集体劝退。7月25日启动的这轮涨价是英伟达2026年第三次涨价,也是覆盖面最广的一次:从中端到旗舰全线中招,技嘉显卡8月1日起在日本市场涨价20%至40%,AMD也通知合作伙伴8月起GPU+显存套件涨价10%-15%,华强北渠道甚至出现了厂商封仓、"一日一价写不了报价单"的情况。知乎
模型在狂奔,硬件在起飞。两件事撞在一起,反而把今年本地部署的主题说清楚了:不是"要不要买卡",而是"手里的卡还能榨出多少价值"。
先看一个大背景。Valve 8月初发布的Steam 7月硬件调查显示,16GB显存占比25.90%,首次反超8GB的25.32%,成为占比最大的阵营。知乎也就是说,正在纠结"新模型跑不跑得动"的,大多数是16GB上下的中端卡用户——4060 Ti 16G、5060 Ti 16G、游戏本里的移动版显卡,这批人正是本地AI社区的基本盘。

那为什么现在是"最不该买新卡"的时候?因为这轮涨价和2021年矿潮有本质区别:矿潮是炒作,退潮后价格会崩;这轮是结构性的,AI服务器抽走了存储产能。三星、SK海力士、美光把七八成新增先进产能转向了HBM高带宽内存,单台AI服务器对DRAM的需求量是传统服务器的8至10倍,而单颗HBM芯片消耗的晶圆产能相当于3至4颗标准DDR5芯片。知乎同样一片晶圆,拿去做HBM的利润远高于做消费级GDDR显存,存储厂没有理由把产能留给游戏显卡。
直接后果是显存颗粒价格倒挂:3GB的GDDR7颗粒涨到60-70美元,比2GB颗粒贵了3倍多,一张16GB显卡仅显存成本就增加上千元。这个逻辑短期内看不到逆转,所以现在入场买新卡,大概率是高位接刀。社区里也有人看得很开:“30这些后面估计也要涨价了!电脑已经不适合普通用户了,付费token或者包月才是王道!”哔哩哔哩更悲观的声音则认为本地大模型基本不可用,“3000多美金,可以用10年的chatgptplus了”。知乎这话说得不偏激——如果你的需求只是偶尔问问AI,云端API确实更划算。但如果你是每天都要跑、在意数据不出本机、或者就是享受折腾的人,下面的内容更有用。
先记住一个估算公式,以后不用到处问"我的显存能跑什么"。主流量化格式Q4_K_M大约是4.8 bits/weight,换算过来就是:模型文件大小 ≈ 参数量 × 0.6字节。9B模型约5.4GB,27B模型约16GB。注意,这只是权重文件本身——很多人判断电脑能不能跑本地AI,只看"模型文件能不能下载",这个判断少算了三块内存:系统占用、运行框架,以及KV cache。小红书所以实际能跑的模型,要比"显存÷0.6"再保守一档。
用这周的实测数据对一下这个公式。unsloth的UD-Q5_K_XL作为5-bit混合精度版本,在保持接近全精度模型质量的同时,将模型体积压缩至约19GB——恰好可以在24GB显存的消费级显卡上完整加载;而Q4、Q3的量化版本,更是可以在16G甚至12G显存的设备上部署运行。知乎

按这个思路,把手里常见的显存档位对一遍:
4GB档:微软Phi-4 Mini依然是稳妥选择,能聊、能应急,别指望它干重活。6GB档:这周刚出的Ling-3.0-tiny值得看——总参数7.9B但激活只有1.3B,量化后不到6GB就能跑,是典型的小钢炮;旧的7B稠密模型在这个档位已经可以淘汰了。哔哩哔哩8GB档:Qwen3.5-9B是目前的版本答案,在本周流传很广的Cloud Codes显存天梯实测里,它的GPQA Diamond拿到81.7分,超过了不少120B级模型;想玩本地AI视频生成的,MiniMax H3这种8G显存就能带动的开源视频模型也进了射程。
16GB档是Steam最大阵营,重点说:要速度选MoE,Qwen3.6-35B MoE在这份实测里能跑到100 tok/s上下,日常对话和轻度Agent都够用;要能力上限,27B稠密模型也能挤进去,但要接受更低量化或更短上下文。哔哩哔哩A卡用户要有心理准备:A卡现在主流模型基本都能跑,但兼容性的坑是真实存在的,B站评论区那位用7900XTX训练模型的老哥原话是"为大家的心理健康和寿命着想,请避雷用a卡玩ai"。哔哩哔哩
24GB档,这周的主角来了。Qwen3.8-27B的Q4量化大约16-17GB,Mac上MLX版本约18GB,24GB卡跑起来权重无忧,还能给KV cache留出余量。知乎它的升级是实打实的:对比上一代Qwen3.6-27B,SWE-bench Pro从53.5升到61.7,DeepSWE从13.3跳到42.2,长流程办公从61.0升到70.7。哔哩哔哩

但也要泼盆冷水:24GB单卡跑27B,承担的是低成本验证,不是生产结论,别直接把官方榜单分数等同于自己的日常体验。知乎

32GB+档:可以开始摸Qwen3 Coder Next这种80B级MoE,把空闲专家权重放在内存里流式加载,是典型的工作站玩法。
表看完,有两个比表本身更重要的认知,值得单独说。
第一,MoE时代,"总参数"是纸老虎,激活参数才决定你的显存和速度。Ling-3.0-tiny用7.9B总参做出1.3B激活的体积,Qwen3.6-35B-MoE让16GB卡跑出三位数token速度,都是这个逻辑。这也是为什么接下来最值得盯的消息是Qwen3.8-35B-A3B——社区已经在Reddit上挖到了它的踪迹,35B总参、3B激活,如果真按这个规格发布,16GB卡用户才是最大受益者。
第二,软件层的增量可能比硬件还大。Cloud Codes那份实测里引用了一项独立研究:同一套权重,只是升级了外面的agent harness,SWE-bench Verified成绩就从67.8%拉到90.0%——涨了22.2分。哔哩哔哩你觉得本地模型"不会干活"的时候,先别急着加钱换卡,换一套更好的推理框架、更好的Agent壳子,可能是免费的性能升级。
最后把话说全:哪些人不建议折腾本地?追求最强大脑的——社区共识是本地模型目前接近的是"年初云端旗舰"的水平,离最新一代闭源旗舰仍有差距,需求是顶级能力就直接用云端;轻度用户——一个月问不了几十次,按量付费的API永远比显卡便宜。
但对已经手握一张16GB上下显卡、每天都在用AI的人来说,这周的正确答案很清晰:别买卡,把Qwen3.8-27B或者对位的MoE模型下下来,你的卡正好赶上好时候。
留三个继续观察的信号:一是Qwen3.8-35B-A3B的官方消息,16GB党的"真命天子"可能还在路上;二是9月中旬Steam 8月硬件调查,看16GB的优势是否继续拉大;三是显卡涨价是否延续到Q4——如果延续,二手和魔改卡的价格也会被带起来,到时候连"捡漏"的窗口都没有了。