8月26日到27日,硬件圈发生了两件容易被内存涨价噪音淹没、但会直接改写"本地大模型台式机"配置单的事:NVIDIA 把数据中心那套 4-bit 推理(NVFP4)下放到了消费级显卡,llama.cpp 合入了 Qwen3.8 Flash 系列的官方支持。对打算跑本地 AI 的人来说,算力的门槛是真的降了;但没人提醒你的另一半账是——门槛最低的那条"小显存+大内存"路线,恰恰最吃内存条,64GB DDR5 套条从去年这时候约 1287 元涨到了今年八月的约 7538 元。知乎这篇只算一类人的账:靠 AI 短剧、AI 绘图、代码 agent 吃饭或者准备入坑的人。纯游戏党可以现在就退出——那笔账前面已经算过很多遍,这里只看 CUDA。
一、门槛降了的那一半,是实打实的
8月26日,NVIDIA 发了 616.56 WHQL 驱动,Game Ready 和 Studio 双版本一起上,游戏只是顺带,AI 才是重头戏。知乎Studio 版专门给 ComfyUI 的 WAN-Animate-2 和 MiniMax-H3 做了性能更新,等于官方点名了今年最火的两个本地视频生成工作流。
最直观的变化是绘图模型 FLUX.1-dev:FP16 精度要 23GB 以上显存,基本只有 RTX 4090 才带得动,切到 FP4 后降到 10GB 以下,一张 5060 Ti 16GB 就能本地跑起来;出图速度上,4090 跑 FP16 30 步约 15 秒,5090 跑 FP4 只要 5 秒出头。知乎
稠密模型这边,8月31日知乎那篇 16G 部署实测把梯子讲得很清楚:Qwen3.8-27B 官方 FP8 版权重空间要 30G,Q4 量化也要 16G,全塞进 16G 卡根本没有 KV cache 的余地;但往下走一档用 IQ3_XXS 量化,96K 上下文预计消耗 13-14G 显存,16G 卡就真跑得动这代"小钢炮"了。知乎
MoE 路线的天花板同期也在抬:RTX 3090 配 128GB 内存,靠 `-ngl 99 -ncmoe 42` 的分工把约 94GB 的 Qwen3.8 Flash 权重文件塞进 24GB 显存的机器,128K 上下文还能维持约 40 token/s,而 llama.cpp 对这个模型的正式支持 8月27日刚合入官方 master。知乎讨论度最高的一组自测则是 5070 12G 配 64G 内存跑 Qwen3.6-35B-A3B 的 NVFP4 版本:32K 上下文平均 75 tok/s,200K 上下文还剩 40 左右。知乎
一句话总结:本地跑一个"可用"的模型,入场券确实从五万块的 5090 档降到了 16G、甚至 12G 档。
二、但刷屏帖不会告诉你的三笔隐藏成本
第一笔:卸载只发生在吐字阶段,读题阶段走的是 PCIe 独木桥。MoE 每个 token 只搬被选中的几个专家,这是 12G 卡跑 35B 的原理;可 prefill(模型读入你的输入)要把所有 token 路由到的专家取并集,论文实测 DeepSeek-V4-Flash 的 FP4 权重一次 prefill 要经 PCIe 流过约 140GB 专家权重,5090 的 PCIe 5.0 x16 加约 2 秒,4090、3090 这代 PCIe 4.0 加约 5 秒,笔记本和丐版主板常见的 x8 链路直接加 10 秒以上。知乎日常问答你感觉不到,agent 每轮工具调用重跑一次 prefill,感觉会非常明显。
第二笔:稠密模型没有卸载权。同一张 3060 12G 上,稠密的 Qwen3-14B 全进显存跑 35.9 tok/s,卸一半层到内存掉到 5.7,全卸只剩 3.05;而 35B 的 MoE 在同样的机器、同样的 PCIe 3.0 上卸完还有 38。知乎想跑 14B/27B 稠密模型的,显存每一 GB 都得老老实实买在卡上。
第三笔:这台机器只属于你一个人。专家缓存只留 5% 的条件下,batch=1 的缺失率是 6.91%,batch=16 直接冲到 68.84%。所以"我跑通了"和"我给全组用"是两回事,后者一张卡都省不掉。顺带一提,200K 上下文能塞进 12G,一半功劳其实不在卸载,而在 Qwen3.6-35B-A3B 换了线性注意力混合结构、KV 状态不随序列长度增长——换成传统结构的模型,长上下文该爆还是爆。
三、账目翻面:显卡省下的钱,内存条加倍收回
"低门槛"的故事讲完,看看故事里的硬件现在卖多少钱。曾经的 AI 入门神卡 RTX 3060 12G 6月重新上架后一路疯涨,两个月涨了 45%,北美零售价已经到 500 美元上下;国内小黄鱼的二手平均成交价从 6月的约 1330 元涨到现在的 1750 元,涨幅 31.5%,已经比 3070 Ti 还贵。知乎
往上,甜点卡 RTX 5060 八月底一周内从 2500 元飙到 3000 元,涨幅超两成;顶端的 5090D 32GB 回到 34999 元的历史最高价——连"AI 训练卡"都在用消费级的名义卖理财。知乎
于是这轮涨价潮在本地 AI 阵营出现了一个游戏装机圈没见过的怪象:为了省显存买的 64G 内存,成了整机里最贵的一件。"小显存+大内存"路线的全部卖点建立在"内存比显存便宜"这个前提上,而这个前提在 2026 年被厂商产能分配(HBM 优先)掀翻了。买这套机器的下单顺序,和涨价潮里的游戏党正好相反。
四、四条路线:现在谁该装,谁该再等等
路线 A|16G Blackwell 单卡(5060 Ti 16G、5070 Ti 16G):本轮真正的主力。 能吃 NVFP4 硬件加速,FLUX 出图、27B 稠密量化、LTX 视频生成三条线全通,96K 上下文不用看内存条脸色。而且 8 月下旬连单槽涡轮版 RTX 5060 都上架了,商家直接点名"多卡部署"是适用场景——信号很清楚:AI 主机正在从"堆一张大卡"变成"插几张 16G"。知乎适合:稳定出图的 AI 短剧/绘图产能用户、要长上下文写代码的 agent 玩家。
路线 B|12G + 64G MoE 卸载机:理论最便宜,实际最看内存脸色。 门槛数据都在上面,但整机账单里内存占大头、prefill 延迟归你。只适合对首字延迟不敏感、每天处理长文档的单人场景,而且要有"7538 元的套条随时可能继续波动"的心理准备。
路线 C|24G+ 二手(3090/4090 系):体验最顺,占用现金最多。 94GB 权重文件塞进 24GB 显存还有 40 token/s,这是不用 50 系预算的最舒服方案。但二手价也在涨,回收端的热度说明卖方市场没结束,魔改 22G、拆机涡轮卡一律没有官方保修——涨价潮里卖卡的人,多数不是用不着,是觉得还能再涨。
路线 D|先别装,算算你配不配拥有一台。 判断线就两条:数据敏不敏感(医疗、法务、内部文档)、每月 token 账单到没到硬件回本的量级。小红书 8月30日那条被转疯的帖给了一个正面样本:南昌有人为跑 MiniMax H3 专门用旧型号攒了台不到 2 万的 AI 短剧工作站,剪枝 INT8 版实测能跑完 15 秒视频,缺点也坦承——型号旧、风扇吵。小红书注意前提:他是拿这台机器挣钱的。如果只是好奇,这轮硬件涨价+模型半年一迭代的组合下,订阅和租赁的性价比完胜,别跟周期对赌。
五、三个坑,踩一个省下的钱就全吐回去
第一,A 卡不在这道题的计分板上。9070 XT 券后 5330 元再香,那是游戏的账;NVFP4 硬件加速只给 Blackwell,llama.cpp、ComfyUI、各类量化工具链全部 CUDA 优先,RDNA 在这条路线上没有折扣位。30/40 系老卡同理——能拿到软件层面的格式支持,但没有 Tensor Core 的 4-bit 加速,收益小得多,老卡过渡是妥协不是解法。知乎
第二,带 NPU 的"AI 主机"不等于本地大模型机器。迷你主机货架上挂 AI 标签的产品越来越多,但 NPU 的 TOPS 数字和"能跑多大模型"是两套语言。做推理,只看三件事:独显显存、CUDA、内存带宽。
第三,老平台续命有隐藏到期日:英伟达已确认今年 11 月份停止对 Windows 10 的驱动支持,拿压箱底旧平台凑 AI 机的,先把系统升级排进计划,不然 11 月后驱动更新直接断供。知乎
六、等等党该盯的四个信号
64GB DDR5 套条的落地价。回到 5000 元以内,路线 B 的账才重新算得平;这是唯一能救"小显存大内存"路线的变量。
魔搭/HuggingFace 上 NVFP4 预量化权重的数量,以及 ComfyUI 原生节点的支持进度。这决定 16G 路线"能跑"变成"好用"还要几周。
二手 3060 12G 与 3090 的成交价。这两个价是全市场 AI 显卡热度的温度计,3060 这种"没人要的卡"都能涨 31.5%,说明买 AI 算力的还在进场。
模型侧对 prefill 的优化(降 PCIe 流量方向)有没有新论文落地。技术上一旦成熟,低显存大内存路线从"可用"变"好用",届时 12G 卡会迎来它本轮周期真正的价值——当然,现在囤卡等这个,又是在跟涨价周期对赌。
最后把这篇的账压成一句话:8月末这波驱动和量化的更新,确实把"本地跑大模型"从旗舰卡特权拉到了 16G 甚至 12G 档;但同一轮 AI 涨价又把"便宜的入场"从几百块拉进了万元档。门槛降的是技术门槛,没降的是钱包门槛——先确定每天真的拿它干活,再谈买哪张卡,这个顺序在 2026 年下半年,比任何时候都值钱。