10月7日,B站一位UP主发了一条只有90秒的实测视频。他手里这台机器:i7-14700KF、32G内存、RTX 4070 Ti SUPER 16G显存,NVMe顺序读2900MB/s。他要跑的模型,是Qwen3.8-Flash那条125B参数、24576个专家、每个token只激活10个的MoE大模型。
模型确实跑起来了,但不同机器上的数字差得夸张:官方参考机(64G内存)能跑79 tok/s,他这台32G内存的机器实测六次,最快65.8,最慢只有11.7。原因那位UP主自己讲得很直白——这个模型光专家权重就有35.5G,64G内存的机器能全塞进去,32G塞不下,每吐一个token都要现从硬盘里搬。哔哩哔哩
这条视频底下,其实藏着2026年秋天AI攒机圈正在发生的两场地震:显存的门槛被MoE卸载框架砍掉了一截;而补门槛用的"内存",恰好撞上这轮内存大涨价。两个变量叠在一起,"本地跑大模型值不值得攒一台"这道老题,答案得重算。
一、过去半年的共识正在过期:显存不再是唯一门票
今年8月更新的那篇知乎热文给了一个被广泛转发的口径:本地跑大模型,显存是最核心配置,其他硬件都是配角——9B量化版8G显存能跑但勉强,16G才舒服,27B要24GB显存起步。知乎
这个口径放在llama.cpp扛dense模型的时代是对的。但9月底到10月上旬,社区用一串实测把它捅穿了。小红书9月28日那条笔记把结果摆得很直接:新项目Strata,4060 Ti 16G显卡配64G内存,跑125B的Qwen3.8-Flash-Next IQ3_XXS量化,还能跑出30 tok/s。往前还有两路。一路是NInfer:4060Ti-16G挂载Bonsai2-27B的部署方案,实测给出2倍提速。另一路是kvmem项目,主打的就是16G显存下的上下文大突破。小红书哔哩哔哩哔哩哔哩
Strata框架走得更远——把MoE的专家层按冷热分层,热专家进显存、冷专家留在内存和NVMe里。10月11日刚发的另一条实测更狠:一张2019年的魔改22G显存2080 Ti,靠三层专家卸载把84G权重的125B模型塞进22G显存,跑出了48-60 tok/s。知乎有人把社区做法总结成了一句话:3090/4090/5090这些卡显存都装不下大MoE(哪怕4bit也要90GB+),专家层靠`–n-cpu-moe`往内存/CPU卸,已经在好几种硬件上被验证是标准做法。哔哩哔哩知乎
换句话说,决定你"能不能跑"的,从单一显存容量,变成了"显存+内存+NVMe读取带宽"这条三级缓存链。显存管热数据,内存成了第二显存,NVMe成了第三显存。这就是为什么那台32G内存的机器会掉到11.7 tok/s:框架没骗人,是内存容量不够,卸载链路直接卡死。64G是125B级模型的门槛,不是建议值。
二、坏消息:第二显存,正是这轮涨价的靶心
门槛降到"16G显存老卡+64G内存",对攒机党本来是天大的好消息——16G显存的卡遍地都是,内存便宜大碗,凑一凑就有了。
问题是内存的价格表。大象新闻今年3月的报道里,消费者2025年5月花2499元买的64G内存条,涨到了8999元。微博博主"宅数码Kael"翻自己的京东订单更直观:2023年618两根32G的DDR5 6400一共64G,才1885元,现在同款显示8552元。10月10日甚至还有人转发澳门海关查获走私显卡的新闻:RTX 5090、内存条这些"硬通货",成了走私分子眼里的香饽饽——供货紧到什么程度,自己品。大象新闻微博
把"每GB可用推理记忆"的单价摊开,这个秋天的行情大致是这样(样本口径各不相同,来源和日期标清楚):
路线 | 样本价 | 折算每GB | 备注 |
|---|---|---|---|
二手4060 Ti 16G | 两张报9000元(知乎个人报价样本,10/8) | ~280元/GB显存 | 跑27B量化级的实际门票 |
全新RTX 5080 16G | 9750元(10/10全新行情低价) | ~610元/GB显存 | 当日低价:RX7600 1459元、RTX5050 2279元、RTX5060 2544元、RX9060XT 2629元 |
全新RTX 5090 32G | 电商价突破7000美元(10/10爆料) | ~1500元/GB | 外加10/10"被曝停产"传闻 |
DDR5 64G(2023年618低点) | 1885元 | ~29元/GB内存 | 卸载链路用,对比锚点 |
DDR5 64G(2026年4月同款) | 8552元 | ~133元/GB内存 | 涨后价格 |
其中二手4060 Ti 16G那条,出自知乎10月8日的一条个人回答:想研究大模型就"2张4060ti16G多多买二手,9000"。5080那条线,出自一个每日更新的全新现货统计:10月10日榜单里RTX 5080低价9750元。5090那条则来自电商价格爆料:在电商平台,5090的价格已经突破7000刀,比二手车还要贵。知乎哔哩哔哩微博
内存单价仍然远低于显存单价——这就是卸载流派成立的根本原因,模型厂商和框架作者都没法反驳的算术。但对每个具体的人来说,"补内存"这件事的绝对成本,比2023年贵了好几倍。你以为避开了显卡涨价,其实换了个口袋被内存涨价抓。
三、四条路线实测数据摆在一起,各有各的坑
把10月以来跨平台的实测视频和回答拉到同一张桌子上,AI本地部署的选择其实就四条路,外加"不攒"这一条。
A. 单卡16G派:4060 Ti / 4070 Ti SUPER / 5080,配NInfer、kvmem这类框架,日常停在27B量化级最稳。把125B硬塞进16G显存的路子不是不能走——"四月的尾巴"翻译的那条4060Ti实测,标题就是原话:125B大模型塞进16GB显卡能干活吗?快,但聪明吗?塞得下和干得动,是两回事。哔哩哔哩
B. 大内存卸载派:这才是现在的主流正解——16G显存老卡+64G内存起步、128G从容。而且这条路最反常识的结论是:别急着插卡。手里有4张3090(合计96G显存)的UP主"调音AI大黄",第一版llama.cpp四卡切层方案decode只有约6.5 tok/s,最后实测下来最快的日常方案反而只用一张3090加CPU卸载:32K上下文107 tok/s、64K 95.3。这跟游戏攒机"预算不够先买一张以后加"的思路完全相反:多卡张量并行的通信开销会吃掉堆卡红利,大MoE推理是单卡+大内存的天下。有人算过更极端的账:两张5090合计64GB,连32B BF16的权重(约65.5GB)都过不了装载这一关——堆卡堆显存这条路,在旗舰上也撞墙。哔哩哔哩知乎
C. 二手垃圾佬派:魔改2080 Ti 22G前面提过,这里补两个量级。两张二手Tesla V100-32G(无NVLink)跑1760亿参数MoE的IQ3量化,机主自己把口径写得很老实:解码中位172 tok/s、峰值190.3,日常开思考实际体感约78~93 tok/s。再往上,有人用约5万块的二手服务器(双路8269CY+768G DDR4+8张3080 20G)跑748B的DeepSeek V4.1 Flash,13.8 tok/s。单价最狠、能跑最大,但噪音、功耗、无保、矿余,是给接受"周末修机"的人准备的。哔哩哔哩哔哩哔哩
D. Mac统一内存派:乞版Mac Mini M6的本地大模型测评10月9日在B站拿到3846播放、37条评论,讨论度不低。它的短板有真人给过数:从4090换成5080+M5 Max 128G组合的用户实测,m5max跑AI的decode速度只有4090/5080的一半左右,prefill更是只有三分之一到二分之一。它的卖点从来不是快,是安静、不用折腾、大统一内存真能装。能忍慢的选它,忍不了的别被"128G"三个字骗。哔哩哔哩知乎
E. 不攒:API和云租赁。这是必须摆在桌面上的反方——知乎10月2日一条冲到127万播放的回答,开头四个字"赛博做梦":你省下来的云端API调用费,最后是要从别的地方花出去的;设备钱、电费、折旧、修设备的时间都得算进TCO,而云端价格卷得很厉害,国内国外顶尖大厂都在往下压API价格,几块钱人民币就能买到上百万的高质量Token。知乎
同一条回答还提醒:真正做过本地知识库的人知道,决定系统好不好用的,往往只有百分之二十是大模型本身,剩下百分之八十都在数据清洗、切分、检索和重排上。最扎心的一句也在这儿:你花重金买回来的硬件,却是用一天旧一天,贬值的钱也得自己认。知乎
四、这波里,谁该现在下手,谁该再等等
把切片拆开,账其实不一样。
手里已经有16G显存卡+64G内存的:别犹豫,这是本轮最大的既得利益群体。门槛降到"装框架"的程度,NInfer、Strata、kvmem的一键包在B站评论区满天飞,先跑起来再说,你的AI攒机成本是零。
隐私/离线硬需求的:本地部署的理由从来不是省钱。知乎那条26万播放的"实验室为什么要本地部署"回答讲得明白:配置清单之前,先过一遍"为什么不用云端接口",真正站得住的理由就那么几条——数据不出门、不依赖网络、不受API涨价缩水停服的背刺。这类人该攒就攒,而且配机优先级和打游戏相反:先保内存64G,再谈显存。知乎
要新购64-128G内存才能上车的:这才是真正两难的人。显卡侧10月10日刚炸出新变量:外媒称英伟达将停产RTX 5090、GB202转供专业卡产品线,面向玩家准备推出RTX 5080 24GB作为替代。注意爆料人是X平台GPU博主、消息未获英伟达证实,但它至少说明一件事:"24G中端"这个档位可能有新选项。而内存侧,走私都出来了,供货没松动。建议API先用着,把"内存价格明显回跌"和"5080 24G落地"当成两个动手信号,满足一个再下单;也别按老经验死等——这轮周期里"等等党"在内存上翻车的先例已经够多了。微博
打算多卡并联的:看完4×3090那条6.5 vs 107的实测再下单。这条赛道的正确姿势是单卡大内存,不是插满。
最后给一个今晚就能做的动作:打开你这台老机,看三个数——内存有没有64G(32G就会卡在11.7 tok/s那种悬崖上)、NVMe顺序读能不能看(卸载链路里它是第三级缓存)、你对多少tok/s能忍(27B级量化在16G老卡上日常够用)。三个数看完,你属于上面哪一档,配置单自己就长出来了。
这轮AI攒机最反常识的地方就在这儿:它不是让你买更贵的显卡,而是逼你先看懂自己的内存条值多少钱。