这两天刷装机区的人应该都有体感:显卡和内存,一起涨麻了。微博上 #内存条涨价比金条还快# 的话题底下,装机场直接开骂——一根32G内存,全网找不到低于1000块的。 评论区更狠,有人直接把矛头对准三星、SK海力士、美光三大厂商,说这轮就是联合控价"抢钱"。但最痛的其实不是普通装机党,是想给本地大模型配机器的人——因为这轮涨价,恰好砸在了本地部署玩家最依赖的一条省钱路线上。微博
一、先看这波涨得有多离谱
单说"涨价"没感觉,直接上数字:
64GB DDR5 套条,去年这个时候约1287元,今年八月约7538元,涨了将近6倍。知乎
显卡端同样没跑:RTX 5080 从首发8299元涨到渠道批发11700~13700元,涨超40%。 16GB以上显存的型号2026年普涨15%到20%,供应还削减了20%。小红书
RTX PRO 6000,有B站网友自述5月6万入手,一个半月后涨到10万,评论区还有人感叹"现在2080ti魔改都3000了"。哔哩哔哩
5090在国内的阉割版,小红书用户的原话是"溢价太多,阉割版基本都是3.5万起",还没算主机和周边。小红书
为什么会这样?微博上有科技博主的视频标题说得很直白:《手机电脑涨价,全是AI害的?》——AI对HBM和先进制程产能的挤占,把消费级内存和显卡的价格一起带飞了。微博
二、涨价打断的那条路,恰恰是本地玩家的"穷人方案"
过去一年,本地大模型圈最主流的省钱思路叫"小显存+大内存":显卡只买12G~16G的,靠MoE架构的特性把模型里不活跃的专家权重扔进内存跑,显存装不下的部分用内存兜底。
这套方案的逻辑基础只有一句话:内存比显存便宜得多。 这句话在2026年不成立了。64G内存条从1287元涨到7538元之后,你买小显卡省下来的钱,现在全在内存条上加倍还了回去。有网友算过一笔账:12G显存跑35B模型是真的能跑,“问题是这台机器的内存条现在比显卡还贵”。知乎
三、技术上也得泼盆冷水:这条路本来就是"半条路"
就算不考虑涨价,"小显存+大内存"也远没有短视频里吹的那么神。知乎上有一篇技术拆解写得很透,我把它压缩成人话:
decode(吐字阶段)确实不掉速。 有人实测12G显存+64G内存跑Qwen3.6-35B-A3B的NVFP4版本,32K上下文平均75 tok/s,200K长上下文还有40 tok/s左右,数据不假。 原因是MoE每生成一个token只需要把被路由选中的几个专家搬过PCIe,每次几百MB;而稠密模型每层都得把整块权重过一遍,同样的3060 12G,稠密Qwen3-14B卸一半层到内存,速度直接从35.9 tok/s掉到5.7。知乎
但prefill(首字之前的预填充)会被打死。 以DeepSeek-V4-Flash为例,一次预填充要经PCIe流过约140GB专家权重,PCIe 4.0 x16要多花5秒,x8链路10秒起步。 日常聊天感知不强,可一旦跑Agent——每轮工具调用都要重跑一次prefill——那几秒几秒的卡顿会累计到让人崩溃。知乎
结论就是:这条路适合一个人慢慢聊,不适合干活、不适合并发、不适合Agent。 模型侧确实在进步(线性注意力、KV压缩都立了功),但"显存门槛降了"只降在单用户解码这一段。
四、那现在怎么办?不买新卡的人有三条活路
涨价把买新卡的路堵贵了,反而把存量硬件的价值抬起来了。这周最值得看的其实是这几个方向:
1. 老数据中心卡正在"复活"。 8张V100、256GB显存,用1Cat-vLLM加DFlash2跑GLM-5.3-Flash的NVFP4量化版——320B总参、18B激活——低接受率场景约82 tok/s,代码场景最高145 tok/s。 V100这种很多人眼里的"电子垃圾"都能跑新一代320B模型,存量GPU的价值正在被重新计算。手里有旧卡的,先别急着出。哔哩哔哩
2. 24G卡和魔改卡还能再战。 有UP主在3090上做混合量化,同时跑27B大模型、256K长上下文加TTS,还能剩下4G显存。 魔改2080 Ti 22G跑35B的Q4_K_M,48K上下文稳定43~45 tok/s,KV cache量化到4-bit后还能扩到128K。 另外Qwen3.8-27B的GSQ RCO量化版,被测出来是"16G显卡最佳选择",千元级老卡用户直接受益。哔哩哔哩知乎哔哩哔哩
3. 二手大内存Mac,但要看清门槛。 小红书有位玩家花了3万多,最后留下的是一台二手M3 Max 128GB:跑Qwen3.8 Flash-Next稳定38~40 tok/s,属于"可以正常工作"的范围。 而M2 Max 96GB连Flash-Next都加载不了。他的结论很实在:选机器别看芯片新不新,内存能不能装下模型、实际多少tok/s,才是最重要的。当然B站评论区也有反对派,原话是"Mac没啥好折腾的,铺天盖地的水文搞得大家以为Mac真能跑AI"。 两边吵的其实是同一件事——统一内存带宽就是不如显存带宽,装得下和跑得快是两码事。小红书哔哩哔哩
五、也别说"token自由"了,先对号入座
知乎上那个浏览量破百万的问题——《很多人认为本地部署一个大模型,就实现token自由,就可以干活了,真的吗?》——高赞回答的冷水泼得很有参考价值:4090加192G内存,跑DeepSeek V4 Flash的Q8混合量化,只有10 tok/s。 更早的高赞说得更直接——“本地模型仅限于玩和极简任务处理,不建议作为生产力工具”。 而且编程要舒服得50 t/s起步,150G左右的权重文件一加载,这台机器基本就被绑死了,干不了别的。知乎知乎
所以对号入座一下:
手里有24G级显卡的:别动,量化生态这几个月更新飞快,你的卡正处在"越等越好用"的区间;
手里有旧数据中心卡的:更别急着出,NVFP4这类新量化格式的适配才刚开始,V100的故事可能轮到你的卡;
正打算顶着涨价买新卡的:建议看三个信号再动手——内存价格有没有拐头、消费级新架构落地到什么程度、你目标模型的量化版适配进度。统一内存+独显异构加速这条路线,B站已经有人开源了heterogeneous-gpu-pd-lab项目。哔哩哔哩
真要拿AI干活的:直接买API。涨价后的API价格,依然比你为了"token自由"专门攒一套硬件便宜得多,还不用你掏电费。
写在最后
这轮涨价最大的启示,其实是把本地大模型玩家的决策门槛拉简单了:现在这个时间点,"为跑模型专门买新硬件"几乎是所有选项里最差的一个。 要么把手里的存量卡榨干,要么等架构和量化生态再走一步,要么老老实实API+本地小模型混合着用。
内存和显卡的价格总有回头的一天,但"大内存比大显存便宜"这个曾经的天经地义,短期内是回不来了。
互动一提:你现在手里的卡,跑Qwen3.8-27B能到多少token?评论区报个型号+速度,给后面的人当参考。