这几天刷本地部署相关社区的人,大概率都被同一条消息砸过:8G显存跑35B大模型,40 token/s,“本地部署的逻辑被颠覆了”。哔哩哔哩有的短视频还给它安了个"上海交大和加州大学联合开源"的出身,播放、收藏涨得飞快。
手里拿着8G、12G显卡的人,第一反应大概都一样:我的卡是不是不用淘汰了?还是说,这又是一轮标题党?
我把这周知乎、B站、项目仓库里的原帖、实测数据和评论区都翻了一遍,结论可以先给你:"颠覆"是真的,但它颠覆的东西、以及它的代价,跟疯传的版本不太一样。
先搞懂这周发生了什么:“专家坐诊”
先说背景。现在新出的大模型,越来越偏向MoE(混合专家)架构:参数总量很大,但每次生成只激活其中一小部分"专家"。比如疯传视频里那个35B模型,总参数35B,每次实际只激活约3B。
问题出在加载方式上。传统跑法是把所有专家的权重全部塞进显存待命——因为推理引擎不知道下一个token会激活哪个专家。于是出现一个很反直觉的现象:一个11.5GB的模型文件,全量加载却要吃掉23GB以上的显存。8G、12G的卡连门都进不去。
这周火起来的思路,说白了就是一句话:专家不用全部在岗,用到的时候再"请"进显存,不用的留在内存里待命,高频专家常驻缓存。 显存只装当前激活的那几个专家,门槛一下子就塌下来了——同一个模型,显存占用从23.3GB压到6.7~10.1GB,极端配置甚至能压到2GB以内。知乎知乎

这不是PPT。两条线都已经能用了:
llama.cpp主线:8月27日合入了对新MoE模型的支持,用`-ncmoe`参数就能把前N层的MoE专家权重放到CPU内存侧。有人用24G显存+128G内存,把一个94GB的MoE模型跑到了40 token/s。知乎
开源项目moe-l2:一个人维护的项目,7月底上线,一个月迭代了13个版本,8月27日刚把Windows(WSL2)环境验证通:RTX 3060 12G跑35B MoE,实测15.5 token/s,显存只占5.7GB。知乎项目在GitHub开源,刚过80 Star。

所以"小显存跑大MoE"这件事,技术路线是真实存在的,而且从极客玩具走到了"照着教程能装"的阶段。
但疯传的数字,有三处对不上
热度起来之后,数字就开始变形。我对着原始帖子核了一遍,至少三个地方要打个问号。
第一,出身存疑。 那条最火的短视频,把这事说成"上海交大和加州大学联合开源"。哔哩哔哩我翻遍了知乎、B站和项目仓库,找不到任何能对上号的成果——真正在跑的开源项目,作者是一位个人开发者。这条视频本身也标注了AI生成。不是说技术是假的,而是"名校联合开源"这个光环,目前没有出处。
第二,同一个作者的标题和正文打架。 3060实测那篇,标题写的是"20 t/s",正文实测是15.5 t/s。知乎差20%不是小事——对一张想"养老再利用"的老卡来说,这就是"勉强能用"和"挺流畅"的区别。
第三,“能加载"不等于"能用”。 项目作者自己都专门提醒:157B的DeepSeek-V4-Flash,用这套方案8.3~9.1G显存就能加载起来,但速度数据至今是N/A——上游还有一个架构bug没修。知乎157B这种体量,"装得下"只是第一步,别把加载成功当成可以干活。
B站评论区其实已经有人把话说明白了:试过的直说没那么巨大的提升,有人问这跟llama.cpp把专家卸载到CPU上有什么区别,回答是没啥区别,本质是懒人一键优化专家调度。哔哩哔哩这项技术的含金量在于"把门槛打下来",而不是"免费送你40 token/s"。
没人告诉你的账单:门票从显存换成了内存
这才是我想重点说的部分。显存门槛塌了,不代表免费入场——成本只是从显卡插槽搬到了内存插槽。
专家不进显存,就得待在内存里。35B的模型,专家池常驻要十几GB内存;想跑157B级别,全量锁页内存最高要吃84GB(优化后也要17~24GB)。知乎那条24G显存跑94GB模型的配置,后面跟着的是128GB内存。知乎

而今年的内存市场是什么行情,装过机的人都懂——价格一路涨,评论区已经有人在发愁内存太贵:自己还是2×16,早想换两个32但一直没钱,担心这套玩法一出来内存还要继续涨。哔哩哔哩有知乎答主说得损但准确:MoE正在把大家的硬件焦虑,从显卡插槽一路扩散到内存插槽。知乎
除了内存,还有三笔隐性账:
老平台会被带宽卡死。 有人用双路E5-2680v4+双V100+DDR4 64G跑80B MoE,只有5~6 t/s,还不如LM Studio的10 t/s。知乎专家从内存往显存搬,走的是PCIe和内存带宽,老平台的"洋垃圾"配置在这里占不到便宜。
A卡暂时不在席上。 moe-l2目前只支持N卡(GTX 1080到RTX 50系),AMD用户在评论区留下的那句"可惜我是a卡",暂时还是无解的。哔哩哔哩
小显存要配重量级量化。 8~12G卡跑35B,用的基本是IQ2_M这类2bit级量化——能跑、能聊,但别拿它和云端满血版比智力。知乎另外Qwen系模型默认开思考模式,会把输出额度吃光,部署时记得手动关掉。
按卡对号入座:你是哪一档
把散落在各篇实测里的数据拼起来,大致是这样一个分布(以35B级MoE、Qwen3.6-35B-A3B为参照):
4~6G显存:能跑,别指望快。专家命中率只有40%上下,六成专家要从内存现搬。知乎定位是"验证可行性",不是日常使用。
8G显存:入场档。5~10 t/s上下,聊天够用,长上下文(32K以上)会明显降速。
12G显存:实用档。3060实测15.5 t/s,日常对话、轻量代码已经像样。
16G显存:甜点档。社区报告llama.cpp原生方案能到40 t/s,这个水平已经接近"本地token自由"。哔哩哔哩
2080Ti/24G档:28~35 t/s,但注意——慢卡上把专家表开得再大也不提速,瓶颈在算力,别折腾参数了。
一个反直觉的结论:这套方案的最大受益者不是最穷的4G卡,而是12~16G这个中间档——它们的显存刚好装不下35B全量,又恰好够装"激活专家+路由表",速度损失最小。
落到行动上,三条路:
路线A(推荐多数人):llama.cpp原生方案。 主线已支持`-ncmoe`,新模型适配最快(8月27日刚合入新MoE模型支持),不用依赖第三方小项目。知乎适合已经在用llama.cpp/LM Studio/Ollama的人。
路线B:moe-l2。 优势是档位自动适配(读你的显存自动选专家表)、带环境自检和一键安装,对不想调参的人友好。代价:项目只有80 Star、一个人维护,Linux为主,Windows得走WSL2,而且只支持N卡。适合手里正好是10~12G N卡、愿意折腾半小时的人。
路线C:先别动。 如果你是A卡、或者内存还停在16GB、或者指望8G显存跑出云端旗舰的效果——这三类现在入场,体验大概率配不上期待。等两个信号再说:原生Windows版落地、内存价格松动。
接下来值得盯的三个信号
moe-l2的Windows原生版和Flash-Next适配。作者已经排期,落地后8G N卡玩家的门槛会再降一截。
llama.cpp上游修完DeepSeek4架构的bug。到时候157B在10G以下显存的真实速度才有数。
内存价格。这套方案的性价比公式里,内存是越来越大的变量——如果内存继续涨,"显存换内存"的账就要重算。
最后说句实在话:这波"专家坐诊"真正的意义,不是让你用8G卡跑出4090的体验,而是把"模型大小≤显存大小"这条铁律撕开了一个口子。本地部署的入场规则,正在从"看显卡"变成"看显卡+内存的组合"。手里的老卡先别急着挂闲鱼,但也别急着为了一条短视频加钱——对着上面的档位表看看自己是哪一档,再决定动不动。
你的显卡是几G的?现在跑什么模型、多少速度?评论区报个数,给后面的人当个参照。