这两周的B站本地AI区被一个开源项目刷屏:8月下旬起相关视频不下十个,播放最高的一条——单卡5090部署满血DeepSeek V4 Flash——半个月2.1万播放,卖点都是同一句:以前想都不敢想的大模型,你现在这张卡能跑了。哔哩哔哩
同一时间,21世纪经济报道9月2日的《“本地模型”,下一个风口?》三天内在知乎挂出三个追问;而群里置顶的老话——“8G跑8B、12G跑14B、24G跑32B”——第一次被贴了反例:论文里,8GB显存跑的是35B。arXiv
论文、GitHub、评论区实测和反方声音摆到一起,这篇是一份重算后的账。
FreeToken干的事:不是把模型缩小,是把"跑得动"改了定义
先看核心样本:Qwen3.6-35B-A3B。按命名规则,35B是总参数,A3B意味着每个token只激活约3B。"能不能跑看显存"这条老规则,对稠密模型一直成立,因为每个token都要把全部权重过一遍;但MoE不同——每步真正用得到的权重只占一小撮,用到的是哪一撮,取决于路由结果,而你事先不知道。
9月5日B站一条技术拆解视频把论文(arXiv:2608.16157,作者名单里有Keutzer、Zaharia、Stoica这些名字)的方案拆成五块,思路其实很朴素:
磁盘→系统内存→显存,三级存储:权重平时躺在内存里,不占显存;
全局LRU专家槽位池:最近被点到的专家进显存,冷专家请出去;
PCIe搬运与CPU计算按带宽并行,缺页才付等待的代价;
Prefill/Decode分策略,吃算力和吃带宽的两段分开调度;
和llama.cpp式静态卸载的本质区别:静态卸载是"把几层永久挪去CPU",FreeToken是"专家按需进出显存"。
一句话总结:它没有把35B塞进8GB显存,它把"跑得动"从"装得下"改成了"下一跳的专家提前就位"。GitHub论文演示:RTX 4060 Laptop(8GB)跑Qwen3.6-35B-A3B,39.3 tok/s。哔哩哔哩

多来源对完账,数字能看进什么区间
论文和评测视频天然报最好的情况。我把论文摘要、几条视频评论区和其他实测归了一下:
系统侧:官方README里,支持模型是DeepSeek-V4-Flash、Qwen3.6-35B-A3B、GLM-5.2这一批MoE,Apache 2.0开源,`pip install freetoken`就能用,还带OpenAI/Anthropic兼容API,明确给Codex、Claude Code这类编程Agent接;
上限侧:微博博主复述论文——5090台式机以22~25 tok/s跑284B的DeepSeek-V4-Flash,单张RTX PRO 6000能跑753B的GLM-5.2(约15 tok/s),用的还是官方非量化权重;另一条帖子则总结"相比Ollama,decode快3~4倍、预处理快6~30倍",转述数字,听听就好,别当基准文案;
落地侧:拆解视频底下有人直接报数"正常也能跑30",还说Prefill大约是llama.cpp的两倍、有桌面端、参数能实时调整不用重启;实装案例里有RTX 3060-12G + 32G内存跑gpt-oss-20b、接Open-WebUI的;
话术侧:5090教程标题的"Opus 4.8级"是宣传语;4GB显存跑27B的教程没见公开速度,按存在性证明看待。
多来源对下来,稳的区间是:8~12GB卡跑35B级MoE,短上下文decode在30~40 tok/s;往上,单张5090级确实能把两三百B的MoE推进"能交互"的门槛。微博30~40 tok/s超过人眼阅读速度,接近云端产品的流式体感——"能用"这条线,小显存卡是真迈过去了。哔哩哔哩

但三道坎,官方方案也没全填平
第一,KV cache不给豁免。专家权重可以按需进出,但每轮对话的KV cache跟着序列长度一起涨,且必须有个家。拆解视频评论区那句"数据规模跟序列长度一起涨,内存就不够用"说的就是这个。官方配了两个补丁:语义锚点checkpoint(工具调用改动时免整段重算)、运行时在专家缓存和KV之间重分显存——省重算、腾地方,但不是推翻物理。
第二,PCIe比显存带宽低一个数量级。显存内部是几百GB/s的量级,消费级PCIe 4.0 x16有效带宽不到30GB/s,笔记本x8还要再砍一半。专家路由集中时命中率高,你感觉不到这条链路存在;一旦碰上高熵时刻,缺页走PCIe,速度立刻见真章——论文标题里的"带宽自适应",就是在跟这道坎讨价还价。39.3 tok/s是命中率红利,不是人人日常。
第三,系统内存成了新显存。有人算过:5090跑284B除32G显存还要配192GB内存,“需要DDR5,否则跑不出来”。还在用16G内存的,动手先看内存价格——9月6日显卡日报里连2TB固态都刷了历史最高。知乎“先看显存"改成"显存、内存、PCIe三条一起看”。
所以修完后的规则不是"8G跑35B",而是:8G能跑35B级MoE,代价是短上下文、单并发、以聊天和轻任务为主。稠密模型这边老账一分没变:Qwen3.8-27B的Q4量化文件17.1GB,16G卡"勉强"、24G才"舒服",这是9月4日知乎选型帖的原话。长文本、并行批处理、重Prefill负载,依然指向大显存。
谁该现在就动手,谁该把钱按住
8~12G N卡(30/40/50系) + 32G以上内存:不用换卡,装一个玩一周。8月那篇避坑帖的话我觉得对:“先买设备再培养习惯,是99%小白浪费钱的开始”——现在软件把试用成本压到接近零,先跑通再谈别的。GitHub
要拿27B级别干正事、跑长上下文和Agent批活的:24G仍是硬通货。但5070Ti报价8999又创历史新高(9月6日显卡日报),按显存收钱的行情追顶明显不划算——要么等,要么把二手24G老卡认真放进备选。知乎
只是偶尔用用云端聊天的:风口是你的话题,不是你的钱包。知乎反方观点目前没有被推翻:非敏感、非高频、非定制化,本地"备胎"的账依然不划算。而且免费的云也在卷:AMD上周在Radeon Cloud上线Token Factory,DeepSeek-V4-Flash等免费、免绑卡——只想要token的人,本地方案的价值进一步收缩到隐私、离线、可控三样。小红书
顺带一个产品信号:已经有办公套件在应用内加了"本地模型"入口,一键下载Qwen3.6-35B(WorkBuddy 9月3日的5.5.2版)。等工具链把这套东西消化成默认能力,参数你就不用自己调了——这才是"风口"落到普通人身上的真实方式。知乎

接下来盯三个信号
生态吸收:llama.cpp/Ollama这类主流引擎跟进动态专家缓存了吗?跟进了,8G跑35B就成默认体验;FreeToken致谢名单里正是SGLang、vLLM、llama.cpp,反哺路径不会太远;
硬件走向:NVIDIA消费卡"砍带宽换显存"的传闻(5060 12G、9GB版本)传了几个月还没落地,它出不出、出什么价,决定小显存档位的天花板归软件还是归硬件;
行情:显存和内存价格这条链没松动前,"用软件省卡钱"就一直有受众;一旦往下走,方案红利立刻减半。
"风口"翻译到你的机箱里就一句:你的卡现在能跑大于它规格书的模型,前提是你在序列长度、并发和内存上让步。手里有8G卡的,这个9月最划算的姿势不是等新卡,是先让老卡跑一次35B——跑得动,你省下一轮换卡钱;跑不动,你也第一次真正知道差的是哪一环,下次花钱会清醒很多。