这两天,关注本地大模型的人,大概都被同一个名字刷屏了:FreeToken。
“伯克利+MIT团队开源的新推理引擎”“8GB显存的笔记本跑35B,39 tok/s”“一张5090跑280B级的DeepSeek-V4-Flash,22-25 tok/s”,甚至还有"一张工作站卡跑753B"——每一条都踩在本地部署用户的痛点上。开源不到48小时,全网讨论量直接爆了。
但先别急着下载安装。三个问题问清楚之前,这引擎是"你的升级票"还是"别人的玩具",真不好说。
问题一:你的模型受益吗?它只认MoE
这是最容易被忽略的一点:FreeToken是专为MoE(混合专家)模型设计的推理引擎。
原理不复杂:MoE模型有海量"专家"参数,但每个token只激活其中一小部分。FreeToken的做法是不把整个模型塞进显存,而是按你机器的带宽,把专家在显存、内存和CPU之间动态调度,常用的专家缓存在显存里——论文解读频道的数据是,专家缓存未命中率从62%降到了16%。哔哩哔哩

所以它官方演示里列的模型,清一色是MoE:Qwen3.6-35B-A3B、DeepSeek-V4-Flash、GLM-5.2。微博
而这周大家装机主力的Qwen3.8-27B,是稠密的Dense模型,每个参数都参与计算,FreeToken的这套调度对它没有意义。如果你的主力模型就是27B,这波热度基本与你无关,主力工具还是llama.cpp、Ollama、LM Studio那一套。
问题二:那些炸裂的数字,是真的吗?
全网传得最广的三个数字,我把出处捋了一遍:
Qwen3.6-35B,8GB显存的RTX 4060笔记本,39.3 tok/s:来自项目方演示和论文解读频道。小红书
DeepSeek-V4-Flash(约280B级,各渠道口径284B/288B略有出入),RTX 5090,22-25 tok/s:同一批口径。哔哩哔哩
GLM-5.2(753B),RTX PRO 6000工作站,15 tok/s:来自微博上流传的项目发布帖。微博

至于"比llama.cpp快1.46倍"“同基准下最高比Ollama快3倍”,也是出自同一批传播物料。小红书问题在于:目前没看到大规模的独立复现。有博主专门做视频指出,论文正文主要证明的是"能跑起来",速度对比数据披露得并不完整,自媒体转述的tok/s数字不能直接当实锤。哔哩哔哩这个引擎从发布到刷屏不到48小时,国内不同硬件上的复现样本还非常少。
我的判断:这些数字可以当作"项目方口径的上限参考",值得期待,但不够当你重新配机器的依据。真想验证,装完之后用自己的模型、自己的提示词实测,跑出来的才是你的。
问题三:显存的账省了,内存的账去哪了?
FreeToken不是压缩魔法。280B的模型不会缩小到塞进8GB显存,它只是把大部分专家从显存挪进了系统内存。
所以微博上那条一句话的帖子才扎眼:“FreeToken还是需要大内存支持……”。微博按4bit量化粗算:跑280B级MoE,系统内存要备到150GB量级;753B的GLM-5.2,得奔着400GB量级去——那是工作站级别的大内存机器。叠加今年内存的涨价行情,这笔硬件账单并不轻。
它治好的是"显存焦虑",转移来的是"内存焦虑",总账未必更便宜,只是换了个付法。
另外还有两道硬门槛:按评测频道的口径,FreeToken目前支持NVIDIA CUDA和Linux,不支持Apple Silicon,也没见Windows支持。哔哩哔哩大多数人的游戏本是Windows系统,这一条就把"游戏本变AI工作站"这个口号的大部分受众挡在了门外。
对照一下,先别急着装的三类人
主力模型是Dense的(比如正在跑Qwen3.8-27B):不受益,不用换;
Windows、Mac用户:平台门槛没开,先观望;
内存不大(64GB以下)还想冲280B+的:内存账单先算清楚,别急着下载。
能上手尝鲜的画像很明确:Linux+N卡+本来就在跑MoE模型(Qwen3.6-35B-A3B、Ornith-1.5-35B-A3B、DeepSeek-V4-Flash这类)+内存充裕。这类用户可以当第一批吃螃蟹的人,重点测两件事:首字延迟和长会话稳定性——项目方口径最坏情况TTFT控制在44秒内,对比一些方案150秒级别的超时,这对Agent场景是实打实的增量。哔哩哔哩

顺带说:本周真正的"基建变化",其实是llama.cpp
大家都在看FreeToken的时候,llama.cpp悄悄完成了另一个里程碑:切换到语义化版本后的首个大版本v0.2.0。8月17日v0.1.0标签上线,llama.cpp告别了多年的"构建号"时代,以后锁版本、回滚、下游打包都有了清晰的锚点。知乎网上流传的v0.2.0"提速42%",目前还是视频作者打的问号,社区没有统一结论,先别当事实传。哔哩哔哩对跑Qwen3.8-27B的大多数人来说,我的建议是:可以更新,但更新前先记录一下当前速度;语义化版本的好处是,不满意能精确回滚到上一版——这才是这次版本改革给普通人最实在的红利。
往后看,论文解读频道还预测llama.cpp会吸收路由感知缓存这类思路——开源生态里"新引擎探路、主力项目吸收"的节奏,对本地部署用户才是最划算的。哔哩哔哩
最后留三个值得盯的信号:FreeToken的Windows、Apple Silicon支持进度;280B级速度的第三方复现数据;llama.cpp v0.2.0之后的动作。哪条先动,哪条才值得你动手。