这个周末,本地部署圈被三个字母刷屏了:FreeToken。
传得最凶的几个说法,一个比一个猛:“753B大模型装进一张工作站显卡”“8GB显存的4060笔记本,35B模型跑出39 tok/s”“284B的DeepSeek V4-Flash,5090台式机交互级流畅”。微博再叠加DeepSeek 8月17日最高涨5倍价的背景,不少人的朋友圈已经快进到"API难民找到新大陆"。知乎
但数字喊得越响,越要先问一句:这数字是从哪来的?今天把FreeToken一次说清——它是什么、数字可信度几分、以及你的电脑到底够不够格。
FreeToken到底是个什么东西
先交代事实。FreeToken是伯克利和MIT研究者开源的一个MoE推理引擎,论文挂在arXiv(编号2608.16157),作者名单里能看到Keutzer、Stoica、韩松这些熟面孔,代码走Apache 2.0协议,已经在GitHub开源。GitHub
它解决的问题很直白:传统本地推理是"显存装不下就别玩",而MoE(混合专家)模型推理时其实只激活一小部分"专家",大部分参数全程闲着。FreeToken就按带宽动态调度——闲着的专家权重老老实实待在内存里,只把这一轮要用的搬进显卡算,再配一个语义感知缓存,减少来回搬运。小红书

一句话:显存从"仓库"变成"工作台"。模型越大、闲置专家越多,这套逻辑的收益越大。
刷屏的数字,来源要先打个问号
这是目前争议最大的部分。
这两天传得最广的一组数字是:Qwen3.6-35B在8GB显存的RTX 4060笔记本上跑到39.3 tok/s;DeepSeek-V4-Flash(284B)在RTX 5090台式机上跑到22~25 tok/s;还有"一块RTX PRO 6000,14.9 tok/s跑753B的GLM-5.2"。微博

这些数字被多条微博和自媒体反复转述,出处大多指向项目作者的演示。但社区里一条较真的拆解视频指出了关键问题:论文本身只证明了"能跑起来",并没有披露速度和延迟数据——也就是说,不少自媒体标题里的tok/s,在论文里是找不到的。哔哩哔哩我没法替论文原文核实基准数据,但"多方转述同一组数字、却没人指得出一手页码",本身就是个提醒。所以本文提到的所有速度数字,一律按"社区转述"处理:可以当作演示环境的参考,别当成你掏钱的依据。
"能跑"和"好用"之间,隔着的不是一点半点。这个教训,本地部署圈这两年吃过不止一次。
三盆冷水:门槛没消失,只是搬了家
第一盆:显存门槛降了,内存门槛还在。
评论区已经有人把账算明白了:跑DeepSeek V4-Flash,显存加内存总量仍要170GB往上。哔哩哔哩微博也有人感慨"FreeToken还是需要大内存支持"。微博它不是把大模型变免费了,而是把硬件瓶颈从"显存容量"挪到了"内存容量+内存带宽"。如果你的机器内存只有16G、32G,这波热度基本与你无关。
第二盆:上下文是第二个隐形开销。
社区实测反馈里很扎心的一条:“实测上下文极小,实际用处不大”。哔哩哔哩内存被专家权重占了,留给长上下文KV缓存的空间自然就少。聊天问一句答一句没问题,想拿它干长文档、多轮Agent的活,现阶段还早。
第三盆:工具比想象中齐,但实测还缺位。
公平地说,FreeToken的工程化不算落后:有Windows/Linux桌面版GUI,pip一行装好,提供OpenAI/Anthropic兼容接口,能直接接Codex、Claude Code、OpenClaw这类编码Agent,RTX 30/40/50系都是原生支持。GitHub问题在于,目前能查到的速度数据都出自项目方演示,缺少第三方在不同机器上的独立复现——工具就位了,账还没被人反复验过。

方向是真的:显存为王这套逻辑,正在松动
冷水泼完,说句公道话。FreeToken真正的意义不在"今天就能跑753B",而在于它把一条被反复验证的方向又往前推了一步:MoE时代,本地部署的硬件逻辑正在改写。
也不是只有它一个。这两天社区还在传KTransformers的671B模型+百万上下文单机方案。更早之前,AirLLM用4GB显卡跑70B也上过热搜。知乎连llama.cpp官方都在做权重预取的PR——虽然社区实测这个PR在MoE上反而慢了47.8%,说明这条路不好走。知乎但大家押注的方向是一致的。
对消费决策的直接启示有两条:
一,别为了FreeToken急着买新显卡。它还没被独立实测验证,而且它针对的是MoE模型,跑稠密模型根本没收益。
二,也别急着囤内存。这轮内存行情不便宜,如果你的需求只是跑7B、8B小模型或者Qwen3.8-27B这类稠密模型,加内存等于白花钱。
三类人,三种动作
第一类,可以尝鲜:内存64G以上、显存一般,平时主力就是MoE模型(Qwen3.6-35B-A3B、DeepSeek V4-Flash这个级别)的用户。FreeToken官方支持清单里写的就是这几个模型,有动手能力可以上手,但别期待生产力级体验。
第二类,暂时无关:跑稠密模型的用户。Qwen3.8-27B是稠密27B,FreeToken的专家调度在它身上使不上劲。对你更有用的是现成的免费提速——llama.cpp这周刚出了0.2.0大版本,视频演示号称最高提速42%。哔哩哔哩另外Ollama也上了MTP支持,先把这些吃到嘴里,比换引擎实在。
第三类,别想了:内存在32G以下的。不管装什么引擎,284B这种级别都够不着。老老实实跑35B级小模型,或者继续用云。最近智谱们在排队送token,先把免费额度领了,这波涨价的亏能吃回来一点是一点。
接下来盯三个信号
与其今天冲热度,不如盯住这三件事:
官方或可信第三方能不能复现那组tok/s。有可复现的基准,才谈得上"性能翻倍"。
上下文支持能不能做大。这决定它是玩具还是工具。
llama.cpp、Ollama这些成熟工具会不会吸收这套思路。历史上,论文成果真正落到普通人手里,靠的基本都是这条最稳的路。
本地部署圈有条铁律:今天刷屏的新东西,半个月后大概率被现有工具吸收。机器不用急着换,钱包先按住,热闹看完再说。