这个周末,很多人的时间线大概都被同一个开源项目刷屏了——FreeToken。
消息确实炸:一台只有8GB显存的RTX 4060游戏本,能以39 tok/s跑Qwen3.6-35B模型;一张桌面RTX 5090,能以22-25 tok/s跑满血版DeepSeek-V4-Flash(284B);一张RTX PRO 6000,能把753B的GLM-5.2跑到15 tok/s。微博翻译一下:以前要数据中心一柜子显卡才能伺候的前沿大模型,现在一台你买得起的电脑就能跑起来。

而且这不是什么野路子画饼。项目来自加州大学伯克利分校和麻省理工的联合团队,论文已经挂上arXiv(编号2608.16157)。知乎代码以Apache 2.0协议完全开源,还配好了Windows和Linux的图形界面桌面应用。伯克利的Ion Stoica、MIT的韩松、Spark之父Matei Zaharia都在作者列表里。GitHub难怪周五开始,微博相关帖子动辄上百次转发。
单卡跑满血,靠的是什么
一句话:不再强求“把整个模型塞进显存”,而是把整台电脑当成一个推理平台。
能这么干,前提是MoE(混合专家)架构。以DeepSeek-V4-Flash为例:总参数284B,每层256个路由专家只选6个,单个token真正参与计算的只有13B。知乎但注意,稀疏省的是计算,不是存储——完整专家池依然有140GB上下,什么消费级显存都装不下。以前的卸载方案把权重放内存,受PCIe带宽限制,一般只能跑1-2 tok/s,基本是玩具。

FreeToken的思路是:完整专家池常驻内存,显存只当“热专家缓存”,再实时测量内存带宽和PCIe带宽,动态决定每个专家是搬上GPU、还是让CPU就地算。微博配合这套带宽感知的协同调度,长上下文的首字延迟能降42%-58%;在Claude Code这种反复调用工具、不断追加上下文的多轮场景里,后续每一轮的首字延迟还能再降65%-80%。知乎甚至后台游戏突然占了显存,它也不会直接崩溃,而是自动收缩缓存、平滑降级继续跑。
论文图3的实测里,RTX 5090上四个工作负载的解码速度全面压过llama.cpp和Ollama,这就是“比Ollama快2-4倍”说法的出处。微博有个参照系:Codex生产环境的中位解码速度是33 tok/s,而FreeToken在8GB的4060笔记本上就能跑到39.3。知乎

先别急着装,三个冷静事实
事实一:数字分档次。39.3、22-25、14.9 tok/s是论文基准;网上流传的“RTX 5080跑20GB模型接近100 tok/s”是社区自测,不是官方口径。微博
另外753B那档,官方基准对应的是一张96GB显存的工作站卡,跟消费级显卡基本没什么关系。微博知乎
事实二:真正的成本在内存。跑DeepSeek-V4-Flash,官方给的参考是32GB显存加192GB左右的系统内存。知乎官方桌面应用的演示截图里,就写着“RTX 5090+192GB内存,已占用158GB”。知乎评论区已经有人提醒:别以为24GB显存的游戏本就能跑。
而眼下恰恰是内存最贵的时候:32GB的DDR5-6000套装,去年大约900元,现在普遍报价2800-3000元,有国产套装从首发499元一路涨到3199元。微博微博微博按一套32GB大约2900元算,192GB差不多要6套、1.7万元上下。喊“Token自由”之前,先看看主板还有没有插槽,再看看钱包。
事实三:低配收益有限。有用户用RTX 4060+64GB DDR5实测,开启FreeToken自动调优后速度没有明显提升,有时反而略慢。知乎也有人说自己3060Ti+32GB用llama.cpp部署Qwen3.6-35B,已经能跑40 t/s。对这批用户,换引擎的收益确实有限。
同时,FreeToken目前只支持DeepSeek-V4-Flash、Qwen3.6-35B、GLM-5.2这类MoE模型,dense模型没办法。微博社区里也一直有另一种声音:稀疏模型思维能力强不到哪去,宁可部署低精度dense小模型。知乎这个争论目前没有定论。
那么,谁值得上手
按配置说下我的判断:
显存16GB及以下、内存64GB及以下:先别急着折腾。你能跑的本来就是35B级模型,llama.cpp、LM Studio这些现成工具速度已经不差,换引擎提升有限。
显存24-32GB(4090、5090档)、内存能凑到96GB以上:这波的最大受益者。284B满血模型22-25 tok/s,远超10-15 tok/s的人类默读跟读线,日常对话、写代码辅助的节奏完全够用。知乎
没有N卡的朋友:暂时只能围观,官方目前支持的是NVIDIA RTX 30/40/50系。GitHub
上手门槛很低:去官网flashml.ai下载桌面应用即可;命令行一行`uv pip install “freetoken[accel]”`也能装。它提供OpenAI/Anthropic兼容API,可以直接接进Claude Code、OpenCode、Codex这些工具。微博

几个值得继续盯的信号
一是模型适配速度。社区呼声最高的是赶紧兼容Qwen3.8-27B,支持名单每多一个,实用性就涨一分。微博
二是老牌工具会不会跟进。FreeToken的带宽感知调度本质是工程方案,llama.cpp、Ollama完全可以吸收;一旦被吸收,“值不值得单独装一套”的答案会变化。
三是内存价格走势。FreeToken是拿内存换显存的思路,偏偏DDR5正在一个季度一个季度地涨,英特尔甚至确认DDR4平台要继续供货多年——侧面说明涨价把用户逼成什么样了。微博内存行情如果继续失控,这条路线的性价比会被持续打折。
最后说一句:FreeToken真正的意义,是把本地大模型的计价逻辑改了——门槛从“显卡显存多大”,变成“整机的内存和带宽有多少”。开源模型能力追平闭源已是事实,接下来的战场是“谁跑得起”。你的电脑在哪个档位?已经装了的,测出来多少速度?评论区聊聊。