FreeToken一周狂揽8.4k星:单卡跑满血DeepSeek,小字全写在内存条上

源自237位全网作者

02:41

这周五AI Infra圈刷屏的不是新模型,是一个让"跑得起"三个字的定义被改写的软件:UC Berkeley Sky Computing Lab(vLLM的诞生地)联合MIT Han Lab开源了FreeToken,一个专门在消费级电脑上跑超大MoE模型的端侧推理系统。知乎一周之内它的GitHub星数曲线像被拽起来的K线:8月20日还只有76星,8月22日冲上Trending全站第3(单日新增约1.8k),到8月26日已经8.4k+。知乎作者阵容同样是顶配:并列一作杨硕是伯克利EECS博士生、上海交大本科、导师Ion Stoica,团队里还有Spark之父Matei Zaharia和Deep Compression作者韩松。上手门槛也低:Windows/Linux直接给桌面GUI,命令行一行 `uv pip install “freetoken[accel]”` 就能装。

FreeToken一周狂揽8.4k星:单卡跑满血DeepSeek,小字全写在内存条上

官方数字先摆出来,再决定心动几分

FreeToken支持20多个MoE模型,论文在六台机器上跑了从8GB笔记本到96GB工作站的配置,核心结论是这几组数:RTX 4060笔记本(8GB显存)跑Qwen3.6-35B达到39.3 tok/s;RTX 5090跑Qwen3.6-35B-A3B给到77–83 tok/s;同一张5090跑总参数284B的DeepSeek-V4-Flash稳定在22–25 tok/s;RTX PRO 6000单卡把753B的GLM-5.2跑出约14.9 tok/s,吞吐约为llama.cpp的2倍。相比各工作负载里最强基线,整体加速1.5–2.3倍——而对比名单里的Ollama和MoE-Infinity,在部分DeepSeek-V4-Flash配置上根本跑不起来。知乎

这组数字值不值得心动,得有个参照物。机器之心给的标尺很直接:Codex生产环境trace的中位decode速度约33 token/s——一台8GB显存的笔记本跑35B,已经超过了主流云端编程Agent的实际出字速度。知乎但也要把边界先画清楚:"最高快2.3倍"是论文测试集合里的结论,不能读成对所有后端、所有模型的普遍定律。

FreeToken一周狂揽8.4k星:单卡跑满血DeepSeek,小字全写在内存条上

它凭什么快:省的不是模型,是搬运

MoE的账大家都熟:DeepSeek-V4-Flash总参数284B,43层、每层256个路由专家选6个,单token只激活约13B。稀疏让计算可行,但没让存储变便宜——完整专家池按FP4算约140GB,5090的32GB显存装不下。真正的瓶颈在"搬":长prompt做prefill时,所有token路由的并集几乎覆盖每层全部专家,等于整个专家池要流过一遍PCIe;Agent每轮工具调用改一次上下文,这种搬运还会反复发生。

FreeToken的三件套全部冲着这条搬运链:一是带宽自适应执行,把缓存未命中的专家按实测带宽切成两份,一份搬进GPU、一份留在CPU直接算,两边并行、按路由权重精确合并,不改模型、不是近似推理;二是语义感知缓存,利用相邻token倾向访问相似专家的规律做全局LRU——论文测得5090上GPU专家缓存只装得下完整专家池约11%时,decode未命中率仍压到39%,而KTransformers和llama.cpp分别是59%和89%。知乎三是弹性内存管理加Agent语义锚点,长prompt(4-16K)首token延迟降42–58%,多轮工具调用场景TTFT降65–80%,后台打游戏把显存占掉4–8GB也不OOM,缓存原地收缩、平滑降级。对Agent用户,价值在稳定性:从单轮数学进Coding Agent场景,FreeToken从24.9掉到22.5 tok/s,KTransformers从10.4掉到7.1,跌了31%。

一周实测拼图:封神帖和翻车帖都在这

跑分帖和真机之间隔着一条河。把这一周各平台实测信号拼起来,分歧比官方表格更有信息量:

来源

配置

结果

B站喵叔大萌新

3090 + 256GB DDR4,64K上下文

12 tok/s(llama.cpp约5),“达到日常可用门槛”

微博斌叔OKmath

5090 + DDR5八通道,社区魔改版

Qwen3.8-Flash-Next-NVFP4 prefill 277.5 / decode 59.1 tok/s,双卡619.5 / 83.1

YouTube CloudCodes(B站转载)

工作站复测

35B达到77–83量级,但尾延迟高达44秒,首日不支持Apple Silicon,“硬件成本未必低”

机器之心评论区自测

4060 + 64GB DDR5,LMStudio全专家卸载

llama.cpp路线92K上下文已20+ tok/s;FreeToken自动调优没提速、有时略降,上下文还受限80K

同评论区另一条

3060Ti 8GB + 32GB

llama.cpp跑Qwen3.6-35B已报40 tok/s(自报)

同一张卡,有人实测只有12 tok/s,比llama.cpp的5快了一倍多,但离宣传线差着量级。哔哩哔哩另一侧,有人靠DDR5八通道加社区魔改跑上了59 tok/s。还有人把话挑明:这套东西需要DDR5,否则跑不出来。微博这些差别几乎全在内存那一侧——这不是玄学,是论文里写好的式子。

真正的主角是你主板上那几根内存条

FreeToken的核心决策就一个公式:未命中专家里交给GPU搬运的比例 q* = m × Bₚ/Bₕ,Bₚ是PCIe实测传输带宽,Bₕ是CPU侧有效内存带宽。论文Table 1按机型实测的分配比例很说明问题:5090服务器约68.2%、4090工作站约39.7%、4060笔记本约24.8%、桌面5090高达91.1%。翻译成用户语言:桌面5090上PCIe(约49 GB/s)几乎吃满了双通道DDR5的有效带宽(约53.8 GB/s),CPU帮不上多少忙,收益主要靠缓存命中和调度;笔记本上反而是CPU干大头,内存带宽直接决定下限。知乎所以"3090 + 256GB DDR4"是12 tok/s,“DDR5八通道"是59 tok/s——显存是入场券,内存的容量、代际、通道数才是上限。所谓"单卡跑满血”,小字全写在内存配置里,比如DeepSeek-V4-Flash的官方推荐姿势就是32GB显存之外再配192GB内存。知乎

FreeToken一周狂揽8.4k星:单卡跑满血DeepSeek,小字全写在内存条上

更尴尬的是时间点:补那192GB大内存,付的不是原价。TrendForce预测2026年Q3 DRAM合约价环比再涨13–18%、NAND涨10–15%,评论区已经在喊"内存要涨疯了"。知乎这轮涨价和FreeToken是同一个故事的两侧:界面新闻本周报道行业正从"堆GPU"转向"存算协同",企业端曙光ParaCache这类四级缓存方案都在降低对本地大内存的依赖。反过来读给个人用户的建议就是:先把手头的内存用好,再考虑买新的。

该不该动手:对号入座

  • 40/50系桌面卡 + DDR5 96GB以上:今天就值得装来试,官方数字基本可信,收益最大的是Agent长会话;

  • 30系 / DDR4 / 内存不足64GB:可用但别拿官方曲线期待自己,12 tok/s是真实世界;不建议为它在这个涨价周期里囤内存,等调度优化或内存降价更划算;

  • Mac用户:首日不支持Apple Silicon已被点名,等社区移植。哔哩哔哩

  • 手里是稠密模型(如Qwen3.8-27B):跟你无关,FreeToken只针对MoE做调度,社区原话就是稠密模型不适合这套引擎。知乎

  • 目标只是35B级别、主要问一句答一句:llama.cpp卸载路线已经很能打,FreeToken对你的增量在TTFT和多轮稳定性,不在峰值token数。

最后把结论的边界钉死:论文还是arXiv预印本,官方数字是"指定量化格式+指定硬件+调度调优"下的理论上限,753B那台PRO 6000是展示性配置、1.4T权重并不是塞进了显存,MXFP4/NVFP4量化的精度损失各人体感不同。目前还不能把一次论文实验当成长期生产环境的最终结论,证据覆盖到这里,话就只能说到这里。知乎

接下来盯五个信号:Apple Silicon支持进度、80K上下文限制和44秒尾延迟会不会被版本更新解决、llama.cpp/KTransformers的跟进动作、Qwen3.8-A3B这类小激活MoE模型的发布(机器之心那句"就差个Qwen3.8-A3B"已经成了社区接头暗号),以及Q4内存合约价走势。知乎这一轮"Token自由"的入场券不是更大的显存——先看内存,再聊显卡。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章