当前位置:
AIGC文章详情

FreeToken刷屏,单张RTX 5090跑起284B DeepSeek:“Token自由”是真的,但内存账得先算

源自18位全网作者

12:49

这个周末,很多人的时间线大概都被同一个开源项目刷屏了——FreeToken。

消息确实炸:一台只有8GB显存的RTX 4060游戏本,能以39 tok/s跑Qwen3.6-35B模型;一张桌面RTX 5090,能以22-25 tok/s跑满血版DeepSeek-V4-Flash(284B);一张RTX PRO 6000,能把753B的GLM-5.2跑到15 tok/s。微博翻译一下:以前要数据中心一柜子显卡才能伺候的前沿大模型,现在一台你买得起的电脑就能跑起来。

FreeToken刷屏,单张RTX 5090跑起284B DeepSeek:“Token自由”是真的,但内存账得先算

而且这不是什么野路子画饼。项目来自加州大学伯克利分校和麻省理工的联合团队,论文已经挂上arXiv(编号2608.16157)。知乎代码以Apache 2.0协议完全开源,还配好了Windows和Linux的图形界面桌面应用。伯克利的Ion Stoica、MIT的韩松、Spark之父Matei Zaharia都在作者列表里。GitHub难怪周五开始,微博相关帖子动辄上百次转发。

单卡跑满血,靠的是什么

一句话:不再强求“把整个模型塞进显存”,而是把整台电脑当成一个推理平台。

能这么干,前提是MoE(混合专家)架构。以DeepSeek-V4-Flash为例:总参数284B,每层256个路由专家只选6个,单个token真正参与计算的只有13B。知乎但注意,稀疏省的是计算,不是存储——完整专家池依然有140GB上下,什么消费级显存都装不下。以前的卸载方案把权重放内存,受PCIe带宽限制,一般只能跑1-2 tok/s,基本是玩具。

FreeToken刷屏,单张RTX 5090跑起284B DeepSeek:“Token自由”是真的,但内存账得先算

FreeToken的思路是:完整专家池常驻内存,显存只当“热专家缓存”,再实时测量内存带宽和PCIe带宽,动态决定每个专家是搬上GPU、还是让CPU就地算。微博配合这套带宽感知的协同调度,长上下文的首字延迟能降42%-58%;在Claude Code这种反复调用工具、不断追加上下文的多轮场景里,后续每一轮的首字延迟还能再降65%-80%。知乎甚至后台游戏突然占了显存,它也不会直接崩溃,而是自动收缩缓存、平滑降级继续跑。

论文图3的实测里,RTX 5090上四个工作负载的解码速度全面压过llama.cpp和Ollama,这就是“比Ollama快2-4倍”说法的出处。微博有个参照系:Codex生产环境的中位解码速度是33 tok/s,而FreeToken在8GB的4060笔记本上就能跑到39.3。知乎

FreeToken刷屏,单张RTX 5090跑起284B DeepSeek:“Token自由”是真的,但内存账得先算

先别急着装,三个冷静事实

事实一:数字分档次。39.3、22-25、14.9 tok/s是论文基准;网上流传的“RTX 5080跑20GB模型接近100 tok/s”是社区自测,不是官方口径。微博

另外753B那档,官方基准对应的是一张96GB显存的工作站卡,跟消费级显卡基本没什么关系。微博知乎

事实二:真正的成本在内存。跑DeepSeek-V4-Flash,官方给的参考是32GB显存加192GB左右的系统内存。知乎官方桌面应用的演示截图里,就写着“RTX 5090+192GB内存,已占用158GB”。知乎评论区已经有人提醒:别以为24GB显存的游戏本就能跑。

而眼下恰恰是内存最贵的时候:32GB的DDR5-6000套装,去年大约900元,现在普遍报价2800-3000元,有国产套装从首发499元一路涨到3199元。微博微博微博按一套32GB大约2900元算,192GB差不多要6套、1.7万元上下。喊“Token自由”之前,先看看主板还有没有插槽,再看看钱包。

事实三:低配收益有限。有用户用RTX 4060+64GB DDR5实测,开启FreeToken自动调优后速度没有明显提升,有时反而略慢。知乎也有人说自己3060Ti+32GB用llama.cpp部署Qwen3.6-35B,已经能跑40 t/s。对这批用户,换引擎的收益确实有限。

同时,FreeToken目前只支持DeepSeek-V4-Flash、Qwen3.6-35B、GLM-5.2这类MoE模型,dense模型没办法。微博社区里也一直有另一种声音:稀疏模型思维能力强不到哪去,宁可部署低精度dense小模型。知乎这个争论目前没有定论。

那么,谁值得上手

按配置说下我的判断:

显存16GB及以下、内存64GB及以下:先别急着折腾。你能跑的本来就是35B级模型,llama.cpp、LM Studio这些现成工具速度已经不差,换引擎提升有限。

显存24-32GB(4090、5090档)、内存能凑到96GB以上:这波的最大受益者。284B满血模型22-25 tok/s,远超10-15 tok/s的人类默读跟读线,日常对话、写代码辅助的节奏完全够用。知乎

没有N卡的朋友:暂时只能围观,官方目前支持的是NVIDIA RTX 30/40/50系。GitHub

上手门槛很低:去官网flashml.ai下载桌面应用即可;命令行一行`uv pip install “freetoken[accel]”`也能装。它提供OpenAI/Anthropic兼容API,可以直接接进Claude Code、OpenCode、Codex这些工具。微博

FreeToken刷屏,单张RTX 5090跑起284B DeepSeek:“Token自由”是真的,但内存账得先算

几个值得继续盯的信号

一是模型适配速度。社区呼声最高的是赶紧兼容Qwen3.8-27B,支持名单每多一个,实用性就涨一分。微博

二是老牌工具会不会跟进。FreeToken的带宽感知调度本质是工程方案,llama.cpp、Ollama完全可以吸收;一旦被吸收,“值不值得单独装一套”的答案会变化。

三是内存价格走势。FreeToken是拿内存换显存的思路,偏偏DDR5正在一个季度一个季度地涨,英特尔甚至确认DDR4平台要继续供货多年——侧面说明涨价把用户逼成什么样了。微博内存行情如果继续失控,这条路线的性价比会被持续打折。

最后说一句:FreeToken真正的意义,是把本地大模型的计价逻辑改了——门槛从“显卡显存多大”,变成“整机的内存和带宽有多少”。开源模型能力追平闭源已是事实,接下来的战场是“谁跑得起”。你的电脑在哪个档位?已经装了的,测出来多少速度?评论区聊聊。

内容由AI生成

精选参考来源

1. 加州大学伯克利分校和麻省理工学院的研究人员开源了一款新的推理引擎:FreeToken(这个名字真好),用它可以实现:Qwen3.635B→8GBRTX4060笔记本39tok/sDeepSeek-V4-Flash284B→RTX5090台式机22-25tok/sGLM-5.2753B→RTXPRO6000工作站15tok/s项目地址:...全文

2. 单卡5090跑满血DeepSeek V4Flash,已开源,Token自由了!

3. FlashML-org/FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution

4. 【FreeToken:让顶级MoE模型在游戏本上“跑”起来】FreeToken是一个专为边缘计算设计的推理引擎(FlashML-org/FreeToken),核心目标是在普通游戏本或台式机上驱动290B参数规模的开放权重MoE模型。它通过带宽自适应的CPU与GPU协同执行、全局LRU专家缓存以及语义感知缓存等技术,打破了超大规模模型对数...全文

5. 加州大学伯克利分校开源了FreeToken。结果令人惊叹:一块RTXPRO6000显卡就能以14.9tok/s的速度运行753BGLM-5.2!一台8GBRTX4060笔记本电脑(售价约1000美元)就能以39.3tok/s的速度运行Qwen3.6-35B!在消费级GPU上,FreeToken的速度是Ollama的2-4倍。本地AI推理正变得越...全文

6. 20GB模型无法装入这款RTX 5080的16GB显存,它仍然以~100 tok/s的速度运行

7. 搬砖之旅:一张图说清FreeToken的原理

8. 主流型号存储产品涨价超100%!16GDDR5内存从去年450元涨至1800元,32GDDR5内存从去年900元涨至3800元!归纳为一句话:永远缺存储!

9. 【装机成本失控!32GBDDR5套装冲上2800元:直接翻了4倍】第三方价格追踪平台PCPartPicker的数据显示,主流DDR5-600032GB内存套装最新报价已突破400美元,相较该型号过去的史低涨幅达400%,涨价势头尚未放缓。国内市场同规格DDR5-600032GB套装普遍报价在2900元左右,部分品牌报价达3000元以上。

10. 德国市场DDR5内存涨幅414%作为参考,国产内存DDR5-600016G*2首发499,现在3199,涨幅641%。

11. 【英特尔高管确认RaptorLake未来数年不停产:酷睿i5-14600K涨至250美元仍缺货,DDR5内存价格失控逼用户退回DDR4平台】DDR5内存价格飙升,大量消费者转向支持DDR4的RaptorLake平台,导致该系列处理器涨价缺货,英特尔高管确认未来数年将继续供应该系列产品#英特尔处理器#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章