当前位置:
AIGC文章详情

FreeToken刷屏的7天,本地玩家真正该算的账变了:显存不再是唯一入场券,可这张新票正在涨价

源自226位全网作者

02:55

8月20日,这个叫FreeToken的开源项目GitHub仓库还只有76个Star;8月22日冲上全站Trending第3;8月26日,FreeToken已经达到8.4k+ Stars。智猩猩它成了过去一周本地大模型圈子里唯一的主角,火的原因也足够简单:来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。机器之心这让"单张消费级显卡跑前沿MoE大模型"从段子变成了论文里的实测数字。

FreeToken刷屏的7天,本地玩家真正该算的账变了:显存不再是唯一入场券,可这张新票正在涨价

但当你翻完论文和全网实测,会发现标题党们集体省略了后半句:它确实重新定义了本地部署的硬件账——只是这本账,恰好撞上了内存涨价最凶的一个季度。

一、论文说了什么,哪些是真的

FreeToken的论文全名是《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》,目前还是arXiv预印本,作者名单里有Apache Spark创造者Matei Zaharia、韩松、Ion Stoica。核心主张一句话:别把个人电脑看成"一块小显卡",而是把GPU显存、CPU、主内存、PCIe总线当成一个统一的弹性推理平台来调度。几个被反复转载的关键数字,对照原文核一遍:

  • RTX 5090(32G显存)上,DeepSeek-V4-Flash(284B总参数、激活13B、MXFP4专家权重)解码速度22-25 token/s,Qwen3.6-35B-A3B能到77-83 token/s。知乎对比各任务中最强基线,提升约1.5-2.3倍。

  • 8GB显存的RTX 4060笔记本跑Qwen3.6-35B的NVFP4版本,实测39.3 token/s,约为RTX 4090速度的92%——而Codex生产trace的中位decode速度是33 token/s,笔记本跑出的39.3 token/s已经超过了这个数。机器之心一台普通游戏本的本地输出速度,已经超过了不少人的云端订阅体验。

  • 96GB显存的RTX PRO 6000单卡可以跑753B的GLM-5.2,吞吐达到llama.cpp的约2倍。智猩猩

  • Agent多轮场景下,首Token延迟(TTFT)相比传统卸载方案降低42-58%,工具调用多轮迭代时再降65-80%。

知乎上有人专门做了逐条核对:摘要、正文、实验章节的数字互相对应,带宽比例可以自己复算——这些是实打实写进论文的,不是自媒体脑补。但边界也得划清:这些结果来自论文作者自己的测试,不等于任何电脑都能达到同样速度。知乎“单卡可运行"不等于"这张卡拥有数据中心的体验”,它用的是量化后的专家权重,比如 DeepSeek V4 Flash 的专家池约 140GB,就需要 32GB 显存加上最好有 192GB 的内存来跑才比较稳。机器之心所谓"满血",是"没有砍模型尺寸"意义上的满血,不是"权重全精度塞进显存"。

二、为什么同一套引擎,你的机器和5090跑出来的不是一个东西

这是全网转发中最稀缺、但对玩家最值钱的部分:FreeToken的调度公式。

MoE每一层有256个专家只激活6个,但没被激活的专家也得有人存取。FreeToken把每层要用的专家分成三类:已在GPU缓存里的;没命中、从内存搬进GPU算的;没命中、干脆留在CPU上算的。GPU搬运和CPU计算同时进行,最后按路由权重合并结果。

FreeToken刷屏的7天,本地玩家真正该算的账变了:显存不再是唯一入场券,可这张新票正在涨价

分给GPU还是CPU,不拍脑袋,按实测带宽算:q* = m × Bₚ/Bₕ(Bₚ是PCIe实测传输带宽,Bₕ是CPU侧有效内存带宽)。论文表格里几台机器的分工比例很说明问题:

机器

实测PCIe带宽

实测内存带宽

未命中专家交给GPU搬运的比例

5090桌面机

49.0 GB/s

53.8 GB/s

约91.1%

服务器平台

52.7 GB/s

77.3 GB/s

约68.2%

RTX 4090

25.1 GB/s

63.2 GB/s

约39.7%

4060笔记本

11.8 GB/s

47.5 GB/s

约24.8%

注意第一行:桌面5090的两个实测带宽分别是49.0 GB/s和53.8 GB/s,PCIe几乎吃掉了CPU侧带宽,CPU并行空间很小。知乎它的快,来自PCIe 5.0和DDR5的绝对速度本身。而4060笔记本反过来,PCIe只有11.8 GB/s,搬运是瓶颈,所以大量专家留在CPU侧消化,这恰是"8G显存笔记本能干到4090九成速度"的真相:瓶颈根本不在显卡算力。

于是B站评论区那个没人接话的问题就有答案了——“DDR4和DDR5相比,token差距大么?“大。有3090+256G DDR4的用户晒出实测:64k上下文下速度12token,比原先方案快了一倍多,达到日常可用门槛。B站但离论文里5090的22-25仍差了近一倍。同一个引擎、同一类显存级别,速度差就出在内存这一环。显存决定你"能不能装下活跃部分”,内存容量决定"专家池放不放得下”,内存带宽决定"每秒吐多少token"。三样缺一不可。

三、把全网实测拼起来:你到底是什么档位

单看一条视频容易上头,把B站、知乎、小红书这十天左右的落地记录拼在一起,档位其实很清楚:

  • 5090 + 192G DDR5:论文主角待遇,284B的DeepSeek-V4-Flash跑到22-25 tok/s,而且进入Agent任务后速度保持在单轮数学任务的12%以内波动。知乎

  • 4090 + 大内存:能跑,CPU分担空间大(39.7%),但实测样本还少,速度大致落在上面两档之间。

  • 8G显存游戏本:反而是最大惊喜位——35B级别的MoE以39 tok/s跑着,本地体验反超云端订阅。

  • 3090 + 256G DDR4:能跑到12 tok/s量级,日常对话可用,干活急人。

  • 3060 12G + 32G内存:社区确实有人跑通了FreeToken对接Open WebUI,但那是gpt-oss-20B这种小专家池模型;140GB的284B专家池对32G内存来说根本装不进去,别被"单卡跑284B"的标题骗去下单。

  • 另一派的声音:有B站高赞评论说得直接——“有这功夫为啥不直接Qwen3.8 27B一把梭呢”,Q4_K_M能到300TPS、4路并发。B站这句话没毛病,但它说的是"快",FreeToken卖的是"能力上限":27B给不了的前沿编码和Agent能力,才是这周的增量。

FreeToken刷屏的7天,本地玩家真正该算的账变了:显存不再是唯一入场券,可这张新票正在涨价

四、最尴尬的部分:这张新入场券,正在全年最贵的时候

FreeToken把"显存不够,内存来凑"写成了系统设计的正解,但2026年8月的市场给了它一记背刺:DRAM合约价一个季度涨了93%到98%,机构把全年涨幅预期喊到150%到200%。知乎专栏TrendForce预计2026年第三季度,DRAM合约价格还将环比上涨13%—18%。知乎落到零售价上:单根DDR5 16G内存价格普遍在1000+,换成单根DDR4 16G也就400+。知乎问答

FreeToken刷屏的7天,本地玩家真正该算的账变了:显存不再是唯一入场券,可这张新票正在涨价

也就是说,“32G显存+248G内存"这套配置,内存部分的账单按现价算已经不比一张二手显卡便宜——评论区那句"256G的内存并不一定比256G的显存便宜”,正在从调侃变成报价单。B站网上"目测freetoken会拉着内存条直接涨疯掉了"的猜测,至少方向是对的:当一个开源项目把需求从显存引向海量内存,而内存本身处于历史级上行周期,等等党第一次占了上风。知乎

五、去噪:三个正在误导人的东西

  1. 撞名乌龙。网上还存在一个老牌"FreeToken"项目——收集各家免费API额度、用ChatGPT账号转API的订阅工具,8月30日仍有视频把两者混为一谈。B站看到"FreeToken实现Token自由"的教程,先确认讲的是不是伯克利那套推理引擎。

  2. 速度数字的水分。逐条核对过的22-25、39.3确实写进了论文;但也有自媒体给出的"吊打云端"式tok/s没有任何可复现配置支撑。而且论文的对比基线并不整齐——Ollama和MoE-Infinity在部分DeepSeek-V4-Flash配置上根本跑不起来,因此"最高快2.3倍"应理解为论文给定测试集合中的结果,而不是对所有后端、所有模型的普遍定律。知乎

  3. "格式全支持"的错觉。评论区已经有人折腾半天发现量化格式支持范围有限、白忙活一场。它支持的20多个MoE模型主要指论文覆盖的NVFP4/MXFP4这类量化格式,生态铺开还需要时间。

六、所以:装不装,买不买内存

现在就试:手上已有32G级别显卡+大容量DDR5的,软件侧已经收敛到很低门槛——官方已提供Windows、Linux桌面App(带GUI),命令行一行`uv pip install “freetoken[accel]”`即可载入。机器之心先跑论文同款配置,看你的实测带宽落在哪条线上,再谈升级。

忍住别动:指望"为了FreeToken专门补内存"的人。第一,内存价格在历史高位,为一个预印本级别的软件系统囤192G,是最差的买入时点;第二,先确认瓶颈——如果你是3060/32G内存这一档,补内存也够不到284B的门槛,不如先把27B dense跑明白。

接下来盯四个信号:FreeToken模型支持列表和量化格式生态的实际铺开速度;社区晒出的同档位实测表(现在样本还少);DRAM合约价的环比拐点(TrendForce每季度更新);以及论文从预印本走到正式会议后有没有数字修订。

FreeToken这七天真正改变的事,是把"跑得起前沿模型"从一个硬件采购问题变成了一个软件调度问题——这个方向站在玩家一边。但它同时把新的入场券定价权交给了内存市场,而此刻的市场偏偏站在你钱包的对立面。软件已经自由了,硬件还没。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章