FreeToken一周狂揽8.4k星:老卡也能跑284B大模型,但先看清你在哪个速度档

源自13位全网作者

00:32

8月28日晚的显卡日报记录了一组扎眼数字:RTX 5080回到11999元、5070 Ti涨至8899元,双双站上历史最高,而且是"顶着平台补贴硬涨"。知乎同一周,GitHub趋势榜上蹿得最快的项目,和挖矿、和游戏都没关系——是伯克利、MIT等机构联合团队开源的边缘推理系统FreeToken,8月20日被智猩猩AI首次关注时它只有76个Star,8月22日就冲上全站Trending第3、单日新增约1.8k,到8月26日已经是8.4k+。知乎

同一时间,"Token自由"这四个字刷满了知乎、B站和小红书的显卡区:伯克利、MIT开源的FreeToken,被形容为单卡5090跑满血DeepSeek V4 Flash、8G显存笔记本卡跑35B模型。小红书手里攥着3090、4070、16G中端卡的等等党们心动了:涨价高位不用换卡,也能摸到前沿大模型?

但把各处的实测摆在一起,数字乱得吓人:论文里22 tok/s,有人3090实测12,评论区5,甚至还有人卡到"30秒一个token"。想上这班车,先把速度账算清楚。

FreeToken改的不是模型,是你把电脑看成什么

MoE模型参数总量大、每个token只激活一小部分专家,这个结构早就被拿来给显存"减负":llama.cpp靠-ngl/-ncmoe把部分专家留在内存,24GB显存的3090加128G DDR5,就能以40.4 tok/s跑一个约94GB文件的Qwen3.8-Flash-Next(llama.cpp已在8月27日正式合入该模型支持)。知乎但老办法的共同短板是固定策略——哪些专家进显存、什么时候搬运,都是写死的规则,在真实消费级机器上经常失配:显存可能被浏览器和后台游戏占着,内存带宽、PCIe版本每台机器都不同。

FreeToken(论文arXiv:2608.16157,作者包括并列一作Shuo Yang和Kurt Keutzer、韩松、Matei Zaharia)的做法是放弃固定放置策略,围绕边缘设备的真实限制重新设计推理流程:先实测你这台机器的PCIe和内存带宽,再动态决定哪些专家搬进显存、哪些干脆让CPU直接算;利用相邻token访问专家高度相似的规律,让高频专家驻留GPU共享缓存;运行中还允许重新切分专家缓存和KV Cache的空间,不用重启模型。知乎官方测试里,DeepSeek-V4-Flash(284B总参数、13B激活、MXFP4专家权重)放在32G显存的5090上,显存里的专家缓存只装得下整个专家池的约11%,但decode阶段的专家缺失率压到39%,同场景llama.cpp是89%、KTransformers是59%。它支持超过20个MoE模型,覆盖从8G显存笔记本到工作站的硬件。

FreeToken一周狂揽8.4k星:老卡也能跑284B大模型,但先看清你在哪个速度档

速度上限也因此被重新划定:RTX 4060笔记本8G显存跑35B级模型39.3 tok/s,5090跑DeepSeek-V4-Flash四类任务22-25 tok/s,整体保持在1.5-1.9倍于现有边缘系统的最优基线。哔哩哔哩单卡RTX PRO 6000跑753B的GLM-5.2,吞吐约为llama.cpp的2倍——论文首图里,同一负载下llama.cpp的柱子还停在10 tok/s出头。知乎

四组速度数字,你到底该对哪个号

把这周社区里的数字归归类,其实是四组不同条件的话:

  • 论文数字:5090+大容量内存,284B满血22-25 tok/s;35B-A3B级模型77-83 tok/s。

  • 教程数字:B站1.2万播放的部署视频给的是"5090+248G内存、约20-40 tok/s"——注意那是在带工具调用的Harness场景里,不是裸decode。哔哩哔哩

  • 社区低配数字:有玩家用3090+256G DDR4、64K上下文实测12 tok/s,自评"达到日常可用门槛"——同机器跑llama.cpp只有5。哔哩哔哩3060-12G+32G内存的机器跑通gpt-oss-20B接Open-WebUI也有实测贴;还有博主用32G的V100手动限制显存模拟16G卡,IQ4_XS量化的Qwen3.8-27B做到110K上下文、35-47 tok/s,知识/代码测试20/20、8/8。小红书

  • 小模型天花板:个人项目moe-l2(7月26日上线、8月28日刚破80星)在4090上把DeepSeek-V2-Lite从65 t/s提到139-154 t/s,不降反升。知乎传统方式要23.3GB显存的模型,它只占6.7-10.1GB。

规律一句话:模型越大、上下文越长、量化越轻,速度越往10-25这个区间靠;模型越小越敢谈50以上。拿139去预期284B,或者拿5去否定这波技术,都是对错了号。

FreeToken一周狂揽8.4k星:老卡也能跑284B大模型,但先看清你在哪个速度档

入场券换了:从显存容量,换成内存和总线带宽

最能说明问题的是一组对比:同样是24G显存级别的老卡,双路V100配DDR4-2133、PCIe 3.0、无NVLink,跑80B级MoE只有5-6 tok/s;而3090+128G DDR5的新平台,同一类玩法能到40 tok/s。知乎差距不在显存,在内存带宽和总线。

也就是说,这一波软件红利救的是"显存装不下"的人,救不了"带宽地板"的人。moe-l2作者自己也在给老双卡用户做预期管理:多卡支持正在做,但PCIe 3.0、无NVLink的老双卡就算跑起来,也跑不出新平台的速度,性能天花板客观存在。知乎DDR4老平台、小内存条用户,别指望一张旧卡装满128G内存就脱胎换骨。

五个坑,想上车的先过一遍

  1. "满血"不是你想的那个满血。DeepSeek-V4-Flash的官方检查点本身就是MXFP4专家权重,社区骂"Q4量化不如云端"时,对标对象其实已经换了,精度争论要先校准起点。知乎

  2. 首token会慢。第三方评测给出的尾延迟最高到44秒级别——聊天体感飞快,但扔一篇长文档进Coding Agent等结果,开头要熬。哔哩哔哩

  3. 生态门槛还在。权重格式覆盖有限,有用户吐槽"搞了半天gguf格式只支持Gemma-4模型";多模态暂不支持,图片喂不进去。哔哩哔哩

  4. Windows先别冲动。同类项目moe-l2目前只能走WSL2这一条路,原生版还在开发;命令行都没碰过的,这篇不是写给你的。知乎

  5. “能加载"不等于"能用”。moe-l2上DeepSeek-V4-Flash已经能跑起来、显存占8.3-9.1GB,但速度一栏至今是N/A——卡在llama.cpp上游deepseek4架构的bug(#25582)上。作者提醒得直白:硬盘装得下10TB素材,不代表电脑剪得动8K。

三本账:买卡、加内存,还是什么都不买

先看显卡:街价5070 Ti 8899、5080 11999都在历史最高,日报的原话是"如果没有平台补贴的话价格更高了";7月显卡销量环比降13%、同比-17%。知乎知乎

软件把显存门槛降了,硬件党真正的动作对象变成了内存——而内存恰好在涨价通道里:8月27日DDR5现货站上54美元、价格指数冲到147.21。知乎教程视频评论区已经在"怀念当年48g D5内存800一根",还有人算过一笔直觉账:256G的内存并不一定比256G的显存便宜。哔哩哔哩上游也闻到了味道:长鑫上半年营收1503.1亿、同比+873.6%,净利润776亿扭亏为盈,LPDDR6已向关键客户送样验证。知乎"加内存不换卡"的玩法依然成立,但指望它永远便宜,窗口在收窄。

FreeToken一周狂揽8.4k星:老卡也能跑284B大模型,但先看清你在哪个速度档

按人群分档:

  • 24G+大内存+DDR5(3090/4090):这波最大受益者,284B级12-40 tok/s是真能日常用的,完全不必去接11999的5080。

  • 16G中端(5060 Ti 16G/9070系):35B级甜点区,量化路线35-47 tok/s已有实测;硬上284B没必要,你的钱该买的是速度不是容量。

  • 8G入门:笔记本8G跑35B的39.3是官方数字,但桌面同显存请等社区验证——够用,别当赚钱工具。

  • DDR4/PCIe 3.0老平台:5-6 tok/s就是镜子,这班车和你无关,钱留着。

FreeToken一周狂揽8.4k星:老卡也能跑284B大模型,但先看清你在哪个速度档

盯住这五个信号,结论随时可能要重算

llama.cpp的上游进度值得每周看一次:Qwen3.8-Flash-Next的正式支持已在8月27日合入官方主干,V4-Flash的#25582还没修完,社区速度表基本每周都在补。知乎其余四个:moe-l2的多卡和原生Windows进度;FreeToken对权重格式和多模态的扩展节奏;DDR5现货指数会不会被"AI内存故事"继续推高;以及卡吧疯传的"50系封仓、双11最贵"传闻和50 Super搁置传闻的后续。任何一个变化坐实,上面的分档都要重新核一遍。

这一波不会让AI变免费,它只是把本地大模型的入场券,从"买得起显存"改成了"有带宽"。对等等党最实在的一句话:老卡的瓶颈多半不在那几G显存,而在它旁边的内存条和PCIe插槽上——别急着卖卡,更别急着接盘,先把带宽账算完。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章