同一张3090,67对20;同一张5090L,784对205:本地AI进入"专武"时代,先把四件套对齐再问谁最快

源自321位全网作者

09:35

B站那条2080Ti部署Strata的实测视频下面,评论区有人问:22G显存加64G内存,跑Qwen3.8-27B的Q4量化,llama.cpp只有20~25 tok/s,上下文64K还总是塞满要压缩,怎么提速?底下最管用的回复就五个字:“换推理引擎”。提问的老哥真换了——同一台机器切到Strata,decode直接干到60~80 tok/s,上下文翻倍,他自己的原话是"太爽了"。B站

同一台机器、同一个模型家族,换一个软件差出三倍。这不是孤例,最近半个月,本地部署圈子里这类同机对比数据密集出现:

  • RTX 3090跑Qwen3.8-Flash-Next的IQ3_S量化:Strata能到67 tok/s,llama.cpp只有20 tok/s——这是安全圈老KOL tombkeeper在微博晒的群内实测,488个赞。微博

  • RTX 5090 Laptop跑27B:NVFP4量化8路合批聚合784.5 tok/s,换三值量化的Bonsai2只剩约205——同一个人、同一张卡的对照实验。知乎

  • Mac Studio M5 Ultra:同一个模型、同一台机器,换框架、换上下文长度、有没有命中前缀缓存,读数从40到272 tok/s,差6.8倍。B站

最后这期的UP主AlickFine把话说明白了:速度不是引擎的固有属性。所以"哪个引擎最快"这个问题本身就不成立,成立的问题是:我这台机器、我要干的活,该配哪个组合。

同一张3090,67对20;同一张5090L,784对205:本地AI进入

差距为什么能这么大?拆成三个机制

一是MTP投机解码。 Qwen3.5/3.6/3.8这一代模型出厂自带MTP(多token预测)头,但此前几乎没有推理运行时真的在用它。Mac工具MTPLX就是拿MTP头做投机解码:模型自己起草若干token,一次批量前向验证,用带残差修正的精确拒绝采样提交——数学上保证任意温度下输出分布和普通解码完全一致,16GB的M4 Mac mini提速1.6倍,M5 Max提速2.24倍,OpenCode里跑27B能到125 tok/s。更夸张的是一个双P100实验:200美元收的两张2016年老卡,开了MTP头加张量分割,生成速度从12.9 tok/s变成38 tok/s,还点亮了20万token上下文。知乎B站

但MTP不是万能钥匙。做5090L实测的知乎作者"游戏人王鲸"给了个关键细节:MTP草稿的接受率在数数类重复内容里高达97%,在自然散文里只有24%。也就是说同一个引擎,你让它干的活不同,速度天差地别——这是很多"实测xx tok/s"的截图到了你机器上跑不出来的第一个原因。

同一张3090,67对20;同一张5090L,784对205:本地AI进入

二是量化和硬件的配对。 784对205那组数字是最好的教材:NVFP4走的是50系显卡的FP4张量核,矩阵乘是硬件原生操作,瓶颈只剩带宽;而三值量化把权重压到{-1, 0, +1}三个值,没有任何GPU有原生三值矩阵乘单元,引擎必须先用CUDA core软件解包位流再做乘加。王鲸的总结很精辟:“省的是字节,费的是算术”——权重从17GB缩到8.3GB,速度反而只剩四分之一。但也别急着嘲笑三值:它的生态位在FP4塞不进的设备上,16GB笔记本、8GB小卡,“能跑"压倒"跑多快”,这时候5.9GB的27B就是决定性的。知乎

三是MoE分层调度。 Strata快,是因为它是只为Qwen3.8-Flash-Next一个模型写的:显存放常驻计算部分和热点专家,内存放路由专家,SSD放n-gram嵌入表、靠系统页缓存预取,甚至专门给Q2_0量化写了AVX-512 VNNI的CPU内核。这就是圈内说的"专武"——模型、引擎、量化、卡代际,四件套全对上,速度才是你的。微博

专武的代价:四件套对不齐,坑一个不少

过去一周的评论区和实测报告,把没对齐的下场展示得很齐全:

  • 老卡吃不消:Strata对20系显卡和12代以前CPU支持不佳,2080Ti实测视频的标题就是"很牛!很强!很大坑!";评论区还有30系用户报告各种死循环复读,IQ3_XXS和IQ3_S都一样,换GitHub最新代码也没解决,“还是27B稳定用”。B站

  • 极限低配有天花板:有人自研引擎Arkion-Q1,把Flash-Next 125B硬塞进3070Ti的8GB显存加16GB内存,生成速度8~12 tok/s,预填充"几乎爆炸",长文本灌入能等到死,而且引擎闭源、是个人一个月的项目。知乎

  • 量化降智:Flash-Next的Q2/IQ2_XS版本被评论区点名"IQ2_XS生代码质量还没有27B Q4的好"“q2就降智太大了”,6赞的高楼结论是"Q2就别玩了,Q3就很强";三值Bonsai2官方自测平均保留98.2%是20项基准的平均数,长程agent任务掉到约75%(SWE-bench Verified 60.8对全精度80.6)。

  • 专武有专武的病:AMD R9700被实测认作Qwen3.8-27B的"专武"——解码141→200 tok/s、预填充+49%、首字延迟-43%,但UP主自己补刀:模型、引擎、量化三件套全对上才好用,跑其他模型基本没戏,“要跑多模型还是老实买N卡”。B站

生态已经卷到启动器都开始做"多引擎自动切换":国庆刚发的文义AI启动器V7.0,会自动识别模型量化类型(Q4_K_M、PTQ1_0、PQ2_0),在标准引擎和三值引擎之间智能匹配。这事本身就在告诉你:一个引擎通吃的时代结束了。B站

那到底怎么选?按机器对号入座

以下全部来自近两周社区实测(引擎日志或同机对比),不是官方宣传数:

你的机器

想干什么

当前社区主流组合

参考速度(社区实测)

24G显存N卡(3090/4090)

27B当主力干活

NInfer + NVFP4量化

V100×2都能冲峰值236 tok/s解码

12~16G显存 + 64G内存

体验125B MoE

Strata + Flash-Next IQ3_S或GSQ-RCO

4060Ti约30、5060Ti约40~50、5070约65.6 tok/s

20系老卡(2080Ti等)

同上

先翻项目issue再上车

22G版实测60~80,但死循环报告集中在20/30系

16G内存笔记本 / 小显存

能跑起来优先

三值Bonsai2-27B(需配套三值引擎)

5090L八路聚合205 tok/s,单流散文约66

Mac(Apple Silicon)

27B / Flash-Next

MTPLX(MTP投机解码),或LM Studio最新版开MTP

M5 Max跑OpenCode 125 tok/s

无独显

尝鲜、轻任务

Colibri等SSD流式方案

冷启动0.05~0.1步/秒,能用不等于好用

同一张3090,67对20;同一张5090L,784对205:本地AI进入

再加三条避坑提示:

  1. 看到速度数字先找口径:框架名+版本号+上下文长度+单流还是合批,四样缺一不可。784和205都是8路合批聚合数,单流散文其实都在66 tok/s上下——口径砍一半,结论就能反转。

  2. 通用引擎没死,别盲目追新:LM Studio最新版已支持MTP和KV量化,评论区实测27B的GSQ版能到decode 30+、prefill 400~600、约200K上下文;Ollama的价值是多模型省心,不是刷速度。专武换来的是速度,付出的是"只此一家"的绑定。

  3. 专武迭代快,注意版本和许可证:Strata基本一周一版(0.1.39刚发布),老卡用户先看issue再花时间;衍生量化包的许可证各不相同,MTPLX是Apache-2.0但带额外署名条款——商用集成前记得看一眼NOTICE。知乎

最后说句实在的

2080Ti那位踩坑UP主"牛X天下"在评论区留了句高赞总结:30系以上显卡、96G以上内存用Strata+Flash-Next非常不错,硬件受限的还是老实用27B——最适合的模型才是最好的模型。这句话把"模型"换成"引擎"同样成立。专武时代的红利是真的——20 tok/s的2080Ti能翻身到60往上;坑也是真的——四件套错一件,就是死循环、降智、预填充等到死。假期余额不多,如果你打算折腾自己那台机器,建议先想清楚"我要它干什么活",再回头对上面那张表——你要的毕竟是干完活的速度,不是别人截图里的最高速。B站

想继续盯的三件事:评论区苦等的Qwen3.8-35B什么时候开源(已经有人做"代餐"视频了);Ollama官方什么时候把MTP加速吃进去;Strata修不修老卡死循环。这三件事任何一件落地,上面那张表都得重排。

内容由AI生成

精选参考来源

1. 2080ti,Strata本地部署Qwen3.8 Flash Next!很牛!很强!很大坑!

2. 本地跑大模型的同学,可以试一下新出的推理引擎 Strata

3. 三值化 Bonsai 2 27B 实测:5090L 上 205 tok/s,以及它为什么跑不过 FP4

4. Mac Studio M5 Ultra 本地大模型实测二

5. Ollama 太慢了?这个 Mac 工具让 Qwen3.8-27B 干到 87.6 tok/s

6. [中配]200美元双P100运行Qwen3.8-27B:本地AI极限优化与实测

7. 在 8GB 显存与16G内存上部署Qwen3.8-Flash-next 125B MoE大模型

8. 【实测】Qwen3.8-27B“专武”AMD R9700

9. 最新千问27B大模型用三千多元家用主机部署速度38toks,支持多引擎自动切换三值量化

10. [Ninfer V100X2]v100再再创辉煌!qwen3.8 27b nvfp4峰值236t/s decoding,2000t/s prefill

11. 16GB 显存跑 125B 大模型,实测每秒吐 30 个字,还不花一分钱 API 费

12. Strata确实可以封神了

13. 2MB小程序本机跑744B大模型:纯C推理引擎colibri,不用显卡也能跑 | GitHub Daily

14. 国庆高强度玩了下本地模型,几点个人想法

15. Strata:Run a 125-billion-parameter AI model on your own gaming PC(README速度表与v0.1.39版本信息)

16. MTPLX:Native MTP speculative decoding on Apple Silicon(README与docs/assets截图)

17. colibri:纯C零依赖MoE推理引擎(docs/media截图)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章