同一个Qwen3.8-27B,同一张RTX 4090,速度能差出多少?默认配置47.7 tokens/s,打开MTP推测解码后76.3,换成DFlash2量化直接冲到80。同卡同模型,差出接近一倍。而在另一边,一位5060 Ti 16G的玩家让它写个简单的飞机大战游戏,模型原地"雷霆思考"了3分钟,思考输出跑到5万token。这个梗在社区已经有了专门的名字:雷霆思考。
这模型确实火。开源不到12小时就冲进HuggingFace历史最受欢迎模型TOP4、登上Trending榜首;开源两天,下载量突破100万,社区自发贡献了约500个量化版本。36氪但火归火,跑得快是另一回事。一周下来,社区把这27B稠密模型的提速方法和致命坑都趟了一遍,我替你把有用的部分筛出来了。

一、先搞懂它为什么慢
两个原因。第一,它是稠密模型。拿27B Dense和30B-A3B的MoE比,总参数看着接近,实际跑法完全不同:稠密模型每生成一个token,全部27B参数都要参与计算,MoE每个token却只激活约3B参数。36氪同样算力,稠密天然解码慢。第二,思考默认开启,而且不少框架默认把推理强度拉到最高档。评论区有人吐槽"默认effort都是xhigh,都没人改吗"。哔哩哔哩思考输出可以到输入的3倍,你以为在等答案,其实大半时间在等它想。
大家愿意忍它慢,是因为能力确实够硬:官方基准里,编程、Agent等多个项目上它都跑赢了同榜单的Claude Opus 4.6 Max。36氪这也是社区不换模型、硬要把它速度榨出来的原因。

二、三个真能提速的方法
方法一:MTP推测解码。 模型自带多Token预测头,社区发布几小时后就有开发者建了qwen38-mtp项目做A/B测试:同一张RTX 3090,解码速度从31.0提到41.3 tokens/s;RTX 4090从47.7提到76.3;RTX A6000从26.7提到52.5;连AMD RX 7900 XTX都从30.7提到43.9。项目启动两天,就有21名贡献者、27组配置。36氪代价是MTP会多占显存,5060 Ti 16G开了反而变慢,个别版本还和视觉模型不兼容,得自己测。
方法二:DFlash2量化。 有人用RTX 4090 24GB、Q4量化、128K上下文,跑出80 tokens/s,号称提速100%。哔哩哔哩长上下文场景也有实测:26K时DFlash2有75.7、原生MTP是68.1;拉到212K,DFlash2还能稳在41.5、MTP掉到37.6。微博注意它需要自己编译llama.cpp的分支源码,不是开箱即用。
方法三:把思考强度降下来。 模型支持low、medium、xhigh几档。有玩家实测,NVFP4 LOW版本反而比VERY HIGH更好用:5090开256K上下文、MTP开4、思考等级Medium、KV用q8_0,TPS稳定在100上下,也不雷霆思考了。16G显存的思路是UD-Q3_K_XL量化,配–jinja --reasoning off关掉思考,实测约70 t/s。哔哩哔哩
三、两个真致命的坑
坑一:第三方"思考压缩"微调版。 以DavidAU的Cold Fusion为例,评论区实测翻车。有人让它生成最简单的俄罗斯方块,一堆问题。哔哩哔哩有人让它跑任务,它自己"蛐蛐"了半个多小时然后自动关闭,什么都没跑出来;还有人遇到死循环。原生27B反而是"接Agent很强、干活真的强"。想省思考时间,调参数比换魔改版靠谱。
坑二:推理强度无脑拉满。 有测评者特意设成最高档去生成一个C++滑板游戏,模型反复准备写文件又停下来想,循环至少5到10次,用一个多小时编写、编译、修复,最后仍卡在一个自己解决不了的bug上。36氪HackerNews也有用户记录:同一任务,它消耗的token是别的模型的约5倍,即使开了MTP也耗时12分30秒。不是所有任务都要最高推理强度,按任务难度分配思考预算才是正解。
四、按显存选配置速查
8G: 直接放弃,最小Q2量化也要约9G,跑不起来。
16G: 用UD-Q3_K_XL或IQ4_XS,上下文压到64K,思考强度调低,有人4080在linux下能跑到100 t/s,但属于极限操作。
24G: 甜点区,Q4/Q5量化加MTP是基础盘,爱折腾可以再上DFlash2或NVFP4;AMD 7900 XTX这边能到53 TPS。哔哩哔哩
双卡: 两张4090用vLLM跑FP8,能撑196K上下文、稳定约50 t/s;DGX Spark单流34.5、8并发时总吞吐最高493 tok/s。微博
Mac: M2 Studio约33 t/s,M3 Ultra跑Q4在30-35 t/s。哔哩哔哩针对Apple Silicon还有专门的优化项目,不到16小时就把性能相对基线提了153%,约等于默认MTP解码的2.5倍,下一步还要移植CUDA。36氪

五、接下来值得关注的信号
一是下一档尺寸。评论区"等35b"的呼声很高,也有人透露下一个放出来的会是更大的模型,具体是什么还得等官宣。二是Apple Silicon的优化正在快速推进,CUDA移植已经在计划里。三是伯克利开源的FreeToken,号称一块RTX PRO 6000就能以约14.9 tok/s跑超大模型,目前只有单一来源,先观望。微博最后提醒一句:5060 Ti 16G这段时间已经涨价了,想为本地部署买卡的趁早,别追高。
说到底,这模型的生命力不在下载量和榜单,而在社区把它跑快的那一套工程配方。这才是开源模型真正的护城河。想本地部署的,先把上面三个提速方法用上,再避开两个坑,能少走很多弯路。