Qwen3.8-27B 开源这几天,如果你已经把这个 27B 模型装进了自己电脑,大概率经历过这种落差:跑分看着真猛,社区一片"本地 Opus"的欢呼。知乎可真跑起来每秒吐十几个 token,看它一个字一个字往外蹦,急得想砸键盘。

别慌,你不是一个人。过去 48 小时,B站、知乎、YouTube 上最务实的讨论已经不是"它强不强",而是"怎么让它快起来"。讨论的中心是一个叫 MTP(Multi-Token Prediction,多 token 预测)的开关。我把全网这两天的实测数据扒了一遍,共 10 组——有人靠这个开关从 60 tok/s 提到 167 tok/s,几乎零质量损失。哔哩哔哩也有人开了之后速度不升反降。
MTP 是什么:模型自带的"草稿员"
一句话说清:Qwen3.8-27B 模型里内置了一个轻量"草稿模块",它先快速猜出后面几个 token,再由主模型一次性并行验证。本地推理的瓶颈通常不是算力,而是显存带宽——每输出一个 token,都得把 27B 的参数完整读一遍。MTP 把这次读取的成本摊给了多个 token,所以能提速。这也解释了为什么不同硬件上收益天差地别,后面细说。
10 组实测摆在一起:收益有规律
这是我从社区实测里汇总的数据(截至 8 月 19 日):
硬件与推理引擎 | 未开 MTP | 开启 MTP 后 | 来源 |
|---|---|---|---|
RTX 5090 + llama.cpp | 约 60 tok/s | 最高 167 tok/s | Cloud Codes 实测 |
RTX 5090 + SGLang | — | 206 tok/s | Cloud Codes 实测 |
双 NVIDIA L20 + vLLM(FP8) | 55 tok/s | 71 tok/s | 知乎受控 A/B 测试 |
双 RTX 2080Ti 魔改 44G + vLLM | 45 tok/s | 60+ tok/s | B站评论区实测 |
双 V100 64G(Q8 量化) | 约 18 tok/s | 约 30 tok/s | B站评论区实测 |
AMD AI Max 395(Q5_K_M + MTP4) | — | 约 28 tok/s,上下文过千后掉到十几 | B站评论区实测 |
Apple M4 Pro | — | 提速 2.45 倍 | Cloud Codes 实测 |
NVIDIA DGX Spark | — | 提速约 72% | Simon Willison 评测 |
AMD Vulkan(Radeon) | — | 51.8 tok/s | Cloud Codes 实测 |
RTX 3090(Q4,基线) | 40~47 tok/s | — | B站实机测试 |
数字摆出来,规律其实很清楚:显存带宽瓶颈越明显的平台,MTP 的收益越大。5090 配合 SGLang 能冲到 206 tok/s。哔哩哔哩上代计算卡 V100 双卡开了也只有 30 tok/s。哔哩哔哩Mac 的统一内存反而对 MTP 友好,M4 Pro 实测提速 2.45 倍,是全网实测里的顶级收益。
四个坑:踩中一个就白折腾
坑一:你的 MTP 可能根本没启用。 今年 5 月 13 日,llama.cpp 把 MTP 相关的参数标志改了名,老配置、老教程里的写法就此悄悄失效,受影响的本地部署以数千计。YouTube如果你是照着三个月前的教程部署的,速度平平,第一步先确认当前版本里 MTP 的标志位真的打开了。
坑二:小显存机器开了反而更慢。 有实测发现,12GB 显存的笔记本开启 MTP 后出现内存溢出,关掉反而更快。哔哩哔哩MTP 要额外吃显存存草稿,显存吃紧时别硬开。
坑三:温度调高了会吃掉收益。 采样温度越高,草稿模块猜的内容和主模型的口味偏差越大,草稿接受率会从 85% 掉到 65%。YouTube想榨速度,temperature 尽量压低。
坑四:接受率不等于提速。 知乎一篇双 L20 的受控 A/B 测试里有个反直觉细节:MTP4 的接受率比 MTP2/MTP3 低,但它一次接受就是更多 token,最终输出反而更快。知乎另外有用户反馈开了 MTP 后服务偶尔假死、请求全排队,遇到的话先查并发和调度配置。哔哩哔哩
怎么调:三个社区验证过的结论
草稿深度 5 步最划算。 实测对比了 2/5/8 步草稿,5 步的输出峰值最高,猜得太深反而浪费。YouTube
MTP3 稳,MTP4 可以试。 双 L20 的 A/B 里,MTP4 + O2 + 8192 是唯一同时改善单流输出和缓存输入的简单配置。知乎评论区也有老手直接给结论:MTP 固定开 3 最快。哔哩哔哩不想折腾就从 3 开始。
搭配"关思考"一起用。 Qwen3.8 默认的 xhigh 推理深度是另一个大坑,评测者的建议是把 reasoning_effort 设为 low 或直接关闭。知乎MTP 解决"输出慢",关思考解决"想太多",两个开关一起用,体感翻倍。AMD AI Max 用户在实测评论区也是同一句劝:强烈建议关闭思考再使用。哔哩哔哩
顺带一提:LM Studio 上已经能直接搜到带 MTP 草稿头的衍生量化版本,按显存选哪个量化档位,教程里也写得很明白。知乎

分层行动清单
24G 单卡(3090/4090/7900XTX,跑 Q4):先查 MTP 标志 → 草稿深度 5 → temperature 压低。参考基线:3090 实测 40~47 tok/s,5090 能到 60~100+。哔哩哔哩
双卡/服务器卡(2080Ti 魔改、V100、L20):vLLM 党从 MTP3 或 MTP4 + O2 开始做 A/B,收益普遍三成到一倍。
Mac(MLX/llama.cpp):M 系列统一内存对 MTP 天然友好,M3 Ultra 放心开。
12GB 及以下:别硬开 MTP,Q4 量化 + 关思考就够用;还想更快就换更小的量化或更小的模型。

最后泼盆冷水
软件调优再好,27B 稠密模型也抹不平和"只激活 3B 参数"的 MoE 之间的架构差距——同一台双 L20 机器上,Qwen3.6-35B-A3B 的 decode 能到 152 tok/s,3.8-27B 调到 71 tok/s 还是追不上。知乎调优是在同一块硬件上榨水分,不是改物理。
所以预期要摆正:追极限速度跑 agent,"小 MoE 跑腿 + 27B 稠密做质量任务"是更现实的组合;如果你要的是 40~60 tok/s 的可用体感,Qwen3.8-27B + MTP 已经是这个量级开源模型里的最强解。
还有两个值得持续盯的信号:一是 MLX 和 llama.cpp 社区还在针对 3.8 快速优化,这是刚打开的优化空间,一个月后的速度和今天会不一样;二是专治痛点的衍生版本开始冒头,针对"思考太长"的思考压缩版 Cold-Fusion 已经有人做了完整测评。哔哩哔哩等不及官方更新的可以先尝鲜,但注意和 MTP 草稿头的兼容性。