上周四(8月14日)阿里把Qwen3.8-27B开源,本地部署圈直接过年:一周内Hugging Face点赞破万、月下载冲到170万+,社区量化版刷出700多个,知乎甚至出了个问题讨论它为什么被称为新的「模型斩杀线」——Intelligence Index跑出52分,跟GPT-5.6 Luna坐一桌。

但热闹归热闹,真正装到自己机器上的人,这几天在评论区问得最多的是另一件事:能跑,怎么这么慢?
有人8G显存笔记本上跑出来0.26 tok/s,一个字一个字往外蹦;也有人一张4090挂着110K上下文还能跑到90 tok/s+。哔哩哔哩知乎同一个模型,差出三百多倍。这周社区把原因基本摸清了,我把知乎、B站、小红书上这七八天的实测和讨论整理了一遍——先说结论:大部分人的慢,不是硬件不行,是设置问题。
慢因一:你的token,九成烧在了"打草稿"上
这是最反直觉的一条。一位3090 Ti用户做了个很扎实的实测:固定prompt下,模型一次输出312个token,其中286个是思考token,占92%,真正给你的回答只有26个字。知乎
Qwen3.8-27B默认开着思考模式,思考链和正文走同一条生成管线,速度一样——也就是说,你以为模型在"憋大招",其实它大部分时间在做你根本看不见的草稿。小红书已经有避坑帖在喊"如无必要,关闭思考功能"了。小红书
好消息是这个能调:模型提供reasoning_effort三档(xhigh/medium/low),LM Studio、llama.cpp这些主流引擎都能设。日常对话、改代码这种任务调到low或者直接关掉,体感速度的提升是立竿见影的。反过来,如果你要的就是深度推理,那这部分时间就是该花的,别关。
慢因二:MTP加速开关,默认是关着的
Qwen3.8-27B带了个多令牌预测(MTP)能力——一次猜后面好几个token,主模型批量验收。B站有搬运实测视频:打开这个设置,生成速度从60 tok/s干到167 tok/s,接近3倍,而且官方说法是无损。哔哩哔哩
坑在哪?llama.cpp里相关参数经历过一次改名,不少老教程的命令直接失效,导致很多人装完就是默认关闭状态,白放着不用。社区已经有人在专门做MTP参数实验了:在一台AMD锐龙AI MAX+ 395的mini主机上(Q4_K_M、Vulkan),结论是p-min取0.5整体最优;n-max不是越大越好,接受率会随档位升高往下掉,而且掉多少跟任务类型有关——代码类任务从93%掉到64%,数学类从91%掉到69%,中文写作最惨,65%掉到51%。知乎翻译成人话:MTP开了确实快,但参数别照抄,写代码和写文章的最优值不一样。
慢因三:量化没塞进显存,CPU在拖全队的后腿
27B是稠密模型,生成每个token都要把全部参数过一遍。只要有一层被挤出显存、落到内存里靠CPU算,整个生成速度就会断崖式掉——8G显存"能跑"但只有0.26 tok/s,就是这个原理。
16G显存这周有个很典型的翻车点:Ollama默认的Q4_K_M大概16.5GB,塞不进15.5GB实际可用的5060 Ti,只能分层offload,速度直接打骨折。有篇5060 Ti部署实测给出的解法是换IQ3_S(12GB)全量入显存,配合MTP预期30-45 tok/s,日常够用。知乎

再补一个容易踩的坑:量化版本只认名字不看体积会吃亏。同样是Q4_K_M,不同发布者的文件能差出2GB多(16.8/17.1/19.0GB),质量也天差地别。选文件看体积、看实测,别看名字。知乎
另外这代模型用了混合注意力架构,长上下文的KV缓存压力比传统模型小很多,实测大约256KB/token——8K上下文约2GB,32K约8GB。所以"模型体积+KV缓存+余量"三笔账都要算,别只看模型文件那一个数。知乎

慢因四:上下文和缓存,藏着你没注意的开销
同一台3090 Ti的实测里还有个有意思的数据:10K上下文的对话,首次生成TTFT(首token延迟)要9.3秒,但第二次只要0.23秒——因为KV缓存命中了。知乎真实多轮对话里每轮prompt都不一样,缓存吃不满,首字延迟就会明显。
还有位用户把优化经验写得很细:官方4bit量化(17.74GB)+ LM Studio,折腾一两天,从20-30tps优化到50-60tps,体感跟在线的DeepSeek V4 Flash差不多。他的发现之一是decode速度对上下文长度其实不敏感(10K只比裸测慢10%),真正吃时间的是思考链和prefill。知乎
这周的社区速度地图,一张表看懂
把散在各平台这周的实测数据拼起来,大概是这么个分布(同一模型,不同配置):
硬件配置 | 量化/方案 | 实测速度 | 备注 |
|---|---|---|---|
8G显存笔记本 | 默认 | 0.26 tok/s | 能跑≠能用 |
5060 Ti 16G | IQ3_S全入显存+MTP | 30-45 tok/s(预期) | Q4_K_M装不下需避开 |
3090 Ti 24G | 官方4bit + LM Studio优化 | 50-60 tok/s | 优化前仅20-30 |
双L20 | FP8 + vLLM + MTP调优 | 55→71 tok/s | 数据卡反而不占优 |
4090 24G | UD-Q4_K_XL + DFlash2投机解码 | 90+ tok/s | 挂着110K上下文 |
5090 32G | NVFP4 + dspark | 平均约90 tok/s | 特定任务比4090快约2.8倍 |
两个提醒:一是这表里的数字各家测试条件不同,只看量级、别抠小数点;二是双L20那份报告说了句大实话——27B稠密模型怎么调,也追不上3B激活的MoE(Qwen3.6-35B-A3B能跑152 tok/s),架构差距软件补不平。知乎要极限速度,选模型架构比调参数重要。
按动手成本排的行动清单
如果你已经部署了、就是觉得慢,按这个顺序来,性价比从高到低:
3分钟档:把reasoning_effort调低或关掉思考(不需要深度推理的场景);检查MTP是否开启。这两步可能直接翻倍。
30分钟档:算清"模型体积+KV缓存"这笔账,换一个能全量塞进显存的量化版本;16G卡重点看12-13GB档的量化,别硬上16.5GB的Q4_K_M。
折腾档:24G显存往上,可以试fp8+vLLM(双L20实测55→71 tok/s)或者DFlash2投机解码(4090实测90+)。但注意,DFlash2目前要靠llama.cpp的PR #27342自己编译,截至8月21日还没合进正式版,普通用户建议先观望,等合并了再上车。知乎

不建议做的事:因为"慢"直接去升级显卡。先把上面三档做完,再判断是不是硬件瓶颈——这周的数据反复证明,同一张卡优化前后差2-3倍是常态。
接下来值得盯的信号
llama.cpp的PR #27342什么时候合并:合并后DFlash2就是开箱即用的提速项,24G卡用户值得等。
Ollama、LM Studio什么时候把MTP做成默认开启:现在这个开关的默认状态,是很多人"慢"的源头。
官方会不会出更激进的量化指引:700多个社区量化版良莠不齐,同名不同质的问题还在那摆着。
你现在的配置跑Qwen3.8-27B是多少tok/s?评论区报个配置和速度,互相抄一下作业。