Qwen3.8-27B这两天把本地部署圈彻底点燃了。Artificial Analysis给出的基准成绩是整体得分52分,与GPT-5.6 Luna(max)同分,还超过了上一代闭源的Qwen3.7-Plus。知乎社区给它起的外号也越来越夸张:叫它"斩杀线模型",还有海外开发者直接叫它"本地版Opus"。因为它开源才两天,Hugging Face下载量就破了百万,直接登顶全球大模型趋势榜。小红书到现在开源才4天,Hugging Face上已经有700多个量化版、100多个微调版,社区生态铺开的速度相当惊人。

但对已经把模型跑起来的人来说,真正的痛点只有一个:慢。这是一个27B的dense模型,Q4量化下24G显卡上20-40 tok/s是常态,小显存卡更是跌到个位数,离"丝滑"还差得远。不过就在过去48小时,社区接连放出了一套不换显卡的免费提速组合:Qwen3.8原生自带的MTP多token预测,加上8月20日刚开源的DFlash2草稿模型。结论先说:零硬件投入,速度普遍能提40%到1倍,4090用户可以从40+一路干到80 tok/s。下面按上手难度分三档说清楚,最后还有一个生产环境的坑必须泼冷水。
第一档:MTP打开就生效,免费提速30%~40%
MTP是Qwen3.8架构原生自带的能力:一次草拟多个token,再由主模型统一验证,猜对的部分直接保留,猜错的退回逐个生成,输出结果完全无损。换句话说,这是模型"白送"的速度,你只需要把它打开。
最直接的实测来自AMD平台:7900 XTX 24G跑Q4_K_M量化,生成速度从35.88 t/s提到39-47 t/s,提升10-30%,长会话也不再崩溃。知乎日志里能看到MTP的接受率:一次草拟4个token,平均接受3.96个,接近完美命中,这才是速度能拉起来的关键。N卡这边,有UP主在4090 24G上开MTP n=2,速度最高60+ Token每秒,不开MTP只有40+。哔哩哔哩
用法上分三种情况。Ollama用户什么都不用做,它默认就带上了MTP相关参数,这也是Ollama跑同一模型比裸llama-server快15%的原因;llama.cpp用户需要手动加参数;LM Studio更简单,设置界面里可以直接配置显存卸载层数、KV cache量化和MTP推测解码,点点鼠标就行。

顺手再给两个配套参数。一个是–context-shift:上下文满时自动丢弃最旧内容,新消息始终能完整处理,长会话党必开,不然跑着跑着就崩。另一个是–jinja,可以控制思考强度,还闹出过一个梗:有人让Qwen3.8优化llama.cpp参数,它坚持要加–jinja,DeepSeek说不必要,两者各执一词吵了一架,最后Qwen3.8对照GitHub源码把DeepSeek说服了。知乎不想让模型动不动就深度思考几百个token的,把这个参数用起来。
第二档:再挂一个DFlash2草稿模型,免费翻倍
如果说MTP是开胃菜,8月20日开源的DFlash2就是主菜。先一句话解释投机解码:找一个小模型抢答,先快速猜出一整块token,大模型一次性验证,猜对的保留、猜错的丢弃——验证是严格的,所以输出无损,纯粹赚速度。
IncoAI这次开源的DFlash2,就是专门给Qwen3.8-27B配的"抢答搭档":参数量1.92B、约3.85GB,GGUF的Q4_K_M版本只有1.1GB,Apache 2.0协议,商用也没问题。别小看这1.1GB的额外开销,有实测能因此把本地生成速度拉高约5倍。哔哩哔哩
官方口径也很硬:在单张NVIDIA H200、SGLang、并发1的条件下,Qwen3.8-27B配合DFlash2,输出吞吐达到自回归解码的2.7-3.4倍。知乎五个基准上的平均接受长度是4.80,高于Qwen3.8原生MTP的4.28,也高于社区另一个草稿模型DSpark的3.62——也就是说它和MTP同场竞技还能赢,而且解码结果无损。
落到消费级显卡上:4090 24G本地部署,Qwen3.8-27B Q4量化加DFlash2,能跑到80 Token每秒,相比不开MTP的40+正好翻倍。哔哩哔哩需要说明的是,网上流传的"提速5倍"主要来自GSM8K这类问答基准,接受长度能到5.13-5.39,属于高接受率的个例场景;日常混合任务请按翻倍来预期,不要被标题带偏。

门槛也要说清楚:llama.cpp那边的PR #27342还没合并,现在想上得自己编译分支源码,编译后一条serve命令就能上手。哔哩哔哩SGLang、vLLM、TensorRT-LLM这些服务端框架对DFlash系列已经有支持,服务器用户不受这个限制。知乎另外提醒一句:草稿模型本身也要吃显存,Q4_K_M版1.1GB不算多,但显存本来就卡在边缘的,算账时别漏掉它。
第三档:量化和引擎选对,还能再赚一截
速度和能力的平衡,社区这几天也吵出了结果。有团队在4张4090上把NVFP4和FP8两个量化版本做了同题实测:550题基准的平均分只差0.70个百分点,可以认为能力等同。知乎换句话说,不用为了"FP8是不是更聪明"纠结,两者智商基本一致。
差别在速度结构上:FP8的矩阵乘在prefill阶段占优,那是算力瓶颈;NVFP4的优势在decode,那是访存瓶颈。所以该测试给出的路由建议很直接——默认用NVFP4,输入超过150K token或者带图片的场景换FP8。黑卡用户的上限可以看一下这个成绩:RTX PRO 6000上NVFP4加SGLang,decode跑到219 t/s。小红书

预算有限的路线也都有人趟过了:3080魔改20G在100K上下文、KV Q8的设置下,prefill有1100,生成速度39 t/s。哔哩哔哩双RTX 5060Ti也能跑到60 tok/s。哔哩哔哩8G显存的极限路线,Unsloth有对应的极限压缩方案,本文不展开,感兴趣可以去搜。
泼一盆冷水:这些提速的前提是单并发
上面所有好看的数字,都有一个共同前提:你是一个人用,单并发,自己慢慢聊。一旦上生产、扛并发,结论会整个反转。有一份H20单卡加vLLM的生产向实测:输入2K、并发8时,标准配置和KV-fp8都能跑到220+ tok/s,MTP=3只剩93,输出吞吐减半还多。知乎输入8K、并发8时更惨,MTP只剩28.8 tok/s,是标准配置的三分之一——投机解码的"投机"在混合负载下完全成了负资产。所以如果你是要部署服务给多人用,请把MTP和草稿模型都关掉,直接按标准配置跑。
另外两条预期管理。第一,llama.cpp的PR还没合并,不想折腾编译的人不用焦虑,按社区节奏等一周左右,量化站和一键包大概率都会跟上。第二,连最乐观的体验者也承认短板:Simon Willison完整本地实测后的评价是,能力已经能碰到几个月前最强闭源模型的边,但速度还没快到让他每天打开当主力模型。小红书提速组合能大幅缩小这个差距,但"本地主力"还差最后一口气。
那到底还要不要换显卡?
按手里的设备对号入座:
你的情况 | 建议路线 | 参考速度 |
|---|---|---|
24G显卡(4090/7900XTX) | 先开MTP,再上DFlash2 | 40→60→80 tok/s |
16G级显卡 | 双5060Ti组双卡是性价比参考 | 约60 tok/s |
3080魔改20G | 100K上下文+KV Q8可用 | 约39 t/s |
Apple Silicon | oMLX/llama.cpp+DFlash2,瓶颈在内存带宽 | M5 Pro 48GB实测14-16 t/s |
8G显存 | 走Unsloth极限压缩路线 | 另议 |
Mac用户单独说一句:Mac跑27B的瓶颈从来不是芯片算力,是内存带宽,所以提速空间比N卡小。M5 Pro、48GB统一内存上已经有人实测跑通了多个后端、多个量化和DFlash2组合,结论是能跑、但不建议当主力生产机。知乎Mac Studio M2上也有人跑出33T/S,日常使用够用,前提是不要太着急。哔哩哔哩

对24G卡用户,我的判断是:换卡可以先缓一缓。免费组合能把40+提到80,这个提升已经接近一档硬件升级的效果,而代价是零元加一个下午的折腾时间。接下来三个信号值得盯住:一是llama.cpp的PR #27342合并、官方编译版和量化站跟进,那时上DFlash2就是一键的事;二是vLLM、SGLang对DFlash2的支持进一步成熟,服务端玩法会更多;三是Qwen3.8 Max——2.4T总参数的MoE旗舰,官方计划下周发放权重。小红书到时候本地圈大概率又是一轮地震,值得提前把环境准备好。
最后留个互动:你现在用什么卡跑Qwen3.8-27B,开了MTP之后能到多少速度?评论区报一下显卡+速度,给还在观望的人一个真实参考。