这两天 Qwen3.8-27B 的风评有点分裂。一边是 8 月 14 日阿里正式开源了这个 270 亿参数的稠密模型,官方说它是全球 AI 社区呼声最高的模型尺寸。微博另一边,部署视频的评论区里,不少人的第一反应是:怎么比上代还慢?有 4060 用户直接报出实测 3t/s。哔哩哔哩
比上代更聪明的模型,为什么在不少人的机器上反而更慢?这篇把稠密模型这笔"速度债"讲清楚,也给出社区实测过的几条提速路线。
先说变强了多少
按照 Qwen 公布的评测结果,Qwen3.8-27B 在 AgenticCoding、软件工程、长周期办公任务、竞争性编程和指令遵循等项目上,得分高于同一榜单中的 ClaudeOpus4.6Max。36氪提升集中在编程和 Agent 场景,这也解释了为什么第一批上手折腾的主要是写代码的人群。

为什么更慢:稠密模型的速度债
Qwen3.8-27B 的 BF16 权重约 55.6GB,官方另出了 FP8 版,社区的 GGUF 量化版 Q4 档位可以装进 24G 显存的卡。知乎门槛不算高,真正要还的账在速度上。参数量同样是 27B,这一代是纯稠密(Dense)架构,官方把两种架构的差别说得很直白:27B 稠密模型生成每个 token 时,全部 27B 参数都会参与计算;而 30B-A3B 这样的 MoE 虽然总参数约 30B,每个 token 实际只激活约 3B 参数。36氪翻译成人话:每生成一个字,27B 要把 270 亿参数完整搬一遍显存,MoE 只搬 30 亿。解码阶段受显存带宽约束,激活参数差了将近 9 倍,速度自然跟着差。

全网实测速度盘点
综合发布后这几天的社区实测,情况大致是这样(均为自测数据,量化方案和上下文长度影响很大):
显卡 / 配置 | Qwen3.8-27B 实测速度 | 备注 |
|---|---|---|
RTX 4060 | 约 3t/s | 社区自测 |
8G 显存 | 生成约 7t/s | 最低量化,随上下文变长还会减速 |
RTX 4070 TiSuper | 个位数 | 上代 3.6 Q4_K_M 有 50~60t/s |
RTX 3090 | 31.0 → 41.3t/s | 开 MTP 推测解码 |
RTX 4090 | 47.7 → 76.3t/s | 开 MTP |
RTX A6000 | 26.7 → 52.5t/s | 开 MTP |
RX 7900XTX | 30.7 → 43.9t/s | 开 MTP |
RTX 5090 Mobile | 36.7 → 50.9t/s | 开 MTP |
RTX 5090 | 200t/s 以上 | SGLang + NVFP4 |
2080Ti 22G 改卡 | 39.5t/s | llama.cpp 调参 |
Apple M3 Max | 18–20t/s | 本地直跑 |
上代 Qwen3.6-35B-A3B | 16G 显存稳定 120t/s | MoE,社区优化版 |
部署视频评论区的情况更直接:4070TiSuper 现在用起来 t/s 是个位数,而之前用 3.6 Q4_K_M 有 50~60t/s。哔哩哔哩2080Ti 22G 改卡靠调 llama.cpp 参数跑到 39.5Token 每秒。哔哩哔哩Mac 那边,M3 Max 实测在 18–20t/s 之间。小红书
路线一:MTP 推测解码,提速最立竿见影
Qwen3.8-27B 训练时就带了多 Token 预测(MTP),思路是一次提出多个候选 token,再由主模型批量验证,把逐字串行变成批量过审。发布几个小时后,社区就建了 qwen38-mtp 项目做 A/B 测试:同一张 RTX3090、同一份模型,解码速度从 31.0tokens/s 提高到 41.3tokens/s;RTX5090Mobile 从 36.7tokens/s 提高到 50.9tokens/s。36氪
llama.cpp 用户不用改模型,启动参数里加上 --spec-default --spec-type draft-mtp 就能开。知乎
更多开发者加入测试后,数据进一步被抬高:RTX4090 从 47.7tokens/s 提升至 76.3tokens/s,RTXA6000 从 26.7tokens/s 提升至 52.5tokens/s,AMDRX7900XTX 也从 30.7tokens/s 提升至 43.9tokens/s。36氪对消费级显卡来说,这是目前性价比最高的一项优化。
已经有 16G 显存用户反馈,3.8 自带的 MTP 开启后,速度能到五六十 token 每秒。哔哩哔哩

路线二:换引擎、换量化
推理引擎这边的动作也很快。SGLang 开发者在发布当天就开始测试如何把模型跑得更快,通过 NVFP4 等优化,单张 RTX5090 的解码速度已经可以超过 200tokens/s。36氪走 vLLM 路线的话,官方出了 FP8 权重,比 BF16 省一半显存。知乎高端新卡用户,引擎优化的红利远大于手调参数,值得等一等针对性适配的版本。
路线三:把思考档位降下来
Qwen3.8-27B 默认开启思考模式,reasoning_effort 分 xhigh、medium、low 档。档位越高,模型生成的 token 越多,而稠密模型每多想一个 token,都要完整参数陪着跑一遍。Hacker News 上有用户记录:Qwen3.8-27B 是继 Gemma4 之后第二个通过其私人推理测试的可本地部署模型,但消耗的 token 大约是后者的 5 倍,即使开启 MTP,整个任务仍耗时 12 分 30 秒。36氪日常多数编码和问答任务,medium 甚至 low 就够用,别默认顶着 xhigh 烧时间。
值不值得切换:看显存,也看你图什么
结合现有实测,可以做个简单对号:
8G 显存:不建议硬上。最低量化生成只有约 7t/s,还会随上下文变长持续减速,实测用户的建议是先用上代 3.6-35B-A3B,等后续版本。
16G 显存:紧张但可用。低量化加 MTP,上下文别贪。
24G 显存(3090 / 4090):27B 的主战场。Q4 GGUF 是首选,8K 到 16K 上下文起步,官方也认为这是最推荐的本地配置。知乎
48G+ 显存:官方 FP8 权重加 vLLM,适合跑服务、接 API。
Mac:Q4 加 llama.cpp 是现实的起点,Apple Silicon 端已经有开发者发起优化挑战,不到 16 小时把运行性能相对基线提高了 153%,下一步还计划把优化移植到 CUDA。36氪
一句话判断:显存小于 16G、主要图快的,老实用 Qwen3.6-35B-A3B,这颗 MoE 已经被社区在 16G 显存上优化到稳定 120t/s。哔哩哔哩24G 以上、主要写代码跑 Agent 的,3.8-27B 值得切,但要把 MTP 和量化一起配好,别用默认设置直接开测。
值得继续盯的信号
部署视频的评论区里,已经有人在问:Qwen3.8-35B-A3B 会出吗。哔哩哔哩这个问题恰恰戳在速度债的关键处:社区真正在等的,是 3.8 的能力加上 MoE 的速度。眼下 NVIDIA、AMD、平头哥、沐曦、联发科、摩尔线程等芯片厂商很快完成适配,vLLM、SGLang、Ollama、LMStudio 等推理和本地运行工具也第一时间跟进。36氪
接下来一段时间可以盯三个信号:官方会不会出 3.8 的 MoE 版本、MTP 会不会成为主流推理引擎的标配、Apple Silicon 的优化成果能不能进常用工具。稠密模型的速度债,本质上是靠社区工程来还的——开源五天,4090 已经从 47 提到 76 token 每秒,这个节奏值得等一等。