Qwen3.8-27B开源第4天,口碑出现了一个有意思的现象:一边有人说它是"本地版Opus",另一边吐槽"慢得要死,什么都深度思考,根本没法用"。
我把知乎、B站、小红书和海外博客这两天的实测都翻了一遍,交叉对了各家的速度数据,结论其实挺一致:很多差评不怪模型,怪默认设置。社区这4天基本达成了共识——Qwen3.8-27B很强,但不能拿默认设置直接上手。
默认设置有多夸张:画一张图21分钟
Simon Willison(Django联合创始人,长期玩本地模型的老手)在M5 Max MacBook Pro上用LM Studio加载17GB的Q4_K_M量化版,默认设置,让模型画一张"鹈鹕骑自行车"的SVG图。
结果跑了整整21分钟:光思考用掉22276个token,最后输出3223个token。知乎Simon Willison博客同一条提示词,关掉推理再跑:137秒,输出3715个token,图画完了。

更经典的是他让模型"画一个圆",默认设置下模型开始认真设计:配色用什么方案、要不要包豪斯风格、加不加旋转动画、要不要兼容prefers-reduced-motion……一个一句话的需求,被它做成了大工程。
原因很明确:Qwen3.8-27B默认推理强度是xhigh(最高档),思考模式默认打开,官方模型卡提供了reasoning_effort参数来调推理深度。这个配置对复杂任务是好事,对日常对话和简单任务就是纯浪费。更麻烦的是LM Studio默认上下文只有8192个token——问题再简单,token也全被思考占满,直接卡住。
这不是个例。B站高赞评论说"这个模型干活相当狠,就是思维链也比较狠"。哔哩哔哩小红书有人直接开帖《千问3.8-27B很好,但默认过度思考》。小红书还有人在DGX Spark上跑NVFP4量化,评价是"确实思考得天荒地老"。
下载之后先改这3个设置
设置一:把推理强度降下来。官方模型卡其实给了三个开关:reasoning_effort调推理深度(默认xhigh是最高档,往下有medium和low)、enable_thinking直接关掉思考、preserve_thinking控制多轮Agent任务里要不要保留之前的推理过程。ModelScopeWillison的建议很直接:第一次用,先把reasoning_effort调到low,或者干脆关掉推理。但这里有个反直觉的坑:他关掉推理后让模型写一个图片边界框可视化工具,结果边界框位置写错了;开着推理时一次写对。知乎所以更稳的用法是按任务分配——日常聊天、翻译、简单问答用low或不思考,复杂代码、数学题、Agent任务再开回高档。别指望一套设置通吃。

设置二:把上下文长度拉大。LM Studio默认8192,建议直接拉到262144(模型卡原生上下文,官方还允许扩展到100万)。这一步解决"token全被思考占满"的尴尬。但注意:如果你是24GB显存用vLLM部署,别拉满。社区实测的syv-ai方案只开150k,因为逼近19.5万左右的实际上限时,一条超长请求就会吃掉整个KV缓存池,其他请求全排队。知乎
设置三:开启MTP投机解码。Qwen3.8-27B自带多token预测(MTP)头,这是目前确认的最大提速杠杆。Willison按llama.cpp作者Georgi Gerganov给出的方法,在DGX Spark上加–spec-type draft-mtp实测,比LM Studio默认GGUF快了约72%。a comparative benchmark on the Spark and the --spec-type draft-mtp server outperformed the LM Studio default GGUF by around 72%.Studio default GGUF by around 72%." data-highlight-text="server outperformed the LM Studio default GGUF by around 72%">Simon Willison博客B站评论区也有人报告:开启MTP后16GB显存能跑到五六十tok/s。哔哩哔哩
到底能跑多快:一份跨源速度参考
把这两天各平台的实测速度整理在一起。所有数字都绑定具体硬件、量化和框架,别跨行直接比:
硬件 | 量化/框架 | 实测速度 |
|---|---|---|
RTX 5090 | NVFP4 · SGLang | 超200 tok/s(SGLang开发者发布当天实测) |
M5 Max MBP(128GB)/ DGX Spark | Q4_K_M · LM Studio | 约15–30 tok/s,开MTP约快72% |
AMD 7900 XTX 24GB | workbuddy | 约62 tok/s |
RTX 3090 24GB | vLLM+int8嵌入层(省2.6GB) | 单流MTP 82 tok/s;64并发417 tok/s |
RTX 2080Ti 22G改装 | AWQ INT4+MTP | 39.5 tok/s |
RTX 3080 20GB | Q4_K_M · 32k上下文 | 约29 tok/s |
M3 Max MacBook | 本地实测 | 18–20 tok/s |
8GB显存 | 最低量化 | 生成仅7 tok/s,不推荐 |
另外两个提醒:一是"最低8GB显存就能跑"的说法已被实测打脸——8GB卡跑最低量化,生成只有7 tok/s,还随上下文变长持续减速,"能跑"和"能用"是两回事。二是别被生成速度遮住预填充:10万token输入在3090上预填充约795 tok/s,首token要等两分钟左右。知乎做长文档问答,先考虑文档裁剪和摘要缓存,别一股脑全塞进去。
一个预期管理:它比上代MoE慢,是架构决定的
很多人下载后才发现:上代Qwen3.6-35B-A3B是MoE架构,只激活3B参数,解码天生快(有人跑40-60 tok/s);这代27B是稠密模型,全参数激活,同样硬件上解码速度明显下降。B站有评论很直白:“4080跑这个很难受,速度不如3.6 35B A3B。”
所以取舍逻辑很清楚:这代27B是用速度换更高的能力上限。官方基准把幅度写得很具体:Terminal Bench 2.1(智能体终端编程)73.0分,上代Qwen3.6-27B是63.4,连闭源的Qwen3.7-Plus也只有64.0;LiveCodeBench v6等编程项目上,它还高于同榜的Claude Opus 4.6 Max。36氪

追求吐字飞快的,可以等社区在传的MoE版——评论区都在问"Qwen3.8-35B-A3B会出吗",但目前没有官方消息,别当承诺等;或者先用上代A3B。
谁现在该下,谁该等等
适合现在就下的:有24GB显存或64GB以上内存Mac、愿意动手调参的玩家;需要高强度跑Agent、对数据隐私有硬要求的个人和小团队。在DeepSeek API都开始峰谷定价的当下,本地跑27B的成本逻辑更成立了。
建议再等等的:一个参数都不想碰的用户。这4天工具链一直在修补状态——社区在修vLLM的MTP、修上下文默认值、量化版本之间的表现差异也还在吵。接下来几周提速方案只会更多,MLX社区大概率不会缺席。Simon Willison博客模型已经开源,开源不到12小时就进了HuggingFace历史最受欢迎模型TOP4,两天下载破百万、社区贡献的量化版本已有约500个,没什么可焦虑的。36氪

后续值得盯三个信号:llama.cpp是否默认启用MTP、官方推理框架会不会给出统一推荐配置、MoE版本是否落地。这三件事齐了,才是Qwen3.8-27B真正"开箱即用"的起点。