8月14日开源的Qwen3.8-27B,这几天口碑有点分裂。一边是不断刷新纪录的成绩单:开源仅仅两天,它就登顶了HuggingFace全球大模型趋势榜,下载量突破100万次。知乎海外开发者直接称它是能跑在家用电脑上的"本地Opus"。小红书
HF最新夏季报告给出的判断更直接:Qwen正在成为全球开源社区的基座模型。2026年前七个月,仅HuggingFace平台,Qwen下载量就达到20.45亿次,衍生模型突破15万个。知乎

跑分也站得住:在SWE-bench Pro上,Qwen3.8-27B拿下61.7分,超过了闭源旗舰Opus 4.6 Max的53.4;LiveCodeBench上90.3对88.8,同样反超。知乎

另一边,第一批真把它部署到本地的玩家开始吐槽:太慢了。一道简单题跑二十几分钟没结果,有人怀疑模型不行,想卸载。两边说的都是真的。问题不在模型能力,而在一个几乎没人注意的出厂设置:推理强度reasoning_effort,默认就是最高档xhigh。知乎
一只鹈鹕的账单
最典型的例子,是知名开发者Simon Willison在8月16日做的测试:他给Qwen3.8-27B出了个简单任务——画一只鹈鹕骑自行车的SVG图。默认设置下思考全开,模型花了21分钟,烧掉22,276个思考token,才产出3,223个token的正式输出。Simon Willison博客

产出质量确实好,Simon说这是他至今用本地模型生成的最好的鹈鹕SVG:自行车车架形状合适,鹈鹕两条腿都踩在踏板上,翅膀伸展开够到了车把。Simon Willison博客
但同一道题,把思考关掉重跑:3,715个token、137秒,不到两分半。同样一题,时间差9倍,推理token差6倍。知乎

这21分钟不是花在"想得更深",而是花在"想了不需要想的问题"。问题出在默认参数:reasoning_effort默认xhigh,每个问题都按复杂任务处理。小红书
出厂默认为什么拉满
这不是bug,是定位选择。Qwen3.8-27B一头连着云端API,负责复杂编程、长程研究这类重任务,官方跑分基本都是在最高档下跑出来的;另一头才是交给开发者自己部署的开源权重。默认拉满xhigh,能保证模型在任何榜单上都拿出最强的一面——但它不负责你笔记本上的体验。
本地硬件的吞吐和云端完全不是一个量级。这几天全网的实测样本:
MacBook M5 Pro 48GB自己编译llama.cpp跑,速度9 token/秒,思维链巨长。知乎
AMD APU无独显机器走Vulkan后端,6到7个token每秒,放今天真不算快,但完成度惊人。知乎
也有人在单台DGX Spark跑出256 tok/s的成绩(非量化版),但那是另一类玩家的设备。小红书
按9 token/秒算,光吐完22,276个思考token就要约41分钟纯生成时间;Simon实测21分钟,说明他的机器已经算快的。对大多数本地设备来说,默认最高档就是"地板油"——油门踩到底,速度上不去,时间先烧光了。
还有个隐藏坑:不同量化版本的思维链长度差异极大。同一段千行代码的分析任务,Q4_K_M量化版本思维链输出了66,834个token,Q4_XL版本只要12,991个,差出5倍多。知乎撞上"话多"的量化版本,默认档跑一道简单题奔着一小时去,太正常了。
调档方法:按任务选,别按情绪选
官方文档其实写明了,简单任务场景建议使用medium或low思考。Simon Willison的建议更直接:本地部署时把配置调成low甚至关闭思考,上下文拉到262K。小红书
结合这两天的实测反馈,整理一张可以直接抄的档位表:
你主要用它干什么 | 建议档位 | 原因 |
|---|---|---|
闲聊、翻译、格式整理 | 关闭思考或low | 直出就够,思考纯属浪费 |
日常写码、文档问答、看图分析 | medium | 速度与质量平衡,适合大多数人 |
复杂编程、多步agent、长程研究 | high/xhigh | 深度思考在这些任务上才真值钱 |
但档位不是越低越好。多步智能体任务里,把档位调太低,单次回复省了,失败和重试用得更多,总token反而上去。知乎Simon也试过关掉思考让模型写一个图片标注工具:工具写出来了,标注框位置却整个错位,一次没跑成。Simon Willison博客

另一个容易踩的坑:LM Studio默认8192的token上下文,长思考情况下直接占满,很容易导致结果错误。小红书而这个模型原生支持262K上下文,内存够就把上下文拉大,别让思考链憋死在8K里。
三件事,可以照着做
先判断任务,再定档位。写复杂代码、跑多步任务用高档;闲聊、翻译、格式整理直接关思考。
本地交互场景,把默认档调到medium或low,第一次跑通再往上加,别一上来就xhigh地板油。
把账算清。高档多花的token和时间,值不值这次任务的精度提升——本地跑模型的账本里,时间也是成本。
本地部署的诱惑,从来是数据不出门、边际成本约等于电费。Qwen3.8-27B第一次把旗舰级能力塞进个人硬件能抱走的尺寸,别让一个出厂默认设置毁了你对它的第一印象。降个档,再下判断。