8月14日,Qwen3.8-27B 正式开源,Apache 2.0 协议,可商用。知乎小红书到现在不到一周,本地模型圈已经热闹得不像话。
逛 r/LocalLLaMA 和 GitHub,满屏都是这个 27B 稠密模型的身影。知乎B站那条"一张4090就能跑"的视频,播放量已经冲过7万。哔哩哔哩"本地 Opus"的标题满天飞。
但在你冲下去装它之前,我想先问个泼冷水的问题:它"打败 Opus"的证据,到底成色如何?我把知乎、B站、小红书、微博和海外社区的讨论与实测翻了一遍并交叉核对,结果比标题有意思得多。
先审一遍"打败 Opus"的证据
传得最广的一份证据,是 Qwen 官方 model card 里的 benchmark 自评表。乍看很唬人,细看有三个问题:对照的是 Opus 4.6 Max,不是 Opus 5;是 Qwen 修正过任务集之后重跑自己的模型,而引用的 Opus 分数却是标准题目集的官方数字,不是同一把尺;而且 SWE-bench Pro 这一列分数最弱,却传得最火。截至8月中旬,没有任何独立实验室复现过官方这份质量分数。知乎
那就看目前唯一对所有模型用同一把尺的第三方 Artificial Analysis。Qwen3.8-27B 的 Intelligence Index 整体得分 52,与 GPT-5.6 Luna(max)同分,确实超过了上一代闭源的 Qwen3.7-Plus。知乎但只险胜对手 Terra 0.676 分——是险胜,不是碾压。知乎

AA 还测出了一个容易被忽略的成本项:Qwen3.8-27B 完成单个任务平均消耗的 token,大约是上一代 Qwen3.6 的 2 倍。知乎一部分分数是靠"想得更久"换来的,如果你按 API 调用计费,这笔思考 token 的账要算进去。
还有一份值得说的严格公开对照:John Ring 的《The Gap Between Claude and Local》,用真实的 Laravel 项目从零设计实现整套 Playwright E2E 测试,让 Opus 4.7 和 Qwen3.6-27B 同题各做一次。结论是:本地模型纯计算反而更快,但 Claude 的覆盖率高得多——Qwen 需要人推 7 次,Claude 只要 1 次。知乎注意这场对照用的是 3.6 不是 3.8,而 3.8 官方宣称改进最大的恰好是 agentic 自主性,所以它只能作为"差距方向"的参考,不能直接套用。
再看它实际能干什么活
跑分争议放一边,社区的实测数据要有价值得多。知乎有位作者用 5070Ti 16GB 做了一整套硬核实测——全程 3-bit 量化,测试代码、原始数据和图表全部开源。知乎结论很有代表性。
用带 4 个工具的 ReAct agent 修 QuixBugs 题库的 bug:大部分能修对,在需要同时追踪多个状态不变式的题目上摸到天花板,但它不会乱改——沉默比自信地说错更安全。知乎这个性质对 agent 框架很友好:harness 抓得到"没回答",而"自信地答错"会悄悄污染下游。

数学题实验更有意思:纯推理 8 道对 4 道,给一个 Python 工具后变成 8 道全对,耗时从 406 秒降到 123 秒,token 消耗少了近一半。而且失败的四道题全部是"答不完"——输出撞上 8000 token 上限——没有一次给出错误数字。给工具比给推理预算划算,要精确计算就接 code interpreter,别去调 max_tokens。知乎

代码生成让它做了三次完整俄罗斯方块游戏:语法检查、功能检查、实际加载全部通过。生成速度在这台机器上是:聊天 80 tok/s,agent loop 113 tok/s,差了 41%。原因是 MTP(多 token 预测)在 JSON、代码这类结构化输出上命中率更高——所以拿聊天去测本地模型的速度,会系统性低估它干活时的表现。

本周最大的吐槽,可能骂错了对象
"思考太长"绝对是这周社区最大的抱怨:Simon Willison 的测试里,一个 2 分钟的任务硬想了 21 分钟。小红书B站几条"解决雷霆思考"的视频加起来播放量上万,思考压缩版(Cold-Fusion)这样的社区版本也已经出现。哔哩哔哩哔哩哔哩
但前面那套实测给了另一个视角:在 agent loop 里用同一道修 bug 任务、三种 reasoning_effort 各跑十次,成功率基本一致。过度思考主要发生在"没有外部反馈的一次性生成"——让它画只鹈鹕,它没有任何办法知道自己画得对不对,只能在脑子里一直推敲;而在 agent loop 里,每次 run_tests 的返回都是一个现实检查点,模型拿到客观信号就收手。知乎所以根治的办法不只是把思考档位调低,而是给模型找点事做。
还有一个 16GB 用户必踩的坑:网上几乎都推荐 4-bit,但 16GB 卡上 Q4_K_M 光权重就超过整张卡;IQ4_XS 勉强塞进去,权重会溢出到系统内存,每生成一个 token 都要过一次 PCIe,速度和 3-bit 差出约 300 倍。在这种卡上,不是"3-bit 还是 4-bit"的取舍,而是"3-bit 还是没有"。知乎所以"哪种量化更快"是个伪问题,真正的问题是:哪种配置能让模型全部常驻显存、并且开得起 MTP。
一条能带走的分流线
看完这些跨源数据,我的判断是:这个模型的定位不是"Opus 平替",而是"能塞进一张卡的最强工人"。知乎分流,不是取代:
可以搬给本地 27B 的活:规格明确、有测试可以验收的 coding 任务;有反馈闭环的 agent 流程;不想上云的代码;可以慢慢跑的批量任务。
建议留在云端 API 的活:repo 级推理、需求模糊要靠判断的长任务、三小时没人盯着的自主任务、深度知识问答。这些活上,它和顶级闭源的差距不在分数,而在"要不要人一直盯着"。
三条配置建议:给工具,别给预算——接上 code interpreter 或测试运行器,比调高推理强度划算得多;用测试验收,别用肉眼验收;它失败时先看是不是"答不完",优先加工具预算。
值得继续盯的信号:官方分数表有没有独立机构复现;3.8 的 agentic 自主性提升有没有社区实测跟上(目前严格对照还停留在 3.6);Cold-Fusion 这类思考压缩版能不能成熟。
这一次,千问确实把"一张卡能跑的最强模型"这道题端上了桌。它能不能抢走 Opus 手里的活,不看标题,看你让它干什么活。