海外这几天疯传一个以假乱真的玩笑:Anthropic CEO 得知一个 27B 模型在 LiveCodeBench 上得分超过 Opus 4.6 Max、还能在一张 900 美元的二手显卡上离线运行后,紧急要求与立法者开会。36氪
玩笑的主角,是 8 月 14 日开源的 Qwen3.8-27B。开源不到 12 小时,它就进入 Hugging Face 历史最受欢迎模型 TOP4 并登顶 Trending 榜首;开源两天,下载量突破 100 万次,社区自发贡献了约 500 个量化版本。36氪
但社区口碑在五天里裂成了两半:一边喊 agent 能力强到可以改名 qwen3.8-coder-27b,一边骂通用任务净退步。对已经在本机跑着 Qwen3.6-27B 的人来说,真正要回答的问题只有一个——该不该卸载 3.6 换上 3.8?我把这五天 B 站、知乎、评论区里的实测吵点整理成三个升级、两个争议、一份避坑清单,看完你再决定。
一、三处真升级:社区吵完之后剩下的共识
1. Agent 编程:从帮你写代码,变成给你交项目。B 站实测视频评论区里传播最广的一个案例:有用户让模型写坦克大战小游戏,只随手加了一句需要自测,3.8 没有像 3.6 那样只把代码重读一遍,而是自己安装无头浏览器、写测试脚本运行、截图分析问题,再一点点修复报错,最后交出来的是能直接跑的版本。这位用户说,这一代 agent 能力和代码能力确实非常强,感觉远远甩开了 3.6 27B,甚至觉得模型可以改名叫 qwen3.8-coder-27b。哔哩哔哩
官方评测给出了同一方向的证据:Agent 编程评测 SWE-bench Pro 上,Qwen3.8-27B 以 8.3 分的优势超过 Claude Opus 4.6 Max;Terminal-Bench 2.1 得分 73.0,前代只有 63.4;办公任务 JobBench 从 21.8 提到 33.4。知乎

2. 前端与网页生成,肉眼可见地变强。有连续用了两天的用户对比,前端编写能力变强很多,美观也比 3.6 强不少。哔哩哔哩36氪的拆解也提到,Qwen3.8-27B 在多数测试中的表现明显超出其参数规模,尤其在网页生成、3D 场景和游戏开发上表现突出。36氪评论区甚至有人拿它一句话生成 120 平方米的 3D 户型图 HTML,一次跑通,只有一处卧室朝向的小瑕疵。
3. 多模态从外挂变原生。Qwen3.8-27B 是原生多模态稠密模型,图像、视频理解直接内置,官方基准里单列了计算机操作、移动端操作等多模态项目,这也是它和上一代拉开身位的地方。36氪

二、代价:雷霆大思考,烧时间也烧上下文
先说最出圈的槽点。默认设置下,3.8 的推理强度 reasoning_effort 被拉到了最高档,有知乎作者实测,一道简单题让它空转 21 分钟、烧掉两万多 token,他的结论很直接——模型强不代表默认好,先调档,再下判断。知乎另一篇部署实测也印证了这一点,Qwen 官方文档写得清楚,模型默认使用的就是 xhigh 推理强度。知乎
过度思考的真实成本,社区有人算过账:一个计算线段距离的小问题,32G 显存、Q6 量化、25tokens/s 的机器,硬是跑了 30 分钟、吃掉 50k 上下文才做完,当事人直言最大的问题就是太啰嗦,思考浪费的时间和上下文太多。哔哩哔哩更常见的翻车姿势是:思考还没结束,上下文先见底了,正事没干完就被迫终止。
速度也别指望白捡。有长期开 MTP 投机解码的用户实测,他一直用最新版 llama.cpp 并开着 MTP,3.8 的接受率普遍低于 3.6,最终解码速率还要再低一点。哔哩哔哩也就是说,同配置下解码体验和 3.6 大体持平、略有回落,指望明显提速不现实。
三、两个争议场景:证据还没吵齐
争议一:一次性写代码,是不是退步了?负面样本集中在低精度量化上:有用户发现 3.8 编程很容易出 bug,Qwen3.6 27B 一次跑通的代码,到 3.8 要重写才能修复。哔哩哔哩注意他的配置:4090D 跑官方 Q4_K_M 量化,这个细节很关键。
因为同一位用户把量化换成高精度后立刻改口:Q8 很强,真的强,Q4K_M 出现的 bug 都不会出现,前端也很美观。哔哩哔哩把两条放在一起,结论更接近 3.8 对量化精度更敏感,而不是编码能力本身退步——显存够的话,尽量往 Q8、Q6 选。
争议二:通用任务净退步?一位主打通用任务(非编程、非 agent)的用户给出了最尖锐的差评:3.6 能得出正确结果的任务,3.8 直接挂了,在他的测试范围内完全是净退步。哔哩哔哩注意,这是目前的孤证,当事人自己也说,他用的场景大概就是官方做了取舍牺牲的部分。证据只有一条时,先记下、别下结论。
四、迁移避坑清单:从 3.6 切过来要改的 6 件事
社区五天踩出来的坑,基本都在这张清单里:
换聊天模板。3.6 时代的模板和调教话术不能原样照搬,评论区有人专门提醒要默认开中等思考,因为 v21.3 模板是针对 qwen3.6 27b 的,新模型要切到随模型附带的新版 chat_template_jinja。哔哩哔哩
把推理档位调成 medium 起步。有用户把默认档设成 medium 后感觉良好,速度和 3.6 27b 差不多,思考质量没有下滑,只有复杂问题再切 xhigh。哔哩哔哩
按显存选量化。24GB 显存的甜点选择是 UD-Q5_K_XL,Unsloth Dynamic 的 5-bit 混合精度版本,能把模型体积压缩至约 19GB,恰好可以在 24GB 显存的消费级显卡上完整加载,还留有相当的上下文缓存空间;Q4、Q3 版本能进 16G 甚至 12G 设备,但稳定性和 Q8 有明显差距。知乎
24GB 卡的上下文要做取舍。有 4090D 用户的实测很典型:24G 显存上下文不足的问题严重,要关闭 MTP、视觉二选一,才能跑 64k。哔哩哔哩想要长上下文,要么牺牲 MTP 或视觉,要么上更大显存。
多模态记得带 mmproj。如果要使用模型的多模态能力,mmproj 文件必须下载,只下权重不下它,视觉功能直接缺席。知乎
大显存玩家直接抄作业。双卡 2080Ti 魔改版开 256k 上下文还剩 8G 显存,用 Q6_K 量化、MTP 开到 3,速度大约 60-40 tok/s 衰减,编程很少遇到 bug,但思考比 3.6 长太多。哔哩哔哩
下面这张社区汇总的多 GPU 优化实测表,可以直接当我的卡能跑多快的对照手册:

五、三条路:按你的用法选
主力写代码、跑 agent 的用户:现在就升。这一侧的提升是实打实的,量化按显存取高。17GB 的 Q4_K_M 版本,在 128GB 内存的 M5 Max MacBook Pro 和 DGX Spark 上用 LM Studio 加载同一份权重都能跑,显存富余的台式机直接上 Q8、Q6。知乎

日常以聊天、总结、通用任务为主的用户:再等等。通用任务退步的争议还没吵完,而社区已经在盯一个更省显存的选项:阿里官方已经把 Qwen 3.8 35B A3B 从 Modelscope/ms-swift 注册表中删除。哔哩哔哩先注册又撤下,通常是发布前的常规操作,留着 3.6 等 35B 不亏。
拿不准的用户:双持。llama-server 可以同时开两个实例、各绑一个端口,编程需求路由给 3.8,日常闲聊留给 3.6,代价只是显存和硬盘空间。对还在观望的人,这是成本最低的验证方式。
六、背景音:DeepSeek 涨价,本地这笔账要重算
昨天凌晨,DeepSeek 悄悄改了一张价目表,缓存命中输入价从每百万 Token 0.025 元涨到 0.3 元,涨幅 1100%,这不是一次普通调价。知乎同一天起,DeepSeek 官方价格页显示 V4 Flash 与 V4 Pro 均采用峰谷两档计费,谷时为峰时半价,V4-Pro 也同步转正商用。知乎对重度依赖 API 的人来说,这是真金白银的成本上涨;对本地部署玩家来说,这是一个提醒:显卡的一次性投入加上趋近于零的调用边际成本,又一次成了值得认真算的备选方案。连 Mac 用户也有现成路线,有用户在 128GB 内存的 M3 笔记本上部署 DeepSeek V4 Flash 量化版,生成速度每秒约 25 tokens,个人使用完全流畅。知乎
后面值得盯三个信号:一是官方托管服务,README 已写明 Qwen3.8-27B 将上线带默认 1M 上下文、官方内置工具的托管版本,官方原话是服务即将上线。魔搭ModelScope二是 35B A3B 是否正式发布;三是社区能不能把通用任务退步复现成多样本结论。
一句话收尾:写代码跑 agent 的,今天就值得换,记得换模板、降档位、量化取高;聊天为主的,先别卸载 3.6,让子弹再飞一会儿。