这一周的大模型圈,Qwen3.8-27B 把社区吵成了对立的两派。
8月14日,这个 27B 参数的开源权重模型发布不到 48 小时就冲上 HuggingFace 趋势榜第一。知乎它在 Artificial Analysis 的 Intelligence Index 上拿到 52 分,与 GPT-5.6 Luna 同分,开源权重里只有 53 分的 DeepSeek V4 Pro 和 GLM-5.2 略高一头,而这个指数综合了 GDPval-AA、Terminal-Bench、SciCode、Humanity’s Last Exam、GPQA Diamond 等 9 项评测。知乎知乎上有人给这个分数起了个名字:模型斩杀线。
而在 B 站,一条标题为「Qwen3.8-27B劝退,对普通用户没意义。」的视频收获了 80 多条评论,成了反方声量最大的声音。哔哩哔哩
是斩杀线,还是劝退?把两边的证据都过一遍之后,我的结论是:两边可能都对,因为他们说的是两件事。
这 52 分的含金量有多少

先说清分数本身。Intelligence Index 不是单一考试,而是 9 项评测的综合得分,考的是真实工作能力,不是聊天流畅度。这个分数意味着:一个自己电脑能跑的本地模型,第一次踏进了原本只属于闭源前沿模型的分数区间。
更值得咂摸的是一组对比:53 分的 DeepSeek V4 Pro 总参数约 1.6T、每 token 激活约 49B,而 Qwen3.8-27B 只有 27B。用约六十分之一的参数量打出几乎相同的分数,这才是 52 分真正的含义。知乎
再看它的出身:发布前一周的 8 月 13 日,阿里刚开源了 2.4 万亿参数的 Qwen3.8-Max,那是千问首次开源 Max 级别模型。36氪27B 是同系列的小尺寸版本,Apache 2.0 协议发布,原生支持图像和视频理解,上下文窗口 262144 token、可扩展到 100 万。ModelScope

它是怎么追平的?拿速度换的
这是两派分道扬镳的岔路口。社区高赞评论说得很直白:27B 是靠雷霆大思考弥补参数量劣势,牺牲速度才打平了 opus 4.6。翻译一下:这个模型用更长的思考链补参数量的不足,智力追平了,代价是时间。
全网实测都在佐证这个判断:
社区「屎山考核」遗留代码测试里,它能交出和 Opus 4.6 一个水平的活儿,UP 主原话是「虽然它确实慢,确实啰嗦,但它和Opus4.6一样,也能把活儿,交出来了」,但总任务时间要长好几倍。哔哩哔哩
一篇小红书避坑指南的第一句就是「如无必要,关闭思考功能!!!」——关掉思考,速度立刻回到能用的水平,但那恰恰是换回 52 分的部分。小红书
和 GPT-5.6 同题做塔防游戏的对比测试,结论类似:「总的来说,qwen3.8作为一个27b的模型,能做一些简单的工作,但不能要求太高,最大的问题就是慢」。哔哩哔哩
有知乎用户接进 VS Code 实测写贪吃蛇和俄罗斯方块:程序能跑、代码结构完整,但速度全看显存——纯 CPU 约 2.8 token/s,5060 混跑约 3.8~4.0 token/s,要到 24G 显卡才轮到讨论「怎么更快」。知乎

劝退派有一点特别值得听
劝退的理由里,有一条值得反复强调:这种小模型只有小规模本地部署有价值,拿去部署服务器,成本比 v4f 高、性能比 v4f 弱,没有竞争力。哔哩哔哩意思是,如果你打算租服务器、搭 API、给一堆人提供服务,Qwen3.8-27B 并不划算——它的单 token 推理成本高于 DeepSeek V4 Flash 这类大型 MoE。这个模型的意义,几乎完全建立在「自己本地部署、自己用」上:数据不出机器、token 不计费、断网也能跑。
没有这个前提,劝退派是对的;有这个前提,斩杀线派是对的。
所以谁可以试,谁别碰
综合全网实测,这条线能画得比较清楚了。
可以试的人:
有 24G 显存独显或 32G 以上统一内存——量化后权重约 13.5GB,还能给 KV cache 留出空间,这是本周社区实测出来的甜点位。知乎
主要任务不急:审代码、查 bug、整理文档、处理涉密材料,等得起 30 秒到 1 分钟。
有数据隐私刚需,或者受够了 API 计费——DeepSeek 8 月 17 日刚执行新价,V4 Pro 高峰输出从每百万 Token 6 元涨到 27 元、部分场景涨了 12 倍,「回村」本地的人肉眼可见地多了。小红书
别碰的人:
期待聊天软件那种秒回体验——思考模式会先把耐心耗光。
显存只有 8~16G、又不想折腾量化和 offload——混合推理 2.8~4 token/s 基本不可用,实测里一些 16G 卡也已经跑得叫苦连天。
每月 AI 用量很低——那云 API 的免费额度比电费更现实。

这个模型还在「长」
有三件事值得盯住:
提速:MTP 多 token 预测是它自带的,社区在它之上测草稿模型方案(DFlash2),已经做到「外加这点开销就能把本地生成速度拉高约5倍」。哔哩哔哩
量化:已经出现动态 1bit 量化版本,社区反馈准确率能保到 78.9%,这条路如果成立,显存门槛还会再降一档。哔哩哔哩
瘦身:评论区「下次来个9b的,27b还是太大了」的声音不少,第三方蒸馏的小版本也已出现。如果官方放出更小尺寸,劝退派瞄准的靶子就得换了。
一句话总结:52 分证明的是「本地模型也能摸到前沿智力」,速度争议证明的是「智力打平不等于体验打平」。你有硬件、等得起,这是第一次多了个「不租」的选项;没有,就继续用云 API——别为斩杀线上头,也别被劝退派吓退。