上周四晚上(8月14日),阿里千问把 Qwen3.8-27B 的权重开源了,Apache 2.0 协议,个人、企业都能免费商用。智东西到了周末,海外社区直接炸锅:r/LocalLLaMA 的口径出奇一致——“3.8 比 3.6 能自己往下走”,最爱提的两个词是 No Handholding(不用手把手盯着)和长上下文不再 CoT 死循环;Hacker News 上更夸张,有人直接喊出 frontier-tier(前沿级)。知乎
但国内老玩家明显冷静得多。知乎有人把话说得很直白:新品头一周超强、一周后降智,得"过一周再磕头"。知乎模型到底行不行,我劝你先别急着下结论——咱先把更实际的账算了:这是个 270 亿参数的稠密模型,你的显卡,真的跑得动吗?
先花30秒搞清楚它是什么
简单说,Qwen3.8-27B 是把 Qwen3.8 系列的能力塞进一个好部署的身材里:270 亿参数 Dense 架构,原生多模态(能看图、看视频),原生上下文 262K,用 YaRN 可以拉到 100 万 tokens。智东西架构上用了 Gated DeltaNet + Gated Attention 混合结构,还带 MTP(多步预测)加速——这个后面讲速度时会用到。

跑分确实是它引爆社区的原因。官方测试里,SWE-bench Pro 拿了 61.7 分,高于 Claude Opus 4.6 Max 官方自报的 53.4;LiveCodeBench v6 是 90.3 对 88.8;多模态软工的 SWE-MM 是 38.6 对 27.1。智东西但注意,翻车项也有:Terminal Bench 2.1(73.0 对 78.2)、GPQA Diamond(89.2 对 91.3)、HLE(30.8 对 40.0)都落后。更关键的是,这些基本都是官方对官方的自报成绩,第三方独立复现还在路上。智东西的报道里也专门提醒了这一点。
所以更准确的说法是:它在写代码、Computer Use、长周期办公这类 Agent 任务上摸到了前沿闭源模型的门槛,但科学推理这类硬骨头还啃不动。"Opus 平替"这四个字,听听可以,别写进你的生产备注。
显存档位表:对号入座,别看错
这两天 B 站、知乎的实测已经铺开了,我把跨平台的真实数据帮你归拢成一张档位表,对号入座就行:
第一档:FP8(权重约27GB起步)——24G 单卡免谈
FP8 版本是给有"重火力"的人准备的。已经跑通的方案包括双卡 5090D 配 SGLang,直接接到 Codex 里当编程后端;以及更极限的"穷人方案"——两张起步、四张更稳的 2080Ti 22G 魔改卡。这档的玩法已经不是"体验",是把 API 账单直接归零。知乎

第二档:Q4 量化(约16GB)——24G 卡的甜点区
这是绝大多数人的主战场。lmstudio-community 的 Q4_K_M GGUF 只有 16.1GB,单张 3090 就能跑:实测 prefill 约 1000 tokens/s,decode 约 40 tokens/s,日常 Coding Agent 调用够用。知乎代价是上下文别贪心——230K 上下文时显存占用 98%,非常极限,建议按需收敛。2080Ti 22G 魔改卡跑 IQ4_NL 也能到 39.5 tokens/s,和 3090 几乎打平。哔哩哔哩4090 24G 上 Unsloth Dynamic 4-bit 的方案也有完整实测,社区普遍认为动态 4bit 和 Q8 的差距"肉眼看不出来"。知乎
第三档:16G 卡及更老的设备——先跑通再说话
16G 显存跑 Q4 是能塞进去的,但上下文要大幅缩水,KV cache 才是真账本。老卡方面,V100 靠 MTP 解码能做到 35 tokens/s,够用但不舒服。小红书Mac 阵营这边,M5 Pro 48GB 用 llama.cpp 实测约 9 tokens/s——能跑,但这速度接 Agent 干活要慎重,当个随叫随到的本地问答还行。知乎至于核显跑通的视频也有,那属于行为艺术,别当真。
两个坑,先踩为敬
第一个坑是"雷霆大思考"。这代默认开启思考模式,思维链又长又绕,有实测发现 q4_k_m 量化下思考链能膨胀到六万多个 tokens。而且不同量化版本的思考长度差异极大——同一道题,q4_xl 输出一万三,q8_0 输出五万六。知乎好消息是社区已经有成熟解法:换 HuggingFace 上的 V22 修复版聊天模板 + 开启中度思考,实测正确率不变的前提下耗时缩短 47%,上下文占用最多省 86%。哔哩哔哩不建议直接关思考——正确率会掉到 85% 左右,得不偿失。

第二个坑是心态。跑分是官方自报的,社区口碑是头一周的,而"开源模型首发惊艳、后续版本悄悄降智"的剧本这两年上演过不止一次。现在 B 站已经出现 500 题 10 维度的第三方测评,甚至有人开始担心"这卡又要涨价了"——建议先用手头的卡白嫖一周,跑通自己的真实任务,再决定要不要为它升级硬件。哔哩哔哩
所以,到底谁该现在部署?
给你三条对号入座的建议:
手里有 24G 卡(3090/4090/5090):直接上 Q4 量化 + V22 模板 + 中度思考,这是目前性价比最高的组合,周末就能折腾完。
只有 16G 或 Mac:能跑,但别抱"替代订阅"的期待,当个本地兜底和隐私场景的补充更合适。
完全不想折腾的:官方已经预告 Qwen3.8-27B 的 API 版本在路上,默认 100 万上下文。智东西尤其最近 DeepSeek V4 系列的峰谷调价刚刚生效,正找平价替代的,不妨等官方 API 出来再算账。微博
最后留个话头:你现在手里是哪张卡、打算上哪个量化?已经跑通的,评论区报一下硬件和速度,让还在观望的抄个作业。