昨晚 23 点,Qwen 团队把 Qwen3.8-27B 的权重如期挂上了 Hugging Face 和魔搭,Apache 2.0 协议,免费商用。知乎
这个模型发布前就在 HF 上有了自己的倒计时页面,上线后的热度也肉眼可见:B 站"Qwen3.8-27B 正式开源,一张 4090 就能跑"一夜播放 1.6 万+,知乎官方公告帖半夜积累 30 多条评论,今早 #阿里Qwen3.8开源# 直接冲上微博热搜。
对本地部署玩家来说,这是近半年最值得盯的一次发布——不是因为它最强,而是因为 27B 恰好是"单张消费级显卡够得着的最大尺寸",官方自己都管它叫"全球 AI 社区呼声最高的模型尺寸"。知乎
但先别急着下载。结论放在前面:这是一张"24GB 卡"的模型,16GB 卡能塞进去但体验打折,8G/12G 卡基本不用想。
升级了什么?先看证据再喊"单卡新王"
Qwen3.8-27B 是原生多模态 Dense 模型,三个关键词:原生 256K(262144 tokens)上下文,用 YaRN 还能外推到 1M;新增 reasoning_effort 参数,按任务难度控制思考深度,相当于给本地部署加了个"省电模式";继承了旗舰 Qwen3.8 系列的技术——2.4T 的 Qwen3.8-Max 本月已先行开源。知乎
社区最兴奋的说法是"部分编程场景可以硬碰 Claude Opus 4.6 Max",长周期办公任务也被官方模型卡标在了 Opus 之上。知乎 对比前代 Qwen3.6-27B 的提升幅度,社区已对照官方模型卡逐项核实:
SWE-bench Pro:53.5 → 61.7
DeepSWE:13.3 → 42.2,翻了三倍多
长流程办公:61.0 → 70.7
浏览器操作:48.8 → 64.8
多模态软件工程:25.7 → 38.6

但要泼一盆冷水:以上全部是官方自报分,部分用的是自建基准,上头之前先等等,第三方同条件复测这两天就会陆续出来。知乎 GUI/电脑操作能力是这次最出圈的一项,官方 VL 表格里 Computer use 一项拿到 84.3,而 Opus4.6 Max 是 72.7,"断层领先"的说法就是从这里来的。

显存账本:模型本体只是门票,上下文才是燃油
这是今晚社区最容易吵起来的部分。现在流传着两种说法:B 站有 UP 主说 4bit 量化后单张 4060 Ti 16G 就能本地部署。哔哩哔哩 知乎的部署教程则说 Q4_K_M 量化版加上上下文开销,铁定得 24GB。知乎
两种说法都没错,只是前提不同。先看本体账,经与社区多个实测交叉核对,BF16 原版权重就有 56GB。知乎 各版本差异如下表:
版本 | 权重大小 | 显存门槛 |
|---|---|---|
BF16 原版 | 约 56GB | 多卡/专业卡 |
FP8 官方版 | 约 31GB | vLLM 官方 recipe 建议 ≥38GB,双 4090 起 |
Q4_K_M(Unsloth) | 约 17GB | 单张 24GB 卡 |
更激进的低比特量化 | 更小 | 16GB 卡可以塞进去 |

所以"4060 Ti 16G 能跑"只在用比 Q4_K_M 更激进的量化时才成立,而且只能叫"能装下",不叫"跑得舒服"——模型占了十几 GB 后,留给上下文的余量非常有限。
上下文才是本地部署的隐藏成本。一组社区实测数据很说明问题:前代 Qwen3.6-27B-FP8,单张 170HX 64G 能跑满 256K 上下文;换到双 3090 24G,只剩约 170K,一旦加上多模态输入,直接掉到 128K 以下。24G 卡别幻想满血 262K——"装得下模型"和"上下文够用"是两回事。
对号入座:你的卡该怎么选
8GB / 12GB:直接放弃 27B,看 9B 级小模型或 MoE 小激活参数模型,剩下交给 API;
16GB:能塞进激进量化版,但上下文小、Dense 速度一般。社区选购指南普遍建议这一档用 MoE(如 Qwen3.6-35B MoE),体验反而更好;
24GB(3090 / 4090 / 5090D V2):Qwen3.8-27B 的主场,直接 Q4_K_M,有卡不用换;
32GB+ / 双卡:FP8 随便上,上下文预算也更宽裕;
Mac 统一内存:32GB 能装下 Q4 版,胜在安静省电,但 Dense 模型在统一内存上输出偏慢;24GB 的 Mac mini 会很紧张,不推荐。
部署路径:Day-0 生态已就位,两个注意点
今晚生态跟进速度非常快:
Unsloth 几乎和发布同步放出了全套 GGUF 量化版,HF 和魔搭都能下;
LM Studio 已能直接搜索下载,普通用户最省事的路径;
vLLM Day-0 支持并给出官方 recipe,但稳定版还停在 0.27.1,目前只能装 nightly。知乎
SGLang 同样 Day-0 支持;
RTX 50 系用户还可以关注 NVFP4 量化,有用户实测不开 MTP 就有 50+ tokens/s,开了 70+。

两个注意点:一是习惯 `ollama run` 一条命令的朋友,下载前先看下官方库是否已收录,没收录的话用 LM Studio 加载 GGUF 也一样;二是 vLLM 的 FP8 路线要 38GB 以上显存,单张 24G 卡请直接走 GGUF 4bit,别照抄官方 recipe。
值不值得为它买卡?
最后一个灵魂问题:值不值得为这个模型买张 24G 卡?社区主流观点相当冷静:有卡直接跑,别为模型专门买卡。知乎
逻辑很简单——开源模型迭代速度远快于显卡贬值,今天买的"单卡新王",三个月后就有更强者;而多数对话、写作需求,云端 API 的成本远低于本地显卡的电费加折旧。本地部署真正硬的理由只有两个:数据隐私合规,以及折腾本身的乐趣。没卡又没隐私需求的朋友,可以先走免费通道把玩,等第三方实测跑分落地再决定。这波开源是永久降价,不用抢。
接下来值得盯的信号
第三方同条件实测("对标 Opus"的说法是否站得住);
Ollama 官方库的收录进度;
Unsloth 各量化版本的实际质量损失反馈;
同尺寸竞品跟进:Meta 上周刚开源了 Muse Glimmer-30B,27-30B 这个档位的竞争才刚开始。