Qwen3.8-27B 开源 8 天,热度不用再多渲染。8月14日,Qwen3.8-27B 发布,开源两天下载量破百万,登顶 Hugging Face 全球趋势榜,编程 Agent 工具 Cline 的开发者里,它只用四天就成了被选择最多的本地模型。知乎

Artificial Analysis 的 Intelligence Index 给了它 52 分,已经进入 GPT-5.6 Luna、DeepSeek V4 Flash 这一档模型所在的区间,开发者给它起了个更直白的外号叫「本地 Opus 4.6」。知乎按照 Qwen 公布的评测结果,Qwen3.8-27B在AgenticCoding、软件工程、长周期办公任务、竞争性编程和指令遵循等项目上,得分高于同一榜单中的ClaudeOpus4.6Max。36氪

但社区并不是只有一种声音。有 UP 主直接把视频标题写成「Qwen3.8-27B劝退,对普通用户没意义。」,评论区 81 条留言吵得很热闹。哔哩哔哩分歧的原因不复杂:这是第一次有旗舰档智能被压进消费级硬件真能装下的尺寸,但「能跑」和「跑得舒服」之间,隔着至少一张显卡的钱。
所以对大多数人来说,真正要回答的问题不是模型多强,而是:我的机器跑不跑得动?要不要花钱升级?我把这周 B 站、知乎、小红书上散落各处的实测数据,整理成了 5 条硬件公式,花钱之前先对号入座。
先认清两件事
第一件事:17GB 权重,不等于 17GB 显存就能跑。
BF16 原始权重需要 54.7GB,所以量化是把模型塞进普通设备的关键,4-bit 版本 17GB 左右就能跑,24GB 显卡或 32GB 内存的笔记本都带得动。知乎但真正跑起来,权重之外还要给 KV Cache、上下文和运行时留位置:有人实测并发场景下,Q4 量化活跃时占用 28G 显存,Q3 活跃时也要 24G。哔哩哔哩所以「24GB 是入场券」这句话要加个前提:上下文别贪心。
第二件事:这一代长上下文省显存,是架构换的,不是魔法。
Qwen3.8-27B 的 64 层里,48 层是 GatedDeltaNet 线性注意力,只有 16 层是全注意力,内存算术实测:百万token上下文从244GB降至61GB,使单卡运行成为可能。哔哩哔哩这也是「单张 24G 卡能跑」这次能成立的关键,顺带解释了为什么 MoE 路线在端侧吃不开:稀疏激活可以大幅降低每个 token 的计算量,却不会让一个数千亿总参数的模型凭空缩成 20GB。知乎

公式一|无独显或 8GB 笔记本:别买硬件,先上云
有个很有说服力的实测:Qwen3.827B在8GB笔记本上的真实表现是所有功能可用但速度慢,租用4090后快300倍。哔哩哔哩Unsloth 最激进的 1-bit 版本能把模型压到 6.2GB,保留 77% 的准确率,8GB 内存就能跑,但官方定位说得明白:1-bit 版把门槛压到 8GB,适合先体验,不适合当主力。知乎手里没硬件的话,正确姿势是先用官方免费额度、API 或租云显卡——几十块租金比任何显卡都便宜,先搞清楚自己到底拿它干什么,再谈买硬件。
公式二|16G 显存:能用,但要接受降档
本周口碑很好的一条路线:亲测16G显存用llama.cpp本地部署Qwen3.827B然后跑Hermes的任务,模型用UD-Q3_K_XL.gguf,最快速度能调到70t/s,拿来跑生成 PPT 这类 Agent 任务,效果超出预期。哔哩哔哩但天花板也摆在那:Q4 量化活跃显存就要 28G,远超这一档的上限,大上下文和更高质量的量化基本与它无缘。16G 能跑,但别指望跑满。
公式三|24G 显存:社区公认的甜点位
这一档实测最密集,结论也最一致。有人用一张 RTX 4090 跑 Qwen3.8 27B:主模型装进 24GB 显存,再挂一个 DFlash2 草稿模型,110K 上下文,解码还能到 90 tokens/s 以上。知乎社区 MTP 提速项目 qwen38-mtp 还整理出了各卡的提速数据:RTX4090从47.7tokens/s提升至76.3,同一张 RTX3090 解码速度从31.0提高到41.3,AMDRX7900XTX也从30.7提升至43.9。36氪

已经握着 24G 卡的朋友,恭喜,一分钱都不用花,把精力放在挑量化和提速方案上就行。预算有限可以看看双卡路线:双卡2080ti魔改部署本地AI服务器,这可能是目前穷人的最优解,评论区认真讨论电源和插槽的就有上百条。哔哩哔哩
公式四|32G 显存:舒适区,还有 Blackwell 专属红利
5090 的实测数据各家比较一致:Q4 稳定 60+,最高能到 100+。哔哩哔哩更香的是 NVFP4 量化:SGLang开发者在发布当天就开始测试如何把模型跑得更快,通过NVFP4等优化,单张RTX5090的decodespeed已经可以超过200tokens/s。36氪但注意:NVFP4 是 Blackwell(50 系)专属,4090 吃不到这个红利,评测圈普遍建议把这个版本留给 5090 级别的 32GB 显卡,而且 Unsloth 的 NVFP4 量化版本目前 vLLM 支持,SGLang 暂不支持,框架生态还在补。知乎
上周社区里流传很广的一张 HN 评论截图,把这笔账算得很清楚:32K 上下文的 KV Cache 大约要吃掉 2.5GB 显存,MTP 可用,结论是预算够就直接上 32GB 卡。这大概是对公式四最简短的注脚。

公式五|Mac 统一内存阵营:稳,但别期待速度
Mac 这边的实测数据相当一致:M3 Ultra 512G 跑 Q4 只有 30+ Tokens/s,FP8约20。哔哩哔哩MacBook Pro M4 Max 128GB 上跑,token生成:33.1 tok/s。小红书也有人艰难的在我24G小mac上部署好了qwen3.8 27b:部署简单,跑起来很麻烦,第一次跑直接内存报错,改了 macOS 强制保留内存才成功。小红书Mac 阵营的优势是统一内存够大不容易爆、安静省电,适合不着急的日常使用;劣势是速度大概只有同价位 N 卡的三分之一,24G 统一内存的机型还要做好手动折腾的准备。
本周的 3 个坑,都是真人踩出来的
坑一:信了「最低 8GB 能跑」就去买硬件。 能跑不等于能用。Unsloth 官方都把 8GB 的 1-bit 版定位成体验版,8GB 笔记本的实测结论更是「所有功能可用但速度慢」。门槛数字是用来知道下限的,不是用来下单的。
坑二:把上下文塞满。 前面的实测已经给出参照:24G 卡挂上 110K 上下文,nvidia-smi 显示约 23.7GB / 24GB。知乎再往上加随时可能爆显存。长上下文是刚需的话,要么给显存留三成余量,要么直接投奔大显存卡或 Mac 阵营。
坑三:把跑分速度当体验速度。 这个模型特别能「想」:Simon Willison 实测时,默认推理档让它画一只骑自行车的鹈鹕 SVG,它想了 21 分钟。知乎评测者的原话更狠:Simon 对默认档位的评价是「这是个荒唐的默认值,尤其不适合消费级硬件」,社区普遍建议一开始就用 low 档甚至直接关闭推理。知乎关闭推理确实能快近 9 倍,但输出质量会肉眼可见地下降,档位要按任务自己权衡。
另外还有个工程坑:前面提到的 DFlash2 提速依赖 llama.cpp 的 PR #27342,截至 2026 年 8 月 21 日还没有合进正式版,要自己编译源码,而且主模型和草稿模型不能随意换着搭。知乎

那么,到底谁该换显卡
已有 24GB 卡:不用换,你就在甜点位上;
16GB 卡、需求轻:先试 Q3 量化,够用再说;
本来就要买卡搞本地 AI:本周的社区共识是 24GB 入场、32GB 舒适;预算有限看二手 3090 和双卡魔改路线,电源、插槽和魔改风险是自己要做的功课;
没硬件、想体验:先租云显卡,用最小成本验证需求;
Mac 阵营:不必为速度换阵营,除非真的忍不了 30 t/s。
值得继续盯的信号:DFlash2 什么时候合进 llama.cpp 主线——合进去就是全体 24G 用户免费提速;SGLang 对更多 NVFP4 量化版本的支持进度;还有 Apple Silicon 优化挑战的走向,挑战开始不到16小时,参与者已经将Qwen3.8-27B的运行性能相对项目基线提高了153%。36氪
Qwen3.8-27B 这次证明的,是旗舰级智能可以被压进 270 亿参数里;而对我们每个人来说,事情就简单得多:看看自己的显存,对一对公式,再决定花不花这个钱。有实测数据的朋友,欢迎在评论区交换数字——这张硬件适配表,要靠大家的真实数据才能填满。