Qwen3.8-27B 开源 12 天了(8 月 14 日放出,Apache 2.0)。知乎这 12 天里,本地部署圈子里的两拨人吵得不可开交。
一拨在狂欢:SWE-bench Pro 跑分 61.7,直接超过 Claude Opus 4.6 Max 的 53.4。今日头条“家用 Opus"的说法开始流传,B站上一篇部署教程动辄上万播放、几百收藏。另一拨泼冷水:一位 UP 主发视频说"Qwen3.8-27B 劝退,对普通用户没意义”,9700 播放、160 条评论,评论区基本把他围殴了。哔哩哔哩
两边其实都没说全。吹的视频大多只测自己那一张卡,劝退的视频又拿最极端的量化说事。真正缺的是中间那一层:这张模型在不同显存档位上到底什么水平、多快、要踩哪些坑。我把过去 12 天知乎、B站、公众号上的 20 多份实测和讨论拢了一遍,覆盖 N 卡、A 卡、苹果芯片、核显、二手魔改卡,按显存档位整理成一张对照,下载几十个 G 之前,先对号入座。

先说结论:这是一个"看显存下菜碟"的模型
Qwen3.8-27B 是稠密模型,270 亿参数全参与计算,原生多模态(图片、视频都能吃),262K 原生上下文,带 MTP 多词元预测头。BF16 原始权重约 56GB,本地玩法基本就是选量化档位。

12 天下来,社区已经吵出了一个粗略共识。Q1、Q2 量化别碰,劝退视频下面的高赞反驳就是这个方向:“跑 IQ1 不如去跑 9B,Q2K 勉强干活”。哔哩哔哩Q3 勉强能用,有评论总结"Q3K 勉强成人";Q4 是稳定甜点;Q5、Q6 就要看显存给不给力了。下面按显存档位说。
8GB 显存:直接放弃
最小的 Q2_K 量化文件就有 9GB 多,装不下。哔哩哔哩硬上 CPU 卸载等于用耐心换 token。8GB 卡不如等 Qwen3.8 家族后面的 MoE 小激活版,或者先跑 Qwen3.6 系的小模型。
12GB 显存:能跑,但别指望爽
有实测:12GB 显存跑 UD-Q4_K_XL,13 tokens/s。哔哩哔哩能聊能用,但离"爽"很远,长上下文一开还得往内存溢出、速度再掉。这个档位我的建议是:手里只有这张卡,把它当"尝鲜机",别当生产力。
16GB 显存:战场最激烈,坑也最多
16GB 是这次讨论量最大的档位,重点说三个事实:
第一,Q4_K_M 放不下。 按 unsloth 官方给出的内存表,4-bit 量化需要的总内存(RAM+VRAM)是 16–19 GB,16GB 显存塞不下,得退到 UD-Q3_K_XL 或 IQ4_XS。微信公众号

第二,调好了真能起飞。 传得最广的一个案例是 16G 显存跑 UD-Q3_K_XL:64K 上下文、挂载视觉模型、开 MTP,峰值实测约 70 tokens/s,用它驱动 Hermes 做 PPT。哔哩哔哩这条教程被 414 人收藏,置顶评论里贴了完整启动参数。

第三,16GB 卡想流畅,几乎全靠 MTP。 4070 Ti Super 16G 用户实测:开 MTP、–spec-draft-n-max 设 2 最快。不开 MTP 就是另一个量级的体验。
另外提醒一句:16GB 档别急着开长上下文和高分辨率图片输入,这两样会在后台偷偷吃显存,常被引用的"17GB 就能跑",对应的是 LM Studio 默认 8192 短上下文的情况,长上下文一开就不是这个数了。
24GB 显存:甜点区,Q4_K_M 起步
24GB 是这个模型的舒适区,实测样本也最齐:
7900 XTX 24G + Q4_K_M:默认 35.88 tokens/s,加上两个 MTP 参数后 47 tokens/s,日志里 MTP 一次草拟 4 个、平均接受 3.96 个。知乎
同一张卡再叠加 --reasoning-effort low 压低思考输出,实际对话速度还能到 52 tokens/s;
RTX 5090 跑 Q5:单流约 70 tokens/s。哔哩哔哩有用户说能撑 3 路并发约 100 tokens/s。
对 24GB 卡,社区的判断很一致:值得跑,而且值得作为主力跑。
卡不在上面?还有几条野路子
2080 Ti 22B 魔改卡:IQ4_NL 量化实测 39.5 tokens/s,带 17 万上下文的参数组合。哔哩哔哩这条教程有 360 人收藏;
双卡捡垃圾:两张 2080 Ti 22B 合计约 6000 元,nvfp4 跑到 90 tokens/s、262K 上下文;两张 V100 SXM2 16G(1800-1900 元)跑 Q4 也能到 60 tokens/s、110K 上下文;
AMD Strix Halo(Ryzen AI Max+ 395,128G 统一内存):Ollama 只有 9-12 tokens/s,换 llama.cpp Vulkan 后端加 MTP,直接翻倍到 20+。知乎引擎和参数选对,和硬件一样重要;
纯 CPU 党注意:稠密 27B 每次推理全参数激活,CPU 上天然吃亏,纯 CPU 想跑 Qwen 本地,MoE 的小激活系列更合适。
为什么这么多人喊"慢得要死":三个坑
劝退视频最大的论据是"慢"。但把实测摆开看,慢大多不是模型的锅:
坑一:MTP 默认没开。 Qwen3.8-27B 自带 MTP 头,llama.cpp 要用 `–spec-type draft-mtp --spec-draft-n-max N` 手动开启;而今年 5 月中旬这套参数改过一次名,老配置会静默失效。哔哩哔哩有知乎用户对比后发现,Ollama 比手搓 llama-server 快,就是因为 Ollama 默认把 MTP 参数带上了。开了 MTP,提速普遍在 30% 到接近翻倍。
坑二:MTP 不是万能的。 社区实测出的三个反例:采样温度拉高,草稿接受率会从 85% 掉到 65%;图片任务上 MTP 反而拖后腿,有用户实测从 45 掉到 28 tokens/s;12GB 笔记本显存溢出后,关 MTP 反而更快。–spec-draft-n-max 也不是越大越好,2 和 4 在不同机器上各有最优,自己试。
坑三:长上下文和视觉偷偷吃显存。 想开 262K 上下文,KV cache 必须量化(-ctk q4_0 -ctv q4_0),再用 --jinja --reasoning off 控制思考——注意这个组合只是大幅减少思考概率,不能 100% 关死。哔哩哔哩思考模式全开的时间代价,有实测为证:同一个生成任务,深度思考档位耗时 21 分钟,关掉思考只要 137 秒。知乎

劝退派也不全错:这两类人别冲
160 条评论的劝退视频,剥掉情绪后有两点站得住:
纯聊天需求:只是聊天问答,云端 API 又快又省事,本地部署的折腾成本收不回来;
重度编程干活:真要当编程主力,需要十几万 token 级的上下文吞吐,16GB 卡确实捉襟见肘,不如等 API 版——官方已经预告 Qwen3.8-27B 的 API 版在路上,原生开放 1M 上下文和内置工具调用。今日头条
真正值得本地跑的是这三种人:数据不能出内网的、想 7×24 小时挂机跑 agent 的(一位捡垃圾玩家的原话:“现在付费的都涨价了,烧也烧不起了,本地部署没压力”)、需要无删减版的。哔哩哔哩
接下来看什么
下载:HuggingFace 搜 unsloth/Qwen3.8-27B-GGUF,20 多个量化版本任选;国内用户走 ModelScope 或 hf-mirror;要用视觉功能,记得另下 mmproj 文件;
版本:llama.cpp 今年 5 月之后的构建都支持 MTP 参数,太老的版本先升级(升级取舍可以另查最近 0.2.0 版本的相关讨论);
两个观察信号:一是 llama.cpp 刚切语义化版本号,MoE 预取、专家缓存这些优化还在快速合入,现在跑出的速度记录过两周可能就被刷新;二是社区在赌 Qwen3.8 家族下一个开源的是 35B-A3B 还是 122B-A10B,部署教程的 UP 主简介里已经写满了期待。显存紧的朋友,不妨等 MoE 版再上车,小激活模型才是低显存的解药。
一句话收尾:Qwen3.8-27B 不是"普通用户没意义",也不是"人人家用 Opus",它是一个把你的显存、参数和耐心放在同一张桌子上算账的模型。账算明白了,再下载。