Qwen3.8-27B 这几天是本地部署圈的头号话题。它有多强不用我复述,“Opus 替身”"年度最佳模型"这类话,开源五天已经被说烂了。我想聊的是每个人下载前都会卡住的那一步:下载页上 BF16、FP8、Q8、Q6、Q4_K_M、IQ4_XS、IQ3_S、Q2,还有一堆带 UD 后缀的版本,到底该下哪个?
选错的代价不是"慢一点"。一位 8G 显存、32G 内存的用户,花一天把 Qwen3.8-27B 下载下来,17.1GB,GGUF 头校验通过,以为能换主力了,结果跑起来比老款的 35B 模型慢了 8 倍。小红书原因不复杂:显存不够,权重被挤进内存,总线成了瓶颈。
我把知乎、B站、小红书、YouTube 这几天的实测帖翻了个遍,结论大多反直觉。先讲两个规律,再给按显存分的选版表,最后拿走不谢。
反常识一:选量化不是问"能多聪明",是问"装不装得下"
很多人的直觉:量化是个滑杆,比特数越高越聪明,慢一点就忍一忍。
不是的。在显存紧张的设备上,这是个悬崖。
知乎一位用户在 5070 Ti 16GB 上做了完整实测。这张卡 16,303 MiB,扣掉桌面剩约 15,129 MiB,Q4_K_M 光权重就超过整张卡——不是跑得慢的问题,是根本装不进去。知乎
换更小的 IQ4_XS(14.63 GiB),装进去了,但只剩不到 0.5 GiB 给 KV cache 和 compute buffer,一部分权重被迫丢进系统内存。GPU 利用率看起来是 100%,功耗却只有 76W——上限是 300W——它在等数据,不是在算。知乎这个 4-bit 和能全量塞进显存的 3-bit 之间,速度差了大约 300 倍。
所以在这张卡上,问题不是"3-bit 还是 4-bit",而是"3-bit 还是没有"。27B 是稠密模型,每生成一个 token,全部 270 亿参数都要参与计算,整个模型必须全部放进显存,少一层都不行。实测里往 CPU offload 一层,速度就掉约六成。所以这位作者的取舍原则很简单:宁可用更激进的量化把模型全部塞进显存,也不要更好的量化配一点 offload。
再看一个社区实测里的尺寸表,DGX Spark 上测的:unsloth 的 NVFP4 量化 22GB,MTP-NVFP4 量化 20GB,官方 FP8 量化 29GB。小红书同一个模型,不同量化,体积能差出好几个 GB。选版之前,先看体积这一栏,再谈别的。

反常识二:比特数不等于智商,29GB 的版本输给了 17GB 的
YouTube 作者 Jose Romero 做了一场对照考试,把 Qwen 3.8-27B 从 55GB 压到 11GB,让 BF16、Q8、Q4(Unsloth)、Q4_K_M(Ollama 默认)、Q2 五个版本同题竞技。哔哩哔哩
结果:速度确实随量化变低而变快,但质量不是线性下降。Q8(约 29GB)在部分测试里失败,输给了 17GB 的 Q4_K_M;最大的惊喜来自 Ollama 默认一键拉下来的 Q4_K_M,表现出色。哔哩哔哩
(有个好玩的细节:SVG 绘图测试里它多次署名"Claude"——训练时吃了哪家的数据,一目了然。)
一份 16GB 卡实测也印证了这点:IQ3_S UD 量化——Unsloth Dynamic 的做法,敏感层保留高精度、不敏感层压得更狠,同样叫 3-bit,质量比均匀 3-bit 好——数学推理硬是解出了 Pell 方程 x²−61y²=1 的十位数最小解。纯推理 8 道题对了 4 道,失败的四道全部是输出 token 撞上 8,000 上限,没有任何一次输出过错误的数字。知乎也就是说,3-bit 丢掉的不是智商,是算力预算。
而给它接上 Python 工具后,成绩直接从 4/8 变成 8/8,耗时从 406 秒砍到 123 秒,token 消耗降了约四成。知乎对本地模型来说,给工具远比给思考预算划算。
对号入座:按显存档位选版本
把这几天跨平台的实测数据对齐了一下(样本量不一,部分是单机数据,当作参考区间而不是绝对值):
显存/内存 | 推荐版本 | 实测依据 |
|---|---|---|
8GB 显存 | 别硬上 27B Q4 系列 | 有人实测下载 17.1GB Q4_K_M 慢 8 倍;日常不如直接上 9B Q8 |
12GB 显存 | 3.7bit 左右的 UD 动态量化 | q3 在 30k 上下文掉到 5 tok/s;约 3.7bit UD 量化带视觉+200k 上下文仍有 10 tok/s |
16GB 显存 | IQ3_S / i1 系 UD 量化 | Q4_K_M 完全装不下,IQ4_XS 慢 300 倍,3-bit UD 是唯一能干活的答案 |
24GB 显存(4090/3090) | Q4_K_XL 或 Q4_K_M 当主力 | 有 4090 用户的长期主力量化选了 Q4_K_XL,采样按官方 temperature 0.7 / top_p 0.8 |
32GB+ 显存 | Q8 可试但不必迷信 | 对照考试里 Q8 没赢,29GB 还挤占上下文显存 |
Mac | 容量解决"装得下",带宽决定"跑得快" | M5 Max 跑到 70 tok/s,M5 Pro 约 21 tok/s;M1 Max 64G 跑 Unsloth Q4 只有 6~9 tok/s |
24GB 这档如果你在几个 Q4 之间犹豫,4090 楼主的判断值得参考:Q4_K_XL 是一个很值得优先尝试的平衡点,通常比更激进的低比特量化更稳,更适合当长期主力而不是尝鲜。知乎
12GB 档再补两句。一位 5070 Ti 12G + 64G 内存的小红书用户把 2b、4b、9b、27b 各量化版本全测了一遍,结论是消费级机器上 9B Q8 才是"初级苦力"——速度 45 tok/s,数学能做,工具能调。小红书
而 27B 的 q6、q8 在那张卡上只有 5 tok/s,作者的原话是"只能测试,无法工作"。小红书硬件不升级的话,把小模型用好,比硬扛大模型划算得多。
Mac 要单独说一段:统一内存能装下 PC 显存装不下的版本,但每生成一个 token,全部权重都要过一遍内存,带宽由芯片决定。M1 Max 64G 跑 Unsloth Q4 只有 6~9 tok/s,作者原话是完全没办法投入正常使用。小红书而 M5 Max 上,社区已经跑出了 70 tok/s。小红书同样是"64GB 以上",是两个完全不同的世界。老芯片用户别只看内存大小,先看芯片是哪一代。

上面就是那份 M1 Max 实测截图,上下文从 64K 拉到 256K 对速度影响不大,输出始终停留在个位数 tok/s。
下完之后,最容易忽略的三件事
给上下文留显存。 吃显存的不只是模型权重,KV cache 也吃,开了思考更凶。4090 楼主的经验:别上来就冲原生 262K,先把上下文定在一个能长期稳定运行的值,再慢慢加。官方宣传的"YaRN 技术可轻松扩展至 1M tokens",和你的显存没有关系。小红书
别拿聊天速度下结论。 这个模型带 MTP(多 token 预测),提速效果取决于"可猜性":代码和工具调用的 JSON 结构规整,好猜;自由散文难猜。一份 16GB 实测里,聊天 80 tok/s,agent 循环 113 tok/s,差了 41%。知乎下面这张 DGX Spark 的 MTP 调优矩阵也一样:同一个模型同一台设备,解码配置和并发不同,吞吐差得很远。教程里只拿聊天测速给你看的,多半低估了它干活时的表现。

写代码别机械降温度。 这一代模型是按接近官方推荐的采样分布设计和验证的:temperature 0.7,top_p 0.8。知乎别把"老时代代码模型"低温度出活儿的经验,生搬硬套到 Qwen3.8 上。开了 reasoning 的话,记得给思考 token 设硬上限——社区已经在吐槽它"拒绝停止思考",写个简单任务它能在后台脑补成百上千 token 的内心戏,放任不管会把上下文吃光。知乎
接下来值得盯的信号
Unsloth 的动态量化还在持续更新,有用户说新版 Qwen3.8-27B 量化准确率又提了 10%,下过老 UD 量化的可以准备重下;
官方发布的 FP8 量化(block size 128 细粒度)已经有人在 vLLM 上测了。小红书不过 DGX Spark 上的综合排名对 FP8 有点残酷:NVFP4 系量化排前,FP8 体积更大、排名靠后;
提速方向,DFlash2 投机解码和 oMLX 0.6.2 的 ANE/GPU split tuner(Mac 向)都在社区活跃测试中,缺速度的可以盯一下。

最后给还在观望的人一句:官方说"量化后在消费级显卡上即可流畅运行",这句话是真的,但"流畅"两个字的潜台词,由你的显存档位决定。对好表,看看自己的卡,再点下载——别花一整天下了 17GB,换来一个慢 8 倍的结果。
你的卡在跑哪个版本,速度多少?评论区对一下答案。