Qwen3.8-27B 开源刚满一周,本地部署圈这几天基本都在干同一件事:验货。从 B 站到知乎,评论区被问得最多的一个问题就是——“我的卡是 XXX,该跑哪个量化?”
官方口径很诱人:“单卡 16GB 显存即可部署”。知乎不少人信了,下载完 17GB 出头的权重文件,满心以为能跑,结果对话没聊几句就收到爆显存的警告。其实官方没说错,那个 16GB 指的是"最低加载门槛",而决定你能不能正常用的,是运行时显存占用——这两者中间,隔着一整块 KV cache。
我把这周全网 20 多组社区实测翻了一遍,先把这个差值讲清楚,再给你一张按显存档位对号入座的量化地图。
17.74GB 的文件,为什么要吃掉二十几 G 显存
先看基础事实:Qwen3.8-27B 官方 4bit 量化版的硬盘体积是 17.74GB。有知乎网友在 RTX 3090 Ti 上基于它实测,200K 上下文能跑,“窗口再大一些有爆显存的风险”。知乎
但模型跑起来之后,显存要装三样东西:权重本身、随对话长度增长的 KV cache,还有计算缓冲。B 站一位做并发实测的 UP 主给过一组"活跃时占用":Q4 量化活跃约 28G、Q3 约 24G、Q2_K 约 13G。哔哩哔哩这就是为什么 24G 卡跑 Q4 会感觉"将将好"甚至偏紧——权重占了 17.7G,剩下的要留给上下文。
好消息是,这一代的架构帮了大忙。Qwen3.8-27B 用的是 3:1 混合注意力设计(48 层 GatedDeltaNet 线性注意力 + 16 层全注意力),KV cache 开销比传统 Transformer 省得多,有拆解分析算过,百万 token 上下文的 KV 占用能从 244GB 压到 61GB——这是 262K 长上下文能在消费级显卡上落地的根本原因。哔哩哔哩
但也别高兴太早。还是那位 3090 Ti 网友的实测:一次固定提问,312 个输出 token 里 286 个是思考 token,占比 92%。知乎你的上下文预算,大头是被"思考"吃掉的。思考开得越猛,显存和等待时间涨得越快。
所以选量化本质上是解一个方程:
运行显存 ≈ 量化权重体积 + 上下文预算(KV cache)+ 2~3G 缓冲
显存档位地图:20+ 组社区实测,帮你对号入座
下面是我从 B 站、知乎、微博评论区聚合来的实测数据。注意两点:速度受量化、推理后端、上下文长度影响很大,只能看个量级;这些全是社区自测,不是官方标称。

16G 档(4060Ti 16G、双卡 NVFP4):Q3_K 量化单卡 16G 显存实测能跑到约 40 tokens/s,B 站有视频直接感叹 q3 量化"居然也有这么强"。哔哩哔哩也有网友用双 5060Ti 16G 跑 NVFP4,40 tokens/s、128K 上下文。哔哩哔哩这是实用门槛档,建议上下文控制在 32K 以内,并且一定要限制思考预算。
22G 档(魔改 2080Ti 等老卡):2080Ti 22G 单卡实测 39.5 tokens/s。哔哩哔哩老卡的极限还在被社区往上抬,这档能玩,别急着当废品处理。
24G 档(3090 / 4090 / 3090Ti / 7900 XTX):甜点位,也是大多数人所在的档位。Q4_K_M 是基准选择:3090 Ti + LM Studio 实测短上下文 62 tokens/s、10K 上下文 56 tokens/s,非常稳。知乎4090 48G 版跑 230K 长上下文约 35 tokens/s。哔哩哔哩AMD 7900 XTX 走 ROCm 路线 41~53 tokens/s,llama.cpp 调好参数还能再快 30%。知乎如果显存挤得出来,社区对比的结论是"Q5_K_XL 显著强于 Q4_K_M,显存足够最好 Q5 以上精度"。
32G+ 档(5090 / 48G 魔改卡):直接上 Q6_K 或 FP8,离模型原味最近。5090 实测约 157 tokens/s。哔哩哔哩有在公司服务器部署 FP8 的网友说体验比 Sonnet 4.6 还强——这句当个例听,但方向上 FP8 确实是目前口碑最好的高精度选项。哔哩哔哩4 卡 4090 上 NVFP4 和 FP8 的 550 题基准对比,平均分只差 0.70 个百分点,能力基本等同,区别是 FP8 prefill 快、NVFP4 decode 快。知乎
Mac 档(统一内存):分化极大。M4 Max 128G 用 MLX 后端加 MTP 投机解码,短上下文能到 63 tokens/s,是 Mac 上唯一称得上流畅的组合。哔哩哔哩M1 Max 64G 跑 8bit,输出只有 8 tokens/s。哔哩哔哩有知乎网友专门写了篇《MacBook Pro 不适合跑 Qwen3.8-27B》,结论是能跑、但不建议当主力生产机。知乎老款 Mac 请大幅降低预期。
量化到底掉多少智商?三个参考坐标
第一,FP8 和 NVFP4 之间不用纠结:550 题基准平均分差 0.7 个百分点,可以视为能力等同,按你显卡支持哪个选哪个。
第二,Q4 到 Q5 是社区公认的"值得挤一挤"的升级:有对比实测认为 Q5_K_XL 明显强于 Q4_K_M。哔哩哔哩24G 卡用户在 Q4_K_M 和 Q5 之间取舍时,想想你的上下文需求——上下文短就上 Q5,上下文长就守 Q4。
第三,Q3 能用,但有代价。16G 档跑 Q3 的速度很可观,也有 UP 主给出正面评价,但低量化的坑在细节里:比如 Unsloth 的量化版本有用户实测需要自建 model.yaml、匹配好思考模式才能正确运行。知乎Q3 适合轻量任务,跑 agent、工具调用这类对稳定性敏感的活,建议 Q4 起步。
顺便给跑分热降降温。Artificial Analysis 给 Qwen3.8-27B 打了 52 分,和 GPT-5.6 Luna(max)同分,SWE-bench Pro 拿了 61.7。知乎微博但社区最高赞的几条回复都很清醒:“应该是某些特殊领域,综合肯定比不了大模型”“27B 怎么可能达到,最多某方面接近”。哔哩哔哩我的判断跟社区一致:这是目前 agent、编程场景下最强的本地模型之一,指令执行和代码生成的体验确实越级,但别指望它全面替代旗舰闭源。

直接给结论:按你的档位挑
16G 显存:Q3_K 或 NVFP4,上下文 ≤32K,必须限制思考预算。这是"能用"的门槛,不是"好用"的起点。
22~24G:Q4_K_M 起步,显存富余挤得出就换 Q5_K_XL。200K 上下文理论可行,但警惕思考 token 把 KV 吃满,日常把窗口开到 128K 以内更稳。
32G 以上:Q6_K 起步或直接 FP8,别在量化上省显存了,这个档位的意义就是跑原味。
Mac:M4 Max + MLX + MTP 才值得正经部署,M1/M2 系列当轻玩具。
最后说下要不要为它升级显卡:先别急。2080Ti 22G 魔改卡还能跑 39.5 tokens/s,说明老硬件的上限还在被社区挖掘。有两个值得盯的信号——IncoAI 开源的 DFlash2 投机解码草稿模型(1.92B 参数,SGLang 下单并发吞吐做到自回归的 3.4 倍)。知乎另一个是社区正在等的 Q4_K_M-MTP 优化。哔哩哔哩这两个成熟了,你手里的卡还能再榨出一截速度。

另外,同一周阿里还把 2.4 万亿参数的 Qwen3.8-2.4T-A95B(MoE、激活 95B)权重开放了,这是 Qwen-Max 级首次开源。微博当然,那是机房里的故事,跟家用机没关系——但它说明开源权重追上闭源旗舰的速度比所有人想的都快。本地部署这条路,天花板还在往上走,你的显卡倒是可以先等等。
