8月14日,阿里千问团队开源了27B稠密多模态模型Qwen3.8-27B,Apache 2.0协议,原生支持图像与视频理解,原生上下文262,144个token,可外推到100万,个人和商用都免费。知乎一周之内,它在Hugging Face上点赞破万、月下载量冲破170万,社区量化版本刷出了700个。知乎

很多人的第一个坑,不是显卡,是下载页。发布才一周,GGUF、MLX、AWQ、NVFP4、OpenVINO、推测解码各种变体就已经挤满了社区模型热榜。小红书同一个Q4_K_M,还有好几个发布者在出。这篇文章只做一件事:帮你3分钟从700个文件里挑出对的那个,我把知乎、B站、小红书上20多组实测都翻完了。
第一步选格式:看你的设备,不看不明觉厉的名词
模型文件先按「什么硬件和推理框架能读它」分,格式定了,再谈精度。
英伟达显卡配llama.cpp、Ollama、LM Studio的,下GGUF,实测样本最多、硬件支持最广,从2018年的V100到5090都有人跑通过。RTX 50系追极限速度的,用NVFP4,搭配SGLang或vLLM,SGLang官方给出的数字是单张RTX 5090跑到206.1 tok/s(测试条件为输入8192 token、输出1024 token、单并发)。知乎Mac用户直接下MLX,mlx-community的4bit、8bit、OptiQ-4bit都是现成的。跑GPU推理服务的老卡可以看AWQ-INT4,Intel核显、CPU这条路是OpenVINO。国产芯片这边,昇腾、海光、摩尔线程、天数智芯也都有适配版本,昇腾950PR单卡跑FP8,单流解码67.1 tok/s,精度损失几乎可以忽略。知乎
第二步选精度:按显存算账,别靠感觉
需要的显存≈模型文件体积+KV缓存+系统余量。Qwen3.8-27B的架构在这里帮了大忙:64层里只有16层是标准注意力,其余48层是Gated DeltaNet线性注意力,KV缓存压力只有同尺寸传统模型的约四分之一——8K上下文缓存约2GB,32K约8GB,传统模型开满262K上下文,光缓存就要67GB。知乎

按显存档位对号入座,社区已经实测出了结论。
16G显存(RTX 5060 Ti、4060 Ti 16G):下IQ3_S(约12GB)。全量塞进显存,还能舒服开8K上下文。别硬上Q4_K_M——文件约16.5GB,显存装不下就得借内存,稠密模型最怕这个,任何一层掉进慢速内存,速度直接打骨折。5060 Ti 16G的正确打开方式就是IQ3_S全量入显存加8K上下文,而不是硬上Q4。知乎

24G显存(RTX 3090、4090、Titan RTX、2080 Ti 22G魔改):下Q4_K_M(约17GB)。这是社区公认的甜点档位:4bit量化后能保留FP16原版约95.59%的能力,质量和体积平衡最好,24GB显存机器即可流畅运行。知乎追求输出更稳可以上Q6_K(约22GB),但输出速度会慢一截,生成速度和模型体积成反比,毕竟显存带宽是不变的。
32G以上(RTX 5090 32G、48GB以上统一内存的Mac):要更完整的精度就上Q6_K、Q8_0,要速度就上占用更小的NVFP4。
不到16G:社区的共识是,Q4以下别碰27B。小红书有人真在8GB笔记本上把它跑起来了,所有功能可用,但速度慢,租用4090跑同样的任务快300倍。哔哩哔哩
速度参考:RTX 3090跑Q4_K_M、开xhigh深度思考档,实测约48 tok/s。知乎Mac M3 Ultra跑Q4量化,实测约30 tok/s。哔哩哔哩5090的NVFP4官方成绩206 tok/s,属于另一个次元。
社区一周踩出来的三个坑,都有实锤
坑一:同名Q4_K_M,不同发布者的文件能差出2GB多。「Q4_K_M」只是菜谱名,不是标准——实测lmstudio-community版16.8GB、ggml-org版19.0GB、AtomicChat版17.1GB,质量差距也一目了然。知乎更早之前,权重正式发布前,Hugging Face上还出现过一大批同名假仓库。选文件的口诀是:看体积、看实测,不看名字,想省事就选Unsloth、Bartowski(imatrix量化)这类实测多的发布者。

坑二:NVFP4香,但有刺。B站有UP主做三档精度对比,NVFP4版本测出过两次思考无限循环,视频简介直接写了「该模型慎用」。哔哩哔哩SGLang的issue里也有人报告,非官方转换的NVFP4版本出现严重重复输出,原因是输出头的FP8 scaling值没加载。知乎50系用户认准官方配方,别用来路不明的转换包。
坑三:默认思考档是「地板油」。reasoning_effort默认是xhigh,海外测评者Simon直接说这是个荒唐的默认值,尤其不适合消费级硬件,他的建议是忽略默认档,一开始就用low甚至关闭推理。知乎LM Studio默认只给8192上下文,xhigh档思考一个最普通的问题就能把上下文耗尽;关掉推理后速度快了近9倍,质量肉眼可见地下降,但日常任务够用了。
再补一个误区:别迷信全精度。有人拿39道题让5090(NVFP4)和4080(IQ3_S)并排跑,结论是量化伤细节,不伤收工——8项仓库修复任务,本地两张卡全部修到绿,跟云端打平;但JSON少个括号、事实数字记错这类细节错误,低精度明显更多,输出记得复核。小红书
谁别下载?劝退条款说在前面
B站有条视频标题很扎眼:Qwen3.8-27B劝退,对普通用户没意义。哔哩哔哩7000多播放、130多条评论吵成一团,这个劝退不是没道理。
Qwen3.8-27B的云端API已经上架,输入约0.40–0.45美元一百万token,输出约3.0–3.2美元一百万token。知乎你不需要隐私(公司代码、合同、病历不想上云)、不需要离线、也不是一个自动修bug循环烧十几万token的重度Agent用户,云端就是更省心的选择——本地部署的电费和折腾时间也是成本。
另外最近显卡又涨了一波,一张2080 Ti 22GB魔改卡目前价格大致2300元左右。知乎本地部署的回本前提是卡已经在手,别为了这27B专门去配新卡。
值得继续盯的三个信号
一是DFlash2加速生态在快速进化。SGLang适配版在8卡3090上对比vLLM,实测有4~5倍性能。知乎有人在4090 24G上把Q4量化跑到了80 tok/s。哔哩哔哩Mac的M3 Ultra也已经有适配实测。
二是思考压缩变体,比如Cold-Fusion,专治「雷霆思考」,一条测评视频评论区就有200多人在聊。哔哩哔哩
三是700个量化版本还在增加,下载前先看看这个版本有没有新实测,比盲信文件名靠谱得多。