这三天,本地部署党的评论区在为同一个8.4GB的文件吵架。
9月6日晚,B站字幕组频道"量子菠萝_“搬运了Cloud Codes的《Qwen 3.8 27B in 8.4 GB. But Don’t Download That One》。视频盯上的是奥地利ISTA-DASLab几天前放出的Qwen3.8-27B-GSQ-RCO-GGUF里最火的那个IQ3_S版本:官方口径是同样8.4GB的体积,在AIME25、GPQA-Diamond、LiveCodeBench v6三项上比社区标准件Unsloth Dynamic高7.72分,还"100%兼容原生llama.cpp、不需要自定义解压内核”。哔哩哔哩
分数更高、文件更小,按剧本应该吹。结论却是"别下载"。这就是它吵起来的原因——B站GSQ关键词下三天内至少堆出六条实测/教程视频,9月3日那期《号称对标满血BF16的IQ3量化》播放一万出头、评论区两百多条,吵到现在没合上。
为什么一个量化文件能吵一周
先看日历就明白了。Qwen3.8-27B是8月14日开放权重的,Apache 2.0免费商用、256K级原生长上下文,当天起就霸住HuggingFace热榜——小红书上有博主数过:"一个模型霸榜24个仓库,不是24个模型,是一个模型被量化成各种格式”,一句话说尽了这场选型的混乱。小红书 Unsloth团队的Dynamic版本以公认速度补齐了GGUF生态,"27B标配UD"的共识刚立住,9月2日前后GSQ-RCO就上门踢馆了:Gumbel-Softmax可微权重舍入,加黎曼约束优化,在851个张量的搜索空间里逐层分配比特位,号称在sub-4-bit区间打破误差墙,而且原生llama.cpp直接加载。哔哩哔哩
对16GB显存党来说,8.4GB这个数字是真的有杀伤力。UD-IQ4_XSS权重13GB,在16G卡上给KV Cache留的空间本来就紧,"怎么在16G里塞下可用上下文"从8月下旬吵到今天。现在突然有人说:我质量对齐UD,还多还你4个G。踢馆和反踢馆撞在一起,两边数据全暴露出来了。

踢馆方的账:五维反超,但记了两处裂缝
B站UP"遣返千翻者"上一期刚把五款27B量化定案为UD-IQ3_S最优,三天后在RX 9070 XT上把GSQ-RCO IQ3_S重跑了一遍:PPL 6.31全场第一,MMLU-Pro 61.9%,HumanEval 82.9%,GSM8K 94.5%,五维质量全面反超同档位UD;他还专门验证了教程区流传的"中文能力严重受损"——C-Eval 14题逐题一致,未复现。哔哩哔哩
两处裂缝他也记了:32K短上下文时GSQ版反而慢13%,拉到256K又反超;以及这是个"非均匀量化",文件内部的张量排布和常规版本完全两回事。
评论区的支持票来自各张不同的卡:有20G矿卡用户复测同提示词3D场景,IQ3_S对需求理解更透、元素齐全,生成速度约为Q4_K_M的一半,而Q4_K_M漏了山脚下的湖、飞鸟和17度角的太阳反光。哔哩哔哩 4060Ti 16G用户实测上下文不太长时稳定40t/s,90K左右还有30多t/s。哔哩哔哩 5070 12G用户用9GB的IQ2_S-mtp版跑32K上下文能到60t/s。

反吹方的账:跑分是851个张量的账,机器是一条链
Cloud Codes最狠的一刀不是"体验差",而是机制。GSQ-RCO的位宽是数学优化器自己分的,优化目标是张量重建误差,不是人类定义的"哪层重要"。他拆了仓库里的per-tensor allocation dump给你看:Token Embedding表被压到IQ1_M——全文件精度最低的一档;输出头却保在IQ4_XS;39个1-bit张量扎堆在网络前四分之一,后四分之一原封不动。翻译成人话:这份文件的成绩单是851个张量误差的加权,但真跑起来是一条链,入口精度塌了,链子照样卡。哔哩哔哩
跑分和体验的裂缝,评论区摸得出来。有6800XT 16G用户实测"写一个HTML计算器,Gemini Flash 10秒,这个5分钟、一万token、33t/s";有用户抱怨"强化代码能力后写作能力残疾了,逻辑性比3.6差很远";“开了MTP中间会胡言乱语"更是反复出现——连最早发教程的qwased自己,都在说明里写"建议自行去掉MTP并加大上下文长度使用”。哔哩哔哩
但反吹方也不能通吃。同一批人里,有人贴出对照表"同等级分数不如UD",也有人贴出IQ4_XS在80K prefill吞吐558、解码37t/s,而GSQ IQ3_S只有478和20.77t/s,结论是"很奇怪,我怎么跑,还是IQ4-XS的数据更好";这些全是单机自测,互相不可比。Cloud Codes给16G卡的最终建议"首选9.3GB IQ2_S",同样只是他的显存算术——0.93GB视觉投影器、128K上下文约8.6GB KV Cache,逐项从16G里扣。哔哩哔哩 GSQ家族一共8.4GB到11.8GB四个版本,每个版本的张量账本都不一样。哔哩哔哩 9.3GB这个坑还没人替你踩平。
吵完一周,评论区锤出来的三条新规矩
一、文件大小不等于卡的兼容性,KV才是正账。"我最烦那种14.5GB的IQ4_XS,装是装得进去,KV Cache几乎没地方放。"这不是段子:有5060Ti 16G用户实测,魔改榜单里所有超过14.3G的版本在这张卡上都只能开64K上下文,关掉MTP能到72K,再大必爆,Windows下显示服务还要固定吃掉500多MB显存。哔哩哔哩 LM Studio本身占显存,同样的模型换裸llama.cpp才能开到90K。标称上下文和你能用的上下文之间,隔着操作系统、加载器和MTP。

二、KV Cache量化,对称优先。有用户报告llama.cpp b10819里只要设`-ctv q4_0`,速度直接掉一半,换回`-ctk q8_0 -ctv q8_0`才正常。哔哩哔哩同一类陷阱还有个独立证人:小红书上那位花3100元淘3080 20G矿卡跑27B的测评党,在LM Studio里好心把K开Q5、V开Q4,速度直接从30多掉到7 tok/s左右,问了AI才定位到是非对称量化的坑。小红书跟评的人贴出CUDA Flash Attention内核的判断逻辑:当K和V的量化类型不一致时,找不到专用内核,整套attention回退到CPU执行。这是一条网友贴图而非官方文档,但它把一个便宜的验证动作教给了所有人:每次换模型、换KV参数,跑一短一长两个上下文的生成速度,掉档就是掉进回退陷阱了。
三、榜单不可信年代,交叉验证再信"全场第一"。有人问qwased去哪看可信的开源模型跑分榜,回答就一句:“自己寻找,目前没有可信的榜单”。哔哩哔哩 社区魔改榜单的"保留原版约93%能力"是UP主自测自报。哔哩哔哩 为了塞进128K上下文从Q4降到Q3的版本,被榜单作者自己点名不推荐。 Unsloth的Dynamic版不是分数最高的,但成了"求稳"的行业默认——共识本身就是用几百个用户的翻车喂出来的。
按卡对号:现在这一刻,谁该下哪个文件
你手上的卡 | 你要干的事 | 当前更稳的选择 | GSQ-RCO要不要跟 |
|---|---|---|---|
8GB(2070级老卡) | 能上车就行 | UD-IQ2/Q4_XS极限参数方案:层卸载+KV量化+MTP开关(8G下IQ2写小说尚可但思维链易断,IQ4_XS跑得动Agent但速度难看) | 先别,8.4GB省的是空间不是质量 |
12GB(5070) | 快语速日常用 | IQ2_S 9GB+MTP,32K上下文60t/s(用户实测) | 可以试,选小版本,预期放在"尝鲜" |
16GB(4060Ti/4070TiS/5060Ti/5070Ti/9070XT) | 写码、Agent、长上下文 | UD-IQ4_XSS+对称Q4 KV仍是保守主力;有9070用户实测UD-IQ3_S(权重11.2GB)在128K下稳定40+ t/s,但踩过ROCm卡死的坑、换vulkan版才丝滑;Windows把预期压到64-72K | 别碰8.4GB;想跟先等9.3/11.8档的allocation dump和他人实测 |
20GB+(3080矿卡等) | 生产/折腾两相宜 | 3080 20G矿卡实测UD-IQ4_XS+KV4bit四种玩法:视觉MTP全开86K约38t/s、关视觉保MTP往128K走、关MTP保视觉约28t/s能到180K、全关纯文本240K——MTP就是拿约1G显存换一档速度;激进玩法是llama.cpp-adaptive-kv-streaming分支,16G宣称可开256K、线性衰减,但参数敏感、有人实测爆显存 | 当补充任务跑,不必当主力 |

接下来盯什么
GSQ-RCO仓库会不会给全部四个版本公开per-tensor allocation文件——没有dump,embedding这一关谁都验不了;
K/V不对称触发CPU回退这个"一直没修的老bug"有没有进修复列表;
教程区扩散的修复版chat_template v22.5(自称解决官方Qwen模板的渲染错误、KV失效和思考污染)会不会被官方吸收——在你换不换它之前,所有测评都自带一个隐藏变量;
评论区那句"别折腾了,等3.9",当情绪看就好。
这场踢馆没有输家,输的只是榜单。点下8.4GB之前,先看Embedding档位、再看KV对不对称、最后看这份数据是在哪张卡上跑出来的——这三问,比那7.7分值钱。