丐帮的显存又不够用了,这回是被"太够用了"吓的。
10月9日晚到10日,本地模型圈连着落地两件事:一篇量化论文把2-bit量化里常用的MSE损失换成RMSE口径,按中字转述视频的说法,仅替换一个损失函数就能挽回超六成性能。哔哩哔哩
紧接着Underdog发布Saluki 27B,把Qwen3.8-27B压成约2-bit的GGUF。 文件大小则仅有7.89GB。 按Apache 2.0协议开源。小红书知乎知乎
作者递出来的自报成绩很扎眼:工具调用88分,反超满血版的84分,选工具47/48,标准llama.cpp免编译。哔哩哔哩
换成两个月前,这套话术在评论区活不过三小时——"低位宽=交智商税"基本是这一圈层的肌肉记忆。
可反证的反证也来得快:同一份发布自报里,作者自己写了四个字——“数学弱、纯文字”。 这四个字比88分更值钱,它等于官方自己把"反超"的边界画好了。哔哩哔哩
所以这2天值得做的不是站队,是把官方自报、论文转述、社区实测这三类数字分开放进同一张表。8–16GB显存的,下载那个7.89GB文件之前,先对完下面两本账。
一、先把10组数字摆一张表(来源类型标在右边)
# | 数字 | 说的是什么 | 来源类型 |
|---|---|---|---|
1 | 7.89GB | Saluki 27B文件,2-bit GGUF | 发布页 |
2 | 约54GB | Qwen3.8-27B满版权重,压到约1/7 | 发布页+搬运转述 |
3 | 88 vs 84 | 工具调用自报,反超满血版 | 作者自报,目前单一来源 |
4 | 47/48 | 选工具:固定工具集里选对名字填对参数 | 作者自报,单一来源 |
5 | “数学弱、纯文字” | 官方自己标注的短板 | 发布页 |
6 | 约5.9GB | 同期热榜上Bonsai 2系27B文件 | HF热榜盘点转述 |
7 | 超六成 | 换RMSE类损失对2-bit性能的挽回幅度 | 论文(中字转述) |
8 | 上万倍 | 传统MSE下浅层与深层量化误差的差距 | 论文(中字转述) |
9 | 16G/5060Ti | 量化27B装得下,但真正吃显存的是上下文和KV缓存 | 实机自报+评论区 |
10 | 32G/M5 | “模型跑得动,带不动agent应用”:选错工具、参数写错、多步丢目标 | 知乎真机自报 |
表里有两组数要单独说清楚。88/84和47/48目前只有单一来源,就是作者自己那一页,中文圈都是转述,评论区还没出现同机复现的对照数;"上万倍"和"超六成"来自论文,但目前只见到中字转述,没人贴第三方复现图。证据覆盖到这里,结论就只能说到这里。
二、能力账:反超在哪一个切片里成立
“27B被压成7.89GB还打满血”——这句话拆开看,“打满血"只发生在47/48那个切片:给定一套工具,选对名字、填对参数,本质是分类加格式填空。这类能力恰恰是量化里最抗揍的。而学界已经给过能力塌方顺序:ACL 2026研究发现,推理最怕低精度,知识应用最吃模型规模。 Saluki官方自报"数学弱”,跟这个排序严丝合缝——不是巧合,是2-bit的能力结构本来就这样。小红书
社区对2-bit的警惕不是凭空来的。ICML 2026连续比特量化研究的开场白,就是本地党的日常困境。 这轮新论文修的就是"暴跌"的成因:强行2-bit时传统均方误差会让各层优化极不均匀,浅层与深层的误差差距高达万倍。小红书哔哩哔哩
所以这轮"反超"真正成立的说法是:2-bit在工具调用切片里,第一次够用了。不是"2bit变强了"。对号入座:日常主要跑问答、RAG检索、结构化提取、工具编排的,这个切片就是你的主力工况,88和84的差距对你比对满分榜党重要;反过来,主力是数学推导、代码重构、长文推理的,官方自报的短板正好怼在你脸上,这张反超表跟你无关。
还有个更麻烦的空档:agent不是单次工具调用,是链条。知乎上一位拿32GB M5实测qwen3:8b的用户,结论是八个字:模型跑得动,带不动agent应用。 选错工具、参数写错、多步之后丢目标,链条就是这么断的。88分是受控单步环境里的数字,链条里量化损伤会不会滚雪球,目前没人报数。知乎
三、显存账:7.89GB不是给8GB卡准备的
文件尺寸是门票,不是总账。Kai那期视频把逻辑说透了:模型经量化能装进RTX5060Ti,但真正吃显存的是上下文和KV缓存,智能体工具很快占满窗口。 评论区那句"做正经编程任务至少得264k上下文",基本是把"8GB卡跑27B"从装机区拉回了现实区——264k上下文的KV是什么量级,丐帮都算过,答案是装不下。哔哩哔哩
还有一个48小时里没出现的东西,比出现了的更值钱:目前没有一条"带长上下文的同机速度自报"。t/s没有、首字延迟没有、16k/32k上下文下的显存占用也没有。硬盘党那批人上个月刚被端侧方案的低速自报教育过一回,这次先别急着替Saluki把速度账填上。
四、路线账:多花2GB买什么
27B进8GB不是Saluki一家的动作:Ternary Bonsai 2 27B在前,压完大约5.9GB,2-bit量化把27B压到5.9GB直接上了HF热榜盘点。 5.9和7.89之间这2GB,买的不是参数,是能力结构——三值极限压缩和"换损失函数保能力"是两条完全不同的路线,谁在你的工况里活得好,得等同机对照。小红书哔哩哔哩
知乎那边已经把这轮归成了"8GB级智力的两个来源":Mellum 2.1这类小模型和Saluki 27B并列出现,两者都~8GB体积、单卡消费级可跑。 一个是12B从零用强化学习训出来的编码特化生,一个是27B往死里压出来的压缩体。单卡党未来两年的选择轴,大概率就是这条"小模型从零训 vs 大模型往死压"。知乎
五、切片判断:谁今天下,谁再等等
可以直接下的:8–12GB显存、主力工况是问答/提取/工具编排、有断网刚需、并且愿意自己把速度账和长上下文账跑出来的——Saluki现在就是这个活台账最好的一页,下载它有一半是给社区交数。已有博主说它"可能改写本地Agent门槛",这个判断目前只对工具编排党成立。小红书
先别急的:跑数学、代码重构、长文推理的(官方自报短板正怼脸);想拿它替API跑生产并发的;以及指望"7.89GB"能塞满8GB卡就万事大吉的——KV和引擎开销那本账,一分都不会少。
继续盯的三个信号:一是带长上下文的同机速度自报什么时候出现,二是88/84有没有第三方复现,三是Strata、ninfer这些已经吃透卸载路线的引擎,哪天宣布对Saluki文件格式的支持——那才是2-bit文件从收藏党进主力党的发令枪。
这轮真正变的,不是"2bit终于能打",是"2bit开始成为一个正常档位"。论文修的是损失函数,文件修的是显存门槛,还没修好的是信任——信任不缺一个88分,缺的是下一条带着上下文长度和显存曲线来的自报。