这个周末,本地大模型的下载清单悄悄降了一个档位。10月9日,天天盘HuggingFace热榜的UP在榜单里写下"2bit量化把27B压到5.9GB"。10月10日,基于Qwen3.8-27B压出来的Saluki-27B文件已经有人塞进16G笔记本跑通,10月11日笔记爬上小红书,还特意补了一句:7.89GB是模型文件大小,不是运行内存要求。同一条时间线上,10月7日发布的那篇量化论文正在被中字视频反复搬运——2-bit量化常让大模型彻底崩溃,但最新研究证明,仅替换一个损失函数就能挽回超六成性能。它的结论简单粗暴:2bit以前翻车,锅不全在权重,校准用的损失函数一直在"偏心"。哔哩哔哩小红书哔哩哔哩
8G显存台式机、16G轻薄本这批丐帮老玩家是最先动的:4bit档的文件已经下过一轮了,现在6-8GB级的新文件就摆在面前,"270亿参数塞进16G笔记本、工具调用88分反超满血版"的标题就写在视频封面上。要不要换主模型,成了这两天的真问题。
先把四天里来自论文、模型卡、中字视频、实测笔记和评论区的23组数字摆成一张表。所有数字都是厂商/开发者自测或第三方转述,口径写在右边,别当背书看。
# | 数字 | 出处与口径 |
|---|---|---|
1 | Bonsai 2:权重只取-1/0/+1,真实1.72bit,54GB压到5.9GB | B站UP主2026-10-09盘点HF热榜,转述Prism ML官方口径 |
2 | 同上:“保留98.2%智力,笔记本47 token/s” | 厂商自测,UP主转述,未见第三方同机复现 |
3 | Underdog-Saluki-27B-1.0:基于Qwen3.8-27B,约54GB压到7.89GB文件 | HF模型卡ConwayResearch,小红书/B站10月10-11日转发 |
4 | 换算:54GB→7.89GB≈平均2.34bit/权重;54GB→5.9GB≈1.7bit | 按文件体积÷参数量折算,非官方标注 |
5 | Saluki用标准llama.cpp即可跑,免编译 | B站实测视频10月10日,1016播放/32收藏 |
6 | 论文《Optimization Imbalance in Post-Training Quantization》(arXiv:2610.00983):顺序量化时,浅层到深层重建误差差距高达1万倍 | 论文口径,10月7日Cloud Codes原视频/10月9日中字 |
7 | MSE损失让小误差层的优化推力弱约100倍 | 同上,论文结论转述 |
8 | 把MSE换成RMSE,每层获得等比1/√N推力,改动约一行代码 | 同上 |
9 | Qwen3.5-27B(W2A16):困惑度37.51→22.20 | 论文自测,B站中字视频10月9日 |
10 | 同模型准确率60.45%→70.96% | 论文自测口径 |
11 | 校准耗时变化-1.19%~+2.82%,峰值显存额外开销0.00% | 论文自测口径 |
12 | Saluki开发者自测:120道工具调用题,2bit版过88题,原版过84题;选工具47/48 | 模型方自测,样本小,只测工具调用场景 |
13 | 同一批自测附带结论:数学明显变弱,纯文字 | B站10月10日视频转述 |
14 | 小红书笔记提醒:7.89GB是模型文件大小,不是运行内存要求;看图还要额外加载视觉组件 | 10月11日笔记原文 |
15 | 讲论文的Cloud Codes自己的部署建议:8GB显存设备,跑4bit-9B比硬塞2bit-27B更可靠 | 10月7日原视频"务实部署建议"段 |
16 | 量化自测疲劳的社区温度:6bit视频评论区25赞高评"不看这视频,我还以为4bit比6bit强呢" | B站评论区10月8日 |
17 | 同评论区变量提示:“单次随机程度、用的什么harness,结果都不一样;我IQ3_S配qoder比你Q6都好” | 同机用户自报,10月9日 |
18 | 同评论区事故档案:写坦克小游戏,27B-q5-kv8正常跑完,另一条4bit线直接黑屏起不来 | 用户自报,10月9日 |
19 | 单张RTX 5090(32GB)跑量化后Qwen3.5-122B:权重全在卡上没搬CPU,固定短请求下整卡已用显存采样峰值30.64 GiB | 小红书实测记录10月10日,NVML整卡口径,作者自报 |
20 | 同实验35B版:128-token输入时PyTorch分配峰值约14.85 GiB,输入拉到16K仍只生成64步,涨到18.26 GiB | 同上,框架分配口径,与19行读数不可混用 |
21 | 同122B对比BF16:HumanEval 135/164→134/164、CMMU子集163/201→161/201、GSM8K子集190/200→189/200、中文与格式48/48→46/48 | 开发者自测,四组各少1~2题,作者注明"预设质量门槛还没过" |
22 | RTX 4060级8G卡实机《问道凡尘》:三元量化Qwen3.8-27B(Ternary Bonsai 2)约5秒回一句,重复对话概率高于Q4版;开思考模式回复长达60秒没法玩 | 小红书实机自报10月7日 |
23 | 本地模型StartLux-27B的MCP-Universe测评:综合第二、多项专项第一,题集总口径693题 | 36氪报道(8月31日),第三方测评 |
第一本账:7.89GB是文件的账,不是你这台机器的账
这张表里最容易被读歪的就是第1、3两行。文件尺寸≠占用内存。模型权重是静态的,真正在推理时吃显存/内存的大头是KV缓存和上下文窗口,同一张卡有人3 token/s有人70 token/s,差的就是这些。被中字搬运的Kai那条视频把话说明白了:模型量化后塞得进5060Ti,但能加载不等于能完成任务,agent工具链一开,窗口先被吃掉一块。哔哩哔哩

第19、20行把这本账算到了你眼前:122B量化后权重全压在一张32GB卡里,固定短请求下整卡读数30.64GiB——离爆卡只剩一个窗口的余量;同一个实验里35B从128-token输入到16K输入,框架分配峰值从14.85GiB涨到18.26GiB,涨的全是上下文。所以看到"5.9GB进16G笔记本"先别下单硬盘空间,把三笔都记上:文件本体(6-8GB档)、你日常要开的上下文对应的KV缓存、以及像Saluki这种带视觉组件的"看图另算"(第14行)。第15行才是这批文件真正的对手——连讲论文的人自己都在建议:2-bit依然存在信号衰减,8GB显存别硬上2bit-27B,跑4bit-9B更稳。不是2bit不行,是在8GB这个档位,2bit-27B和4bit-9B之间没有普适答案,只有任务答案。小红书哔哩哔哩
第二本账:88分是真的,但"反超满血"这四个字要打折
第12行的自测,开发者口径:120道题,2bit过88,原版过84。数字本身没造假,造假的是读法。
拆开看:一,样本120道,全是工具调用一个场景,数学被模型卡自己承认"明显变弱"(第13行);二,这是模型方在自家benchmark上的自测,第2行的"保留98.2%智力"同样是厂商口径,到今天为止没有一组公开的"同机4bit对比2bit"复现——社区现在最缺的就是这个对照;三,那位自己把122B压完再对答案的开发者写得诚实,四组开发评测的总通过数各少1~2题,预设质量门槛还没过。掉分少不代表过线,这是2bit波里最容易被标题吃掉的一句话。小红书

顺便给"题量"找个参照:第23行的StartLux-27B过的是MCP-Universe 693题的第三方口径,综合第二、多项专项第一;Saluki自测的120题只占这个量级的六分之一——工具调用分数要横向可比,题集得先对齐。第17行那位老哥提醒的变量也是真实存在的:单次随机程度、用的什么harness、提示词模板,换个壳结果就变。上一波6bit vs 4bit吵到139条评论,最后留下的社区共识就是第16行那条25赞的阴阳怪气:量化文件的自测分,信一半。36氪哔哩哔哩
“反超满血"的正确打开方式是这样的:在"挑工具、传参数"这类窄场景里,这个文件的下限被校准得很高(47/48),高到可以跟原版掰手腕。它证明的是2bit在特定任务上"够用了”,不是"更强了"。
第三本账:哪些活现在能搬,哪些活别搬
可以试搬:工具调用链、固定格式的抽取改写、离线OCR和双语翻译这类窄上下文、少数学、不吃多模态的活。Saluki主打"工具调用";也有人已经把GLM-OCR和HY-MT两个小模型接成自己笔记本上的离线工具箱,PDF、图片OCR、中英翻译串成一条流。方向是一致的:小权重量化后先抢"选择题"型任务。小红书

先别搬:
数学和多步推理——模型卡自曝短板(第13行),第21行的GSM8K掉分就是同一条曲线;
长上下文文档活——KV缓存这本账在量化文件上只会更紧(第20行),第18行的黑屏事故就是端到端任务翻车的样本;
图文混读——视觉组件是额外加载的(第14行);
严肃编码——4bit都还有起不来的先例,2bit只会更容易死循环,上个月Q2死循环的教训还在Strata帖里挂着;
对延迟敏感的沉浸场景——有玩家拿三元量化27B在8G卡上跑游戏NPC,每句话本地模型大概要5秒左右回复,重复回话的概率还要高于Q4量化版。8G卡上它"能玩",但"能玩"和"能干活"是两个档位。小红书

换之前,四道自测题
别用模型卡的120题,用你自己的agent最近翻过车的5个case跑一遍——知乎那条Mac mini M4的回答给过失败模式清单:选错工具、参数写错、多步任务走到一半丢了目标。这三类恰好是工具调用benchmark测不出来的。知乎
开你日常最长的上下文挂上去看余量,确认KV缓存挤完还剩多少窗口。
找一条"同机4bit vs 2bit"的实测再下结论,现在社区全是单边自报,缺对照——这也是接下来最值得盯的供给。
工具链连跑10次记方差,一次88分说明不了稳定性(第17行)。
后面盯什么
论文(arXiv:2610.00983)的RMSE校准有没有被llama.cpp/Strata这条工具链正式收编,收编了才轮到普通用户吃到红利;
有没有16G本/8G卡用户晒出2bit-27B对4bit-9B的同机对照;
HF热榜上6-8GB档的27B文件会不会从"一两家"变成"一排"——变成一排,价格战就从显存卷向任务质量了。
这四天本质上发生了一件事:54GB级的权重第一次摸到了8GB门槛。门槛变低带来的是选择权,不是答案——"88反超满血"和"4bit-9B更稳"在各自的场景里都是真的,替你把两句话拼回原境的,只有你自己那5个翻过车的case。