先说这篇写给谁:手里只有一张8GB或16GB显存的卡(或者一台16G内存的笔记本)、正在琢磨把Agent、工具调用这类活从API订阅搬到本地的人。深度党、有多卡的可以先划走,这篇的账本不是给你们算的。
10月8日前后,一个署名ConwayResearch的Underdog团队把Saluki-27B推上了讨论区顶部:基座是今年被本地党翻来覆去折腾的Qwen3.8-27B,做法是用2-bit量化把约54GB的全精度权重压到7.89GB,官方口径是"保住96%性能",主打工具调用。知乎的问题帖是10月10日建的,B站最火的一条实测视频两天内跑了5665播放、277收藏,评论区最高赞的那句"你是4096上下文用户吗🤔"有15个人点赞——热闹和质疑是同一分钟长出来的。发布才三天,我把官方模型卡、社区自报数字和一篇10月初的量化论文摆成三本账,你下载前对着核。哔哩哔哩B站
第一本账:空间账——7.89GB是文件大小,不是你显卡的账单
官方给的7.89GB是权重落盘体积。小红书那条帖子的说明写得直白:7.89GB是模型文件大小,不是运行内存要求,看图还需额外加载视觉组件。知乎问题帖的描述还有一句容易被跳过:2-bit版Saluki只保留了文字I/O,基座那个262K上下文、能看图的多模态Qwen3.8-27B,和你下载的这份不是一个完成度。小红书哔哩哔哩知乎
文件大小和运行开销之间隔着一整条KV cache,这不是每个模型各自踩的坑,是这一代小文件模型的公共账单。同一张4080上的对照测试把差价摆得很清楚:稠密27B三值版权重文件8.9GB,跑起来显存实测12.7GB;IQ3_S版文件12.2GB,显存15.5GB。也就是说,按社区自报的口径,文件到运行之间至少还要再加3~4GB的开销,上下文越长加得越多。那台4080的分层账本长这样——专家权重驻显存、KV cache量化后分层、查找表下沉:知乎

所以8GB卡塞7.89GB权重是什么场面,评论区那句质疑其实已经替你把账算完了——“放进去直接上下文没了”。16G笔记本党倒是真能跑:10月10日那条"54GB压到7.89GB"的实测确认标准llama.cpp免编译就能起,OpenAI兼容接口一条命令架在8080端口。但代价是把大上下文让给内存换页和首字延迟,262K是基座的天花板上限,不是你机器上的可用额度。想要16G卡上"跑满"27B的另一种花法,10月7日那位5070Ti用户的实录走的是NInfer+GSQ IQ3_S、128K上下文路线,跟Saluki是两条不同的省钱路。B站B站哔哩哔哩
第二本账:智力账——"反超满血版"是真的,但反超的只有一项
官方最抓眼球的数字:工具调用120题自测,Saluki通过88题,原版Qwen3.8-27B通过84题;另一组"选工具"测试是47/48。反超是真的,两个限定条件也是真的——样本只有120题,且是开发者自报。小红书那条"saluki-27b有点东西"的帖子同样把"样本较小、数学能力有损失"写在正文里。B站小红书
社区实测报回来的短板清单和官方口径基本咬合:数学和字符推理打折扣、并行调用偶尔有小bug——这是视频简介里主动交代的。;评论区有人问"雷霆大思考严重,小模型是不是都需要这样",有人发现"这个模型是个限制模型,有没有社区Uncensored版本?"——底座的审查继承问题,官方模型卡里没有答案。哔哩哔哩B站
至于"保住96%“,证据强度不够下结论,放进展望位就行。隔壁三值化Bonsai 2去年9月喊"平均保留98.2%”,社区翻完20项基准后的对账单是:长程agent任务只剩约75%,SWE-bench Verified从全精度80.6掉到60.8。量化模型的"平均分"和"你真正要它干的活"之间,历来差着一整个科目。知乎

第三本账:速度账——这轮2-bit能翻身,靠的是一行公式,但"省字节"从来不免运费
先说为什么2-bit突然能用了。10月7日CloudCodes拆解的那篇论文(arXiv:2610.00983,讲训练后量化的优化失衡)给了机制解释:逐层量化时,浅层到深层的重建误差能差出上万倍,而传统MSE损失让本来就压得好的层只拿到百分之一的优化推力;换成RMSE等于给每层一样的推力,在Qwen3.5-27B的W2A16上,困惑度从37.51掉到22.20,准确率从60.45%抬到70.96%,校准时间变化在-1.19%~+2.82%之间、峰值显存增幅精确为0。这是"改一行公式救活2-bit"这轮叙事的来源。但请注意口径:实验基座是Qwen3.5-27B,不是Saluki——论文解释的是"为什么现在敢发2-bit",不是"Saluki为什么88分"。哔哩哔哩
速度的账要靠同机对照才能算。那张4080上的社区自报:Saluki跑30-50t/s,同一套引擎、同样参数下Ternary-Bonsai 2的MTP版本能到100t/s还挂着256K上下文(KV Q4)——"太慢了这模型"就是这条评论的原话。更狠的反例在5090笔记本上:三值化Bonsai 2权重8.3GB、NVFP4版17GB,前者比后者小一半,8路聚合吞吐却只有约205t/s对784t/s。那篇实测文的总结值得抄在本子的扉页:“省的是字节,费的是算术”——低位宽权重没有硬件矩阵单元直接吃,解包要在CUDA core上补回来。同机五版本的表也摆着同样的取舍:三值版107t/s但CMMLU只有68,IQ3_S版89t/s、CMMLU 82,IQ3_XXS版166t/s、CMMLU 88——但后两个文件60GB起步,靠Strata把热区留在显存、其余丢内存、查找表扔SSD才塞进16G卡。那位4080主人的监控面板记下了这笔交接:16G的卡显存顶到15.6G,11万token长上下文下prefill 3344 t/s、解码88.7 t/s、卡温74度、功耗306W——贴着320W的上限在跑。B站知乎知乎

免费午餐不存在,要质量就在内存和等待上交税,这是4080实测文的原话,也是这轮所有"小文件大模型"共同的路税。
按你的卡容量,这三天该不该动手
8G显存党:CloudCodes的视频结尾给了不客气的建议——8GB显存设备,跑4-bit的9B仍然比勉强塞2-bit 27B可靠。Saluki在这类机器上的正确姿势是当"专用工具调用小钢炮":温度设0、按需关思考、上下文往短了用,别指望它同时是你家里最聪明的模型。哔哩哔哩
12~16G显存党:你是Saluki真正的设计服务人群。16G笔记本免编译可跑是实测确认的,但先决定你在买哪一科:工具调用(Saluki/三值系)还是均衡质量(IQ3_S路线或Flash-Next的IQ2_XS)。10月9日那篇"显存12G就别研究27B"的主张(Flash-Next版本答案论)和社区吵了一个月的125B-vs-27B是同一场分歧的新回合——没有共识,只有取舍。知乎
24G及以上:这篇的三个账本你基本都绕得过,原版量化文件随便挑,Saluki对你更像一张"要不要把工具调用流量分流出去"的考题,不是门票。
两个提醒。第一,去HuggingFace核对repo名再下文件:官方口径指向ConwayResearch/Underdog-Saluki-27B-1.0,免费。搜索前排有标题写"多模态"、正文塞网盘打包链接的账号,资料地址直接挂在简介第一位——2-bit版官方描述是纯文字I/O,"多模态"三个字是打包号的标题,不是模型的。第二,把观察位留给这三个信号:社区跑出来的长程agent任务分数(而不是120题短任务)、uncensored/视觉模块有没有补进权重仓库、Strata和ninfer这两个本月最活跃的引擎会不会给Saluki做专项加速——9月底那批Bonsai调教插件的作者已经证明,社区给这类小文件模型续命续速度的速度,比官方快。小红书B站
这轮"2-bit翻身"到底是一次真降价还是又一波文件大小的军备竞赛,答案不在发布第3天的自测表里,在第10天、第30天的社区对账帖里。我会继续盯着,下次摆表见。