9月17日,PrismML把Ternary-Bonsai-2-27B推上了HuggingFace:把Qwen3.8-27B的权重压成正一、零、负一三种值,每128个权重共享一个FP16缩放,平均每个权重只用1.76个比特——整个模型文件5.9GB,比全精度小了9倍多。官方口径相当激进:综合基准83.9对85.4,保留原版98.2%的智能,六个维度里五个保住96%以上,指令跟随甚至跑出102%,反超全精度原版;262K上下文、图文多模态、Apache-2.0协议。哔哩哔哩
翻译成人话:8GB显存的卡,第一次有了跑得动“27B级”模型的可能。12G卡用户更是被直接点名——上一篇我们替大家算过Qwen官方8个量化文件的账,Q4_K_M一个文件11.8GB,12G的卡装进去只剩24MB余量,上下文根本不敢开。现在这个只要5.9GB,省下来的空间全是上下文的。
然后48小时过去,全网实测交出来的结论是精神分裂的。
速度这一项,官方没吹牛,但要按卡分档
Bonsai2的提速逻辑是带宽账:权重体积缩到1/9,decode阶段要搬的数据就少9倍,对显存带宽有限的消费级卡收益最直接。实测下来这个账成立,但成立幅度完全取决于你的卡。
B站有UP主在A3000笔记本12G上实测,只有9.5 tok/s——能跑,谈不上流畅。哔哩哔哩
国内技术区最较真的那期RTX 3060 12G压测报出33 tok/s,全程带功耗仪、显存占比快照和102样本盲测,就是要看它比原版Q4到底缩水了多少。哔哩哔哩
DigitalSpaceport单卡RTX 3090实测稳定在68–70 tok/s。哔哩哔哩
知乎用户实测:4080 SUPER配ninfer框架加MTP头,单流冲到96.7–130 tok/s。知乎
官方给RTX 5090的数据是143 tok/s,还顺带报了个环保账:4090上每token功耗0.714毫瓦时,比8B全精度省40%电。哔哩哔哩
但别忘了硬币反面:知乎那篇拆解码开销的分析算得很清楚——Bonsai2的推理时间里,大头是两份权重流和base-3解码,占了39%~41%。也就是说越靠近CPU、带宽越差的设备(笔记本、老卡),实际提升越会打折扣。“官方143”和“你的9.5”都是真的,中间隔着显存档位。知乎
98.2%是真的,但它保的是“做题”,塌的是“干活”
这是48小时里最大的分歧点,把各家测试摆在一起看就明白了。
官方和搬运侧的证据:基准综合分保住98.2%,指令跟随102%。国内那期“8组多阶段真实工程任务”横评(Bonsai2 PQ2_0对打Qwen3.8-27B Q4_K_M,同机RTX 3060、128K上下文)交出的结论是“基础能力零塌缩”——逻辑推理这些短平快的基础任务,确实看不出差别。哔哩哔哩
反方证据同样硬。RepoChad深度测试后给出数据:学术基准保留98.2%,但SWE-Bench Verified与TerminalBench实测里,智能体编码任务掉了约25%,“98.2%”在他这里被判言过其实。DigitalSpaceport让两个版本通过同一个Hermes Agent生成街机游戏套件,工具调用零失误没出问题,但复杂任务的代码可玩性和创意明显弱于FP16原版。B站那条5200播放、54条评论的吐槽视频《又被Bonsai-2-27B这个模型骗了》写得更直白:本以为底子是Qwen3.8-27B,上下文能开到262K,还能看图、能调工具,下载来测试了一下,感觉啥也不是。哔哩哔哩哔哩哔哩哔哩哔哩
评论区还有人复现了更具体的塌法:并不会更快,只有30K以下上下文快一点,然后连思考都没完就死循环了,远不如原版4bit——好歹人家90K上下文还能用,还能开MTP。哔哩哔哩
三拨人测的其实是三件事:跑分测的是选择题,基础任务测的是单轮对话,而真正塌方的是长链条Agent任务。三值权重的误差在单步里可以被FP16缩放吃掉,到了需要模型连续调用十几个工具、自己纠错的长程任务里,误差会复利。“保留98.2%智能”和“编码干活少四分之一”,两句话都对。
最容易被忽略的成本:这套格式现在还不是“即插即用”
官方视频简介里有一行小字:原版llama.cpp读不了这个格式,要用官方fork。也就是说你习惯的Ollama一键拉模型、LM Studio点两下就聊的流程,目前接不住它——想玩就得自己编译PrismML工程侧那个llama.cpp分支。或者等ninfer这类第三方框架适配——知乎那篇标题里直接喊出“闪电侠”的拆解文,就是在自己写打包器,把402个三元矩阵的码字逐字节搬运,绝不反量化再量化,因为那样体积会炸回去。哔哩哔哩哔哩哔哩知乎
还有KV cache这头吞金兽。权重确实只占5.9GB,但上下文一长,KV cache照样吃显存:有16G显存的用户实测报告是,开MTP2、KV cache压到q8_0,才勉强上到120K上下文,decode已经掉到18 tok/s量级。省下来的空间,别忘了还要留给多模态的视觉编码。哔哩哔哩
到底要不要换:按你的卡给结论
把社区所有实测的隐含共识抽出来,其实是一张很清晰的分层表。
8G显存用户:值得装,但请带着正确预期。 这是你的卡第一次摸到27B级的门槛,那条吐槽视频评论区里定位最实在的一句话就是这类用户的心声——只要能打过Qwen3.5-9B、Ornith-1.5-9B、Gemma这些就赢了,有条件谁不是27B Q4_K_M起步。别拿它当干活主力,当“低配越级玩具”它很称职。哔哩哔哩
12G显存用户(3060/4070系):想要长上下文才换,否则Q4_K_M仍是稳的。 11.8GB vs 12GB的死结确实被它解开了,但128K上下文的工程任务实测显示思考代价偏高、超过30K后速度优势收窄。日常聊天写作、想试试100K+长文档,换;天天跑Agent写代码,原版Q4先顶着。
16G及以上(4060Ti 16G/5060Ti 16G/3090):大概率不用折腾。 Q4_K_M装得下、上下文敢开、生态完整。吐槽视频下14赞的第一名评论就是这类用户的态度:不如GSQ-RCO,稳定性差多了。知乎刚出的那篇GSQ-RCO对比分析给的答案一样:RCO方案把非均匀混合精度GGUF按张量敏感度和总体大小预算分配量化类型,IQ3_S版平均约3.50bit/weight,走的是成熟GGUF生态、不用折腾fork,稳定性正是它的强项。哔哩哔哩知乎
这篇之外,接下来盯什么
Bonsai2真正的历史意义,其实不在那98.2%,而在它把“极端量化的能力边界”往前顶了一格:一代保95%、二代保98.2%,按这个速度,三代可能就是“多数场景无感”。值得继续观察三个信号:PrismML的llama.cpp fork会不会被上游合并(决定Ollama/LM Studio什么时候能一键加载)、ninfer这类框架对三值格式的支持会不会铺开(决定速度上限)、以及社区会不会拿出一套“长程任务”基准来替代现在被各家跑分绑架的选择题测试。
一句话收尾:98.2%没有骗人,骗人的是把98.2%当成“和原版一样”的你自己的预期。8G卡的兄弟们,这次真有新玩具了——先想清楚你要它做题还是干活。