国庆前这两周,本地推理圈在自我打架。一边是B站那条近万赞、1.6万收藏的"token自由=bonsai27b+ninfer,8G显卡流畅运行"。另一边是点赞53、评论103的《又被Bonsai-2-27B这个模型骗了》。主角是同一个:PrismML在9月18日前后公开的Ternary Bonsai 2 27B——把Qwen3.8-27B的权重压进5.9GB,官方口径保留98.2%的智能。哔哩哔哩哔哩哔哩
以前这种"权重又变小了"的消息,老玩家笑笑就划走了。但这轮不一样:27B级的任务智商、6G级的体积、三位数的吐字速度,三个第一次凑在同一份权重文件里,正对8-16GB显存人群的胃口。把三本账摊开:体积速度账、质量账、工程账。每一本都有官方数字,也都有评论区实测跟它对不上号。
第一本账:体积和速度,这本账基本对得上
压缩思路不新但做得狠:每个权重只留−1、0、+1三值,配FP16分组缩放,平均1.72~1.76比特;量化前先做Hadamard旋转把离群权重"摊匀"再压;约2620万个敏感参数留在bf16高精度。体积账最终定格在5.93GB对全精度53.80GB,九分之一,Apache 2.0可商用,还带262K上下文和图像输入。知乎
速度官方口径是RTX 5090约143 tok/s、M5 Max约47。社区复测更接地气:一位4080 SUPER用户用从零手写的C++/CUDA单卡引擎NInfer,单流跑出96.7~130.8 t/s。RTX 5080 Laptop 16G用户从源码编译跑通,10次独立采样持续解码均值89.6 t/s,上下文拉到253,952。4060Ti 16G经分支编译实测40~50 t/s,还带多模态和262K上下文。知乎知乎哔哩哔哩

小红书上一套流传的NInfer配置包,把262K单请求上下文、524K共享KV、最多8槽并发、INT8 KV、Vision和MTP3直接预置成了docker compose的一条命令。小红书
这本账的结论简单:体积是真的,速度也是真的。评论区几乎没有人否认"6G显存换到27B级吞吐"。
第二本账:98.2%这个数,怎么读
官方综合分83.9对全精度85.4,98.2%是这么来的;六个维度五个保住96%以上,指令跟随甚至102%反超原版(上一代只有95%)。这张表本身没毛病——但它是平均数。

平均数之外的东西,都藏在评论区里。编程方向,swe掉了20%,评测者原话是"直接回到解放前"。一位平时用Q4权重做项目的5090用户试用后给出全场最狠的评价:“速度确实快,但成功把我的项目改成狗屎了”。还有用户发现它经常不吐完整答案,查下来的原因是模型自己输出停止token。哔哩哔哩哔哩哔哩哔哩哔哩
独立复测同样分裂,这恰恰说明问题。有评测号跑了14项思考模式基准,平均得分84.78,远超IQ2_XXS的72.59分,仅比UD-Q4_K_XL低0.4分——平均数层面确实强。同一个"鹈鹕骑自行车"SVG测试,一位用户说iq1档"只比3.8原版差一点,建议玩玩",另一位用户xhigh档思考60K直接崩盘,而GSQ那边medium档就能画出完美的鹈鹕骑车。另一位16G笔记本用户则在四组40道题上复测出40/40全对。同一份权重,不同任务、不同思考档位,两个世界。知乎哔哩哔哩知乎

所以98.2%的正确读法是:它衡量"单轮答题",不衡量"多步干活"。任务越短越接近98%;越依赖多步一致性——长链路推理、代理编码、工具链——实际保留率越低,而且逐步骤累积放大。Unsloth量化课第四期把话挑明:量化模型能正常运行,不代表量化没有造成能力损失,要看PPL和KL散度的分布。《被骗》那位16G用户的总结最实在:“但凡有个24GB显存,也不至于对它期望这么高”。哔哩哔哩哔哩哔哩
第三本账:工程账,这辆车不是免费的
“8G流畅运行"的前提是社区自研引擎,不是官方分发。那条万赞视频作者把话挑明:因为权限问题,不做权重下载,只发复现工程和工具包,成品自己组装。官方GGUF版连MTP加速都没有。社区又叠了MTP工件和GSQ、Swift、PQ2、PTQ一堆打包格式,圈里用踩坑换来的经验是"ptq1纯抽卡模型,pq2稳定性好一些”。部署链路根本没标准化。哔哩哔哩哔哩哔哩哔哩哔哩

还有思考档位这道隐藏闸门:实测者吐槽它"是个雷霆大思考,画个鹈鹕能思考40分钟",必须手动压到medium才兑现得起速度优势。一位12G的3060M用户看得清醒:模型是PrismML的,MTP头是社区训练的,工具链和内核补丁也来自社区。这份"免费"是社区劳动堆出来的。哔哩哔哩知乎
各档位怎么办(截至10月1日,证据覆盖放出后两周)
24G及以上:别心动。“能部署Q6的硬件,不需要考虑bonsai”。一位Pro 6000用户的话更狠,资源管够顶格跑了一个月,最后说自己"我能接受的量化下限就是fp8"。哔哩哔哩
12-16G:主力方案不是Bonsai,是kvmem这类社区引擎配GSQ-RCO IQ3_S——这条路线已经是16G卡的顶流,5060Ti实测30-40 t/s带256K上下文,视频攒下2200+赞。Bonsai适合当长上下文提速的实验玩具,"Kvmem跑rco iq3s,都比这东西好几倍"是评论区的主流判断。哔哩哔哩哔哩哔哩
8G:需求是聊天、文案、短任务,"比9b强太多了"是实测共识,值得装。需求是agent开发、项目编码,别碰,等正式版。哔哩哔哩
核显或4G独显:玩具,不是生产力——有用户拿笔记本1650 4G显卡跑了bonsai2的q1模型,实测2 token每秒。8G卡开64K上下文,测个鹈鹕半小时都跑不完。哔哩哔哩
继续盯什么
一是引擎正式版:万赞视频作者预告的"kvmem+ninfer+三元+显卡自适应+多格式适配"和16G配方还没落地,真成了这轮生态要洗牌一次。二是长期稳定性:目前全部证据只覆盖放出后两周,“生产力拼的不是3秒真男人,而是一直能跑下去”。生产用途至少等一个月批次口碑。三是换代信号:8G阵营已经在说"还是等qwen4比较现实"。耐心是个变量。哔哩哔哩哔哩哔哩
这轮三值量化真正证明的只有一件事:27B级智能的体积账,能压到6G。但质量账和工程账,还没跟上体积账。下次再刷到"token自由",先问一句:什么任务的自由。