98.2%保留和agent 0/6都是真的:Bonsai-2-27B上线11天,我把全网的21个实测点摆进一张表

源自27位全网作者

09-29 19:39

9月18号,PrismML把Ternary Bonsai-2-27B推上HuggingFace趋势榜第一:把Qwen3.8-27B的权重压成-1/0/+1三值,每128个权重共享一个FP16缩放系数,平均每个权重约1.75bit,整个文件5.95GB——比原版小了差不多9倍。 官方承诺给得很完整:六大基准总分83.9,只比全精度原版85.4低1.5分,分项里数学99.5%、代码99.3%、指令跟随102%,甚至反超基线。 参数单还列上262K上下文和多模态,并给出RTX 5090上每秒143个token的速度。哔哩哔哩知乎哔哩哔哩

一张8G显存的旧卡,装得下27B,跑得不算慢——这就是这波刷屏的全部卖点。知乎

于是这两个星期,B站、知乎、小红书被"8G跑27B""token自由"刷屏。但同时,另一个版本也在流传:“又被Bonsai骗了”“agent任务全军覆没”“把项目改成狗屎”。11天过去,我把能找到的21个实测点——10组速度、5组评测、6组差评样本——按同一张口径摆开。结论先放这:两边说的都对,但它们说的根本不是同一件事。这个模型值不值得你今晚挂机下载,取决于你要它干哪种活、用哪种版本组合。

一、官方98.2%是真的,但把"超时"算进评测后,故事变了

先看最有代表性的一份独立评测。知乎一篇zxbench评测(评测日9月18,831个相同场景)把Bonsai的PTQ1_0版(5.95GB,约1.75bit/权重)和ISTA-DASLab的Qwen3.8-27B IQ3_S版(11.8GB,约3.5bit)放在同一题库对打,超时按0分计入总分。知乎

结果IQ3_S综合领先:11个维度赢10个,总分80.39对77.23,领先3.16分,通过题数700对671。 但差距的来源很有意思:简单题和中等题几乎打平,分差全部来自长任务——20道编程长任务里,Bonsai有6道直接超时吃0分,Qwen赢下14/20。知乎

反过来,Bonsai在工具/CLI调用维度是反超IQ3_S的,调度、库存这类约束明确的推理题拿到100分,比Qwen的87.43更高。 评测方把话说得很直:Bonsai的问题不是答案质量差,而是完成率。知乎

第二份证据是B站翻译进来的PromptEngineering实测:简单任务上,Bonsai确实能达到宣称的98%性能,但在需要多步骤规划的长智能体任务里彻底失败,六个项目无一可用,常陷入重复调用工具的死循环。 官方数据自己也留了个脚注:长任务基准上它只保留约75%到76%。哔哩哔哩

塌方的原因讨论区已经说穿了:这条量化路线没有针对离群值做优化,遇上难的边界问题就循环崩溃。 这就是为什么"98.2%的智商"和"agent 0/6"能同时为真——基准测单题答得好不好,agent要的是一口气干到底会不会断。知乎

二、6t/s到143t/s都是真的:拉开差距的不是卡,是版本组合

同样的Bonsai-2-27B,全网报出来的解码速度能差20倍:

硬件/版本组合

实测decode

上下文

样本来源

RTX 5090(官方口径)

143 t/s

—

B站发布报道

M5 Max(官方口径)

46.8 t/s

—

同上

5080 Laptop 16G + NInfer + MTP投机解码,KV量化k8v4

89.6 t/s(10次采样极差85-96)

253,952

知乎编译部署实测

4060Ti 16G + 专项编译分支 + GPU优化

40-50 t/s

262K

B站实测

5060 Laptop 8G + 32G内存

~40 t/s(prefill ~270 t/s)

有限

B站启动参数分享

16G显存 + MTP2 + KV q8_0

45→18 t/s(随长度衰减)

120K

B站评论区自测

5060接入联网搜索后

30→19→11 t/s(随任务复杂度)

—

B站评论区实测

AMD 6800XT 16G + 32G内存

22-25 t/s

仅16K

小红书

RTX 3060 12G 拉到64K上下文

个位数 t/s

64K

B站评论区

把表横过来读,规律有三条。

第一变量不是显卡,是投机解码和KV量化。跑出90 t/s的那台16G笔记本,作者自己写明:关掉MTP对比,草稿token接受率约50%时速度大约对折——MTP是90 t/s的天花板控制项。 部署圈的共识就是一句被顶在评论区的话,版本对上了才叫能跑,不然全是坑。知乎哔哩哔哩

8G卡的"能跑"是真的,"长跑"要看内存。5060 Laptop 8G配32G内存,跑出了prefill约270 t/s、decode约40 t/s。 但上下文长度一上去就是悬崖,差评区被36个赞顶在最前面的那条是这么说的,并不会更快,只有30k以下上下文快一点,然后连思考都没完就死循环了。哔哩哔哩哔哩哔哩

接上工具链,速度继续打折。同一台5060:单纯出文字30 t/s左右,接入联网搜索只剩19 t/s,要求再复杂就只有11 t/s。 "token自由"帖里的截图速度和你在Hermes/agent里的体感速度,中间隔着这两层折扣。哔哩哔哩

三、按你要它干的活对号入座,别按显卡

差评区里最扎心的一条来自一位5090用户:一直用q4权重做项目开发,换了5.9G版试了下——“速度确实快,但成功把我的项目改成狗屎了”。 同层楼24赞的总结同样冷,不如gsq-rco,尽管这个体积小,但是稳定性差多了。哔哩哔哩哔哩哔哩

所以我建议按"活儿"分档,而不是按卡:

可以上:问答、摘要、翻译、结构化输出、RAG查库。这类短任务正是98.2%覆盖的区间。知乎那位40题复测的作者把话说得克制:样本量不大,不足以证明分不低于官方,但足以回答那个真问题——三值量化27B在日常数学、知识问答、指令跟随上没有可感知的劣化。 8G卡+16G以上内存,用官方prism分支编译的llama.cpp或现成整合包,当一台离线AI员工是成立的。知乎

观望:轻agent、单步工具调用。工具/CLI维度反超、约束明确任务上100分打87分,这些都是真的;让它干"读表→算账→填模板"这种有明确边界的活,它是划算的。

别上:多步规划、长链路coding、过夜跑的agent。长任务超时、agent六件套0/6、工具死循环——不是概率问题,是结构问题。评测方的原话:真正的分界线在任务进入长链推理、多文件修改、严格超时约束之后,IQ3_S更不容易出现0分式失败。 这类需求老老实实走11.8GB的IQ3_S路线,多花6个G,买的是完成率。8G显存还想真干活的,评论区也有人留了对照:原版4bit好歹90K上下文还能用、真的能干活、还能开MTP。知乎哔哩哔哩

顺带一个正在发酵的分歧:小红书有人拿三值5.6GB和MoE稀疏激活20GB上了同一组30道题实测,结果直接打平27:27。 8G卡用户面前其实摆着两条路线——三值买体积,MoE买稳定,现在谁也说服不了谁。小红书

四、下载前的四个避坑自查

一,文件名和"FP16"三个字别混着信。有UP主被评论区拆穿:仓库里那个18.2GB的`.ninfer`文件,权重自己标着base_model_relation: quantized,是3/4/5bit混合量化,不是全精度。 同理,官方GGUF 5.95GB、NInfer制品9.8GB、IQ3_S 11.8GB,是三个不同的东西,测评截图混着用很常见。哔哩哔哩

二,推理引擎用对分支。官方prism专用版发在PrismML-Eng的llama.cpp fork上,直接认准llama.cpp的prism-b10743发布标签下载;NInfer是另一条三值内核路线,跨架构移植的坑在设备枚举不在内核。 用大众版llama.cpp跑官方GGUF,速度和上下文会让你误判"这模型不行"。哔哩哔哩

三,上下文是内存黑洞。模型文件只有6个G,但25万上下文的KV缓存要靠K 8bit、V 4bit这种量化才塞得进16GB显存——内存低于16G的用户,别按官方宣传的262K去设参数。知乎

四,"98.2%保留"的口径钉死在thinking模式六类基准的平均分。指令跟随102%是真的,agent 0/6也是真的,两个数字不冲突,冲突的是拿前者当后者用的帖子。

五、接下来盯什么

第一代Bonsai(7月)被普遍当Q1级玩具,第二代最大的改进恰恰在质量,把基准分差从5个点左右缩到1.5个——方向本身是真的在进步。 值得盯的信号有三个:PrismML后续会不会上离群值优化版,三值塌方的根源就在这;zxbench这类"超时计0分"的口径会不会变成社区标配,如果变标配,Bonsai的分还要往下掉;以及NInfer方案在非40系卡上的移植进度——现在AMD 6800XT用户还被困在16K上下文、22到25 tokens每秒里。哔哩哔哩小红书

一句话收口:5.9GB的27B不是营销号标题,也不是骗局,它是一张"短活满分、长活看版本"的技能卡。8G、16G卡的用户今晚挂机下载没有沉没成本;但如果你指望它替你跑一整晚的项目,这11天里所有翻车帖子都在说同一件事:那6个G的差价,现在还买不起。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章