9月18号,PrismML把Ternary Bonsai-2-27B推上HuggingFace趋势榜第一:把Qwen3.8-27B的权重压成-1/0/+1三值,每128个权重共享一个FP16缩放系数,平均每个权重约1.75bit,整个文件5.95GB——比原版小了差不多9倍。 官方承诺给得很完整:六大基准总分83.9,只比全精度原版85.4低1.5分,分项里数学99.5%、代码99.3%、指令跟随102%,甚至反超基线。 参数单还列上262K上下文和多模态,并给出RTX 5090上每秒143个token的速度。哔哩哔哩知乎哔哩哔哩
一张8G显存的旧卡,装得下27B,跑得不算慢——这就是这波刷屏的全部卖点。知乎
于是这两个星期,B站、知乎、小红书被"8G跑27B""token自由"刷屏。但同时,另一个版本也在流传:“又被Bonsai骗了”“agent任务全军覆没”“把项目改成狗屎”。11天过去,我把能找到的21个实测点——10组速度、5组评测、6组差评样本——按同一张口径摆开。结论先放这:两边说的都对,但它们说的根本不是同一件事。这个模型值不值得你今晚挂机下载,取决于你要它干哪种活、用哪种版本组合。
一、官方98.2%是真的,但把"超时"算进评测后,故事变了
先看最有代表性的一份独立评测。知乎一篇zxbench评测(评测日9月18,831个相同场景)把Bonsai的PTQ1_0版(5.95GB,约1.75bit/权重)和ISTA-DASLab的Qwen3.8-27B IQ3_S版(11.8GB,约3.5bit)放在同一题库对打,超时按0分计入总分。知乎
结果IQ3_S综合领先:11个维度赢10个,总分80.39对77.23,领先3.16分,通过题数700对671。 但差距的来源很有意思:简单题和中等题几乎打平,分差全部来自长任务——20道编程长任务里,Bonsai有6道直接超时吃0分,Qwen赢下14/20。知乎
反过来,Bonsai在工具/CLI调用维度是反超IQ3_S的,调度、库存这类约束明确的推理题拿到100分,比Qwen的87.43更高。 评测方把话说得很直:Bonsai的问题不是答案质量差,而是完成率。知乎
第二份证据是B站翻译进来的PromptEngineering实测:简单任务上,Bonsai确实能达到宣称的98%性能,但在需要多步骤规划的长智能体任务里彻底失败,六个项目无一可用,常陷入重复调用工具的死循环。 官方数据自己也留了个脚注:长任务基准上它只保留约75%到76%。哔哩哔哩
塌方的原因讨论区已经说穿了:这条量化路线没有针对离群值做优化,遇上难的边界问题就循环崩溃。 这就是为什么"98.2%的智商"和"agent 0/6"能同时为真——基准测单题答得好不好,agent要的是一口气干到底会不会断。知乎
二、6t/s到143t/s都是真的:拉开差距的不是卡,是版本组合
同样的Bonsai-2-27B,全网报出来的解码速度能差20倍:
硬件/版本组合 | 实测decode | 上下文 | 样本来源 |
|---|---|---|---|
RTX 5090(官方口径) | 143 t/s | — | B站发布报道 |
M5 Max(官方口径) | 46.8 t/s | — | 同上 |
5080 Laptop 16G + NInfer + MTP投机解码,KV量化k8v4 | 89.6 t/s(10次采样极差85-96) | 253,952 | 知乎编译部署实测 |
4060Ti 16G + 专项编译分支 + GPU优化 | 40-50 t/s | 262K | B站实测 |
5060 Laptop 8G + 32G内存 | ~40 t/s(prefill ~270 t/s) | 有限 | B站启动参数分享 |
16G显存 + MTP2 + KV q8_0 | 45→18 t/s(随长度衰减) | 120K | B站评论区自测 |
5060接入联网搜索后 | 30→19→11 t/s(随任务复杂度) | — | B站评论区实测 |
AMD 6800XT 16G + 32G内存 | 22-25 t/s | 仅16K | 小红书 |
RTX 3060 12G 拉到64K上下文 | 个位数 t/s | 64K | B站评论区 |
把表横过来读,规律有三条。
第一变量不是显卡,是投机解码和KV量化。跑出90 t/s的那台16G笔记本,作者自己写明:关掉MTP对比,草稿token接受率约50%时速度大约对折——MTP是90 t/s的天花板控制项。 部署圈的共识就是一句被顶在评论区的话,版本对上了才叫能跑,不然全是坑。知乎哔哩哔哩
8G卡的"能跑"是真的,"长跑"要看内存。5060 Laptop 8G配32G内存,跑出了prefill约270 t/s、decode约40 t/s。 但上下文长度一上去就是悬崖,差评区被36个赞顶在最前面的那条是这么说的,并不会更快,只有30k以下上下文快一点,然后连思考都没完就死循环了。哔哩哔哩哔哩哔哩
接上工具链,速度继续打折。同一台5060:单纯出文字30 t/s左右,接入联网搜索只剩19 t/s,要求再复杂就只有11 t/s。 "token自由"帖里的截图速度和你在Hermes/agent里的体感速度,中间隔着这两层折扣。哔哩哔哩
三、按你要它干的活对号入座,别按显卡
差评区里最扎心的一条来自一位5090用户:一直用q4权重做项目开发,换了5.9G版试了下——“速度确实快,但成功把我的项目改成狗屎了”。 同层楼24赞的总结同样冷,不如gsq-rco,尽管这个体积小,但是稳定性差多了。哔哩哔哩哔哩哔哩
所以我建议按"活儿"分档,而不是按卡:
可以上:问答、摘要、翻译、结构化输出、RAG查库。这类短任务正是98.2%覆盖的区间。知乎那位40题复测的作者把话说得克制:样本量不大,不足以证明分不低于官方,但足以回答那个真问题——三值量化27B在日常数学、知识问答、指令跟随上没有可感知的劣化。 8G卡+16G以上内存,用官方prism分支编译的llama.cpp或现成整合包,当一台离线AI员工是成立的。知乎
观望:轻agent、单步工具调用。工具/CLI维度反超、约束明确任务上100分打87分,这些都是真的;让它干"读表→算账→填模板"这种有明确边界的活,它是划算的。
别上:多步规划、长链路coding、过夜跑的agent。长任务超时、agent六件套0/6、工具死循环——不是概率问题,是结构问题。评测方的原话:真正的分界线在任务进入长链推理、多文件修改、严格超时约束之后,IQ3_S更不容易出现0分式失败。 这类需求老老实实走11.8GB的IQ3_S路线,多花6个G,买的是完成率。8G显存还想真干活的,评论区也有人留了对照:原版4bit好歹90K上下文还能用、真的能干活、还能开MTP。知乎哔哩哔哩
顺带一个正在发酵的分歧:小红书有人拿三值5.6GB和MoE稀疏激活20GB上了同一组30道题实测,结果直接打平27:27。 8G卡用户面前其实摆着两条路线——三值买体积,MoE买稳定,现在谁也说服不了谁。小红书
四、下载前的四个避坑自查
一,文件名和"FP16"三个字别混着信。有UP主被评论区拆穿:仓库里那个18.2GB的`.ninfer`文件,权重自己标着base_model_relation: quantized,是3/4/5bit混合量化,不是全精度。 同理,官方GGUF 5.95GB、NInfer制品9.8GB、IQ3_S 11.8GB,是三个不同的东西,测评截图混着用很常见。哔哩哔哩
二,推理引擎用对分支。官方prism专用版发在PrismML-Eng的llama.cpp fork上,直接认准llama.cpp的prism-b10743发布标签下载;NInfer是另一条三值内核路线,跨架构移植的坑在设备枚举不在内核。 用大众版llama.cpp跑官方GGUF,速度和上下文会让你误判"这模型不行"。哔哩哔哩
三,上下文是内存黑洞。模型文件只有6个G,但25万上下文的KV缓存要靠K 8bit、V 4bit这种量化才塞得进16GB显存——内存低于16G的用户,别按官方宣传的262K去设参数。知乎
四,"98.2%保留"的口径钉死在thinking模式六类基准的平均分。指令跟随102%是真的,agent 0/6也是真的,两个数字不冲突,冲突的是拿前者当后者用的帖子。
五、接下来盯什么
第一代Bonsai(7月)被普遍当Q1级玩具,第二代最大的改进恰恰在质量,把基准分差从5个点左右缩到1.5个——方向本身是真的在进步。 值得盯的信号有三个:PrismML后续会不会上离群值优化版,三值塌方的根源就在这;zxbench这类"超时计0分"的口径会不会变成社区标配,如果变标配,Bonsai的分还要往下掉;以及NInfer方案在非40系卡上的移植进度——现在AMD 6800XT用户还被困在16K上下文、22到25 tokens每秒里。哔哩哔哩小红书
一句话收口:5.9GB的27B不是营销号标题,也不是骗局,它是一张"短活满分、长活看版本"的技能卡。8G、16G卡的用户今晚挂机下载没有沉没成本;但如果你指望它替你跑一整晚的项目,这11天里所有翻车帖子都在说同一件事:那6个G的差价,现在还买不起。