过去两周,本地大模型圈被同一个 5.9GB 的文件来回打脸。
9月17、18日,加州理工系团队 PrismML 发布 Ternary Bonsai 2 27B:把 Qwen3.8-27B 的语言权重压成 -1/0/+1 三个值,加 FP16 分组缩放,平均每个权重 1.76 bit,整个文件 5.9GB,比全精度小 9 倍多,官方综合分 83.9 对 85.4,宣称保留 98.2%——上一代只有 95%。这颗被压扁的 27B 转眼就登顶了 HuggingFace 趋势榜,“27B模型压到5.95GB,还保留98.2%智商"就是当时热帖的标题。小红书收藏 48 的帖子标题就是"8GB显卡跑本地大模型选Bonsai,不纠结”,头一句写着"5.6GB打平20GB,我测完直接沉默了"。哔哩哔哩知乎小红书
但同一条时间线上还有另一种帖子,标题是《哈哈,又被Bonsai-2-27B这个模型骗了》。底下评论区吵了 42 条。更狠的是 B 站搬运的海外实测:简单任务上两者确实接近,压缩模型能达到宣称的 98% 性能,可在需要多步骤规划的长智能体构建任务里彻底失败,六个项目无一可用,还常陷入重复调用工具的死循环。知乎作者王大粘拿 4070 Laptop 8GB 完整跑通后,结论只留了一句:能跑,但他大概率不会真用。小红书哔哩哔哩知乎
这些帖子互相矛盾,但它们说的都是真的。分歧点不在模型,在你的任务类型。如果你手里是张 8–12GB 显存的卡、正被"8G 跑 27B"的演示推着准备装机,先把下面这份对账表看完。
一、先把显存的账算清楚:“刚好塞进去"不是"轻松跑”
PTQ1_0 权重文件是 5,946,648,928 字节,大家习惯说"大约 5.95GB",但换成显存真正用的二进制单位,是 5.538GiB——Q4 KV 缓存再按每 token 约 18,432 字节算上 64K 上下文,权重加 KV 已经超过 6.6GiB,剩下的空间还得放 CUDA 工作区、临时张量,和 Windows 桌面自己占走的那一截。8GB 卡上没有"差不多",只有"刚好"和"差一点"。知乎
知乎部署教程给的安装底线和实测帖一致:可用显存 8.5GB 以上再动手,显存不够先砍上下文长度;日常靠新建对话释放 KV、关掉后台占显存的程序续命。装之前先跑一次 nvidia-smi,比看任何演示视频都实在。知乎
二、它守得住的部分:280 道题下来,三元只比 Q4 输 0.4 分
知乎作者 C JOHN 在单张 4090 上做了社区里没人做的事:五套部署——5.95GB 的三元 PTQ1_0、7.21GB 的 PQ2_0、13.15GB 的 Q3_K_XL、16.46GB 的 Q4_K_M,再加一套 vLLM 方案——答同一张卷子,四个公开基准各抽 70 题、固定随机种子、温度 0、程序化判分,合计 280 道,最高 90.4%、最低 87.9%,总分只差 2.5 个百分点。知乎
最能改变购买决策的数字藏在细节里:7.21GB 的三元量化拿 90.0 分,13.15GB 的 Q4 拿 90.4 分——体积不到一半,分数保住 99.6%;而 13.15GB 和 16.46GB 两档总分完全一样,在 1.75-bit 到 4-bit 这个区间里,继续加大体积几乎买不到能力,多占的显存换回来的主要是"更安心"。GSM8K 数学七十题,五套部署全部对 67 题,连错题都是同样三道——这类任务的天花板是模型本身,和量化无关。知乎
社区的手感对得上这些数字。小红书作者寂兮连跑几天文档整理和知识库维护,说效率和准确性与云端相当,而且本地模型对不确定的内容处理得更保守。另一篇拿三值压缩和 MoE 稀疏激活做的三十题对轰,结果是 27:27 打平。作为对照,传统的 Q2 量化要 9.4GB、综合分只有 72.59,Bonsai2 体积比它小三分之一,分数反而高出 12 分以上。小红书小红书
所以问答、总结、文档整理、翻译、写作、批量抽取这类"把活扔后台慢慢磨"的任务,这颗 5.9GB 的 27B 大脑几乎随便用。
三、它翻车的地方:不是慢,是"不可控"
海外测试的六个任务全灭,机制在王大粘的实测记录里看得最清楚:一个很简单的逻辑题,它吭哧吭哧生成了大约 733 个 token;一个显存除法题,大约 725 个 token;C++ 那道题其实很早就判断对了,结果在 1024 token 的预算里反复自我确认,最后连正式答案都没来得及输出。B 站有人让它玩俄罗斯方块,一把棋的思考就吃满了 60K 上下文。知乎哔哩哔哩
C JOHN 那轮 280 题也系统性复现了这件事:按默认配置跑,280 道题里有 28 道(10%)在 4096 token 额度上被硬生生截断、答案根本没输出完就被判错——一道医学选择题,模型"自言自语"推理了 122 秒,额度耗尽时还在写"Let’s search memory internally…";把思考模式显式关掉,截断率降到 1%~4%。这才是"27 tok/s"和"完成任务"之间被演示视频省掉的部分:基准量的是生成速度,不是等待时长。简单题先绕七八百 token,你等到的还是二十多秒之后的最终结论,"跑起来很顺、用起来想摔键盘"差的就是这里。知乎
另一条翻车线是工具调用:BFCL 测试里,该调工具的时候五套部署都对,该拒绝的时候最好也只有 87.5%、最差掉到 68.8%——题目问水在 10 kPa 压强下的凝固点,提供的函数只有一个算沸点的,模型照样自信地调用、填参数,拿沸点的结果去回答凝固点,输出一份格式完整、没有任何异常信号的答案。想拿它跑智能体的先记住:在工具层加一个"无合适工具"的显式出口,比换模型有效得多——而且这个短板是 Qwen3.8-27B 一族的能力上限,不是 Bonsai2 独有的锅。知乎
四、为什么"98.2%"和"0/6"能同时成立
官方的六个维度里五个保住 96% 以上、指令跟随甚至做到 102%,这些全是短任务口径的均分。海外那期视频的介绍里给了另一半真相:官方数据也显示,长任务基准上压缩版只保留约 75% 到 76% 的分数,结论就是压缩模型适合聊天和短任务,长时无人监督的智能体工作仍应使用完整模型。三值量化丢掉的不是知识,是长链条上每一步的置信度:单步几乎测不出来,往后规划六十步,误差会被放大。所以判断 Bonsai2 适不适合你,不用跑任何分,只问一句——你是拿它"干活出字",还是拿它"替你规划"。前者它守得住,后者现在轮不到它。哔哩哔哩哔哩哔哩
五、对完表再看你属于哪类人
后台干活党,8GB 显存也值得装。 文档整理、知识库维护、批量抽取、代码初审,直接上 PTQ1_0 的 5.95GB,把省下的十个 G 全部喂给 KV:同批部署里,vLLM 那套在 240k 深度只有 3.8 t/s,而最小那档还有 32.3 t/s,同时在飞上下文 786K 对 209K,能力只差 0.7 分。长上下文场景里,小权重就是硬通货。知乎
想当聊天写作主力的,装可以,条件先配齐。 显式关思考模式、新建对话释放 KV、上下文别贪 192K、Windows 先核对可用显存 8.5GB 那条线。想换 PQ2_0(多 1.26GB、买回约 2 分能力)的先想明白:更现实的问题是就算 PQ2 真快 10%,也可能让 64K 配置放不下——"理论上解码更省事"不等于实测更快,王大粘自己都没肯把这句话写死。知乎
智能体折腾党,暂时别拿它当主力。 六个任务 0 能用的结论目前还没有反例,非要试,先把工具层守卫搭好再谈。
顺手排两个雷:小红书那篇传得很广的"8GB 跑 27B 只有 6.57 tok/s",作者后来自己回来更正,说之前测错了 5 倍;"先跑一轮 CPU 再跑一轮 GPU"的对比方法也有坑。给这台机器下结论之前,用你自己的真实任务跑一轮截断和等待测试,比任何跑分都可靠。小红书
六、接下来盯什么
原生三元 kernel、加载时权重 retile、投机解码,是王大粘点名最值得继续试的三个方向;但投机解码有个 C JOHN 已经实测出来的坑:Qwen3.8-27B 官方那个 1.37GB 的 MTP 草稿模型不改变正确性,却会让 35 道题里 11 道的输出文本发生同义改写,靠哈希做回归比对、用缓存校验的场景要提前绕开这条路径。再往后,PrismML 下一代的改进重心大概率还在"质量"而不是"更小",三值量化和 MoE 稀疏激活的路线对轰目前 27:27,胜负未分。知乎
三值量化的真正意义,不是把 27B 变成小模型,而是把 27B 的知识密度搬进 5.9GB 的体积里。它配不配当你的主力,取决于你此刻缺的是一个安静的打字机,还是一个靠得住的规划器。