27B压到6GB:98.2%是考分,长任务只剩75%

源自214位全网作者

08:08

27B大模型一直是本地部署的"甜点区"——够聪明、不算大。但甜点不等于吃得下:Qwen3.8-27B全精度体重54GB,16GB的笔记本连想都不用想。

9月下旬,加州理工系团队Prism ML干了件狠事:把27B整个重训一遍,所有权重只许取-1、0、+1三个值。模型文件从53.8GB掉到5.93GB,只剩原来的九分之一。官方口径更炸:保留全精度98.2%的智力。知乎知乎PrismML官网

这个模型叫Ternary Bonsai 2,半个月里冲上HuggingFace热榜第6。评论区裂成两半:8~12GB小显存玩家排队喊真香,长任务玩家发帖骂翻车,其中一条24赞的标题就是"请别再谎报模型的’智力’了"。哔哩哔哩知乎

27B压到6GB:98.2%是考分,长任务只剩75%

该信哪边?拆开两本账看。

第一本账:智力到底剩多少

先说清原理:Bonsai 2不是"训完再压缩",而是重训时就把权重约束成三值。每128个权重共享一个FP16缩放系数,算下来每个权重只占约1.7比特。所以严格说,它不是Qwen3.8的压缩版,而是一个"三值兄弟"。知乎知乎知乎

官方成绩单:20项基准平均83.9分,原版85.4分;分项保留率数学99.5%、代码99.3%,指令跟随102%——还反超了。知乎有人拿RTX 5080 Laptop自建40道题复测,数学、知识、指令跟随全对。日常问答、写文档、短代码,你基本感觉不出它是压缩过的。知乎

27B压到6GB:98.2%是考分,长任务只剩75%

但成绩单有折页:长程agent任务。Terminal-Bench 2.1拿52.8分(原版69.7),SWE-bench Verified拿60.8分(原版80.6),都只剩四分之三上下。那条HF高赞帖戳的就是这里:98.2%是"考试分数保留率",不是"行为等价保留率"。还有人在V100上对了输出分布:三值版困惑度比Q4量化高32%,最高概率token的一致率只有77.8%——它给的答案,确实不是原版那个"人"。知乎知乎知乎

第二本账:跑多快、什么卡配跑

官方参考值:RTX 5090单卡最高约143 tok/s,M5 Max约47 tok/s。社区实测更接地气:5080 Laptop(16GB显存)稳定在90 tok/s左右,4070 12GB约39.5,4060笔记本8GB有人调出70 tok/s、也有人嫌折腾删了换小模型。8GB显存跑27B,搁两年前是科幻。知乎知乎知乎

但也别急着喊三值无敌。有人拿同一张5090 Laptop做对照:NVFP4量化8路聚合能跑784 tok/s,三值版只有205。原因一句话:FP4有专用硬件矩阵单元,三值没有任何GPU指令直接支持,得靠软件解包再乘加——省的是字节,费的是算术。知乎

27B压到6GB:98.2%是考分,长任务只剩75%

所以结论很干脆:手里有24GB显存的卡,NVFP4/Q4才是正解;Bonsai 2的生态位是"别的量化根本装不下"的设备——16GB笔记本、8GB小卡、硬盘寸土寸金的离线机器。5.93GB的27B,下载十分钟的事。知乎

装之前,几个坑先知道

  • LM Studio主线不支持三值kernel,得用PrismML的llama.cpp分支或ninfer引擎。知乎

  • Windows用户别碰`–wddm-evictable-budget`参数,实测会崩显卡驱动。知乎

  • 16GB卡塞不下满血262144上下文,差166MiB,降到253952正好。

  • xhigh思考模式有死循环记录,有人烧了11万思考token才等到一个回答。知乎

  • 工具调用有翻车案例,拿它搭Agent前,先用自己的任务跑一遍。

27B压到6GB:98.2%是考分,长任务只剩75%

装还是不装

如果你的显存在8~16GB,主要干日常问答、长文档、短代码,又在意隐私离线——装。这是目前6GB以内最强的智力,官方"智能密度"指标是传统2-bit量化(IQ2_XXS)的1.6倍。如果你要跑长程编码Agent,或者手里有大卡——别为难自己,回Q4和NVFP4去。知乎

压缩这件事从来不会凭空消失。98.2%写在考卷上,75%写在职场上。下载之前先想清楚:你要用它的,是哪一头?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章