官方成绩单保留98.2%,智能体任务零通过:本地27B这周被出了一道新考卷

源自45位全网作者

10-04 13:20

这周本地部署圈最热的模型不是新旗舰,是一个"老模型的新包装"。PrismML开源的Bonsai2 27B把27B参数的多模态模型压到5.9G,性能还保留了98%,Apache2.0随便商用。官方口径是综合基准保留98.2%,连"Agentic & Tool Calling"分项都保留了97.3%。B站主帖几天冲到3.5万播放,知乎那篇"先别急着信"的质疑帖也紧接着上线。哔哩哔哩微博知乎

官方成绩单保留98.2%,智能体任务零通过:本地27B这周被出了一道新考卷

转折就出在这周。一条中字实测把三值版和全精度27B放进同一智能体环境:短任务48.6对47.1持平;六个长程构建任务,全精度版得35/60,压缩版没有做出一个可用的应用。另一条16GB显存实测(Luke’sDevLab)更不留情:长上下文记忆召回低,复杂编码烧token,Q1多次失败、Q2能做但效率极低,不推荐干专业活。还有直接翻报告的人:terminal和swe两项智能体基准,准确率下降了近20个百分点。98.2%是真的,智能体翻车也是真的——基准测的是一问一答,不是干活。哔哩哔哩哔哩哔哩微博

智能体在聊天之外加了四道考题。长链条决策:一步歪,后面十步白跑。长上下文召回:工作集动辄几万字,低比特量化在这里最敏感。Token预算:一个任务几十上百次调用,"免费无限"变成时间账——10月4日开源的Multi-Harness RL研究证实:同一套模型权重换到不同的Agent脚手架,表现往往大打折扣,单环境训练又极易过拟合格式与解析规则。格式服从:OpenCode评论区"同一个prompt在其他地方输出比较正常,在opencode里就不太正常,会有重复的感叹号"这类抱怨最密集。有人更直接:把我项目搞炸了,再也不见27B。微博哔哩哔哩

动手前,三笔账先对平。配置账:6GB档(5.95GB)聊天、读代码够用,别派长活;12-16GB档,OrcaSAQ-2-27B报12.06GB、SWE-bench 70.0,但那是厂商自测,社区还没有独立智能体复测,先等;22-48GB档(INT4),有M4 Max 48GB机主用LM Studio接Claude Code跑完一个onnx转NPU精度的真实任务,至多使用 27 GB 内存,耗时两小时。但32GB机主同规格"拉满会爆、只敢分28"——运行时开销必须算进显存。Prefill账:智能体每轮都要重读工作集,双T10改装机主的口径是prefill/decode 1000/80,而ds4把KV缓存按前缀哈希持久化到SSD,服务重启无需重复Prefill。协议账:实测手册写明131k上下文默认被配成32k,“聊到 3 万 token 左右就会撞上「上下文不足」”,/compact还是死循环——不是模型不行,是配置坑。哔哩哔哩微博知乎

那到底能不能开工?现在能信的是窄范围、易核对的小任务:解释调用关系、找重试逻辑、列测试思路——LocalAgentToolkit的结论相同,把小任务交给本地模型之前先查材料。长程自主构建先别指望,记住全精度也只有35/60。接下来盯三个信号:OrcaSAQ的独立复测;Claude Code Mods,几行 TypeScript 就能改它的行为、界面和内置功能,但官方明确没有沙箱,会不会补上?以及10月23日Spark 64GB版开卖后:4999美元起,英伟达官方内存图里Qwen3.8-27B权重按16.5GB算、给KV留40GB余量,发布稿附的星标与token曲线说明这波热度还在涨,12-16GB档的价格口径多半要重写。知乎IT之家

官方成绩单保留98.2%,智能体任务零通过:本地27B这周被出了一道新考卷

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章