27B拿下Agent考试第二名,分项却露了馅:我核完信通院693个计分任务和这周的16G实测,本地Agent要看的是三个数

源自30位全网作者

04:48

这周的"本地部署"圈有个新的默认词。打开B站,近一周的模型教程——Qwen3.8-27B的各家量化版、Qwen3.8-35B-A3B、MiniCPM5-2B——标题里清一色缀着"接入HermesAgent",像进站标配的检票口;知乎的教程则把"Claude Code接国产模型"讲成了"两个环境变量"的事。哔哩哔哩知乎

引爆这条线的是9月初的一份测评:中国信通院MCP专项测试里,陈大年新公司StartLux发布的27B本地模型拿到综合第二,只落后1.6万亿参数的DeepSeek-V4-Pro 1.3个百分点,反超284B的V4-Flash。社区传阅的说法很提气——“本地27B能干活了”。量子位

但我把测评分项、量子位的报道原文和这周B站、知乎的实测评论全部对了一遍之后,结论要复杂得多:这1.3分是真新闻,"你的电脑马上就能跑Agent"是假兴奋。中间隔着的那段路,恰好是这周几十条一手实测替我们趟完的。

一、先把1.3分拆开看:考的是干活,不是聊天

信通院这次用的基准是MCP-Universe类工具任务集:231个任务跑三轮,共693个计分任务,覆盖网页搜索、地点导航、金融分析、浏览器自动化、代码仓库管理、3D设计六类真实工具环境。翻译成人话:不考模型"答得好不好",考"事情办没办成"——让AI自己操作浏览器查航线、跑金融计算、管代码仓库、开Blender建模。知乎

结果如下表所示。

队伍

完成任务数(共693)

综合成功率

DeepSeek-V4-Pro(1.6T-A49B)

281

40.55%

StartLux-V1.0-27B-Preview

272

39.25%

DeepSeek-V4-Flash(284B)

被27B反超

第一个要记住的数字就藏在表里:榜首也只完成了四成的任务。Agent的世界里目前没有"能干",只有"多大的成功率、干哪类活"。知乎

再看分项,综合第二的含金量立刻分叉:

分项

StartLux-27B

V4-Pro

V4-Flash

金融分析

68.33%

68.33%

浏览器自动化

28.21%

28.21%

地点导航

33.33%

32.59%

网页搜索

42.42%

47.27%

56.36%

代码仓库管理

17.17%

27.27%

画像非常清楚:StartLux在金融、地图、浏览器这类固定工具链上跟旗舰打平甚至小胜,在开放网页搜索和代码仓库上被明显甩开。这和它的训练方式直接相关——它用Qwen3.6-27B做基座,后训练让模型在真实工具环境里反复执行任务、按环境反馈修正工具选择和报错自救;练的是"办成",不是"知道"。所以它能在特定环境追平万亿模型,也完全可能在开放式任务上原形毕露。知乎知乎

还有两个口径修正,是传阅环节被吃掉的细节。其一,“小60倍"是夸张:V4-Pro是MoE,1.6T总参数、每token激活约49B,27B对它的单次计算差距接近27B比49B,不是27B比1600B。其二,也是最重要的——截至本文发稿,StartLux-V1.0-27B-Preview没有公开的模型权重,个人下载不到、装不上。这份成绩单证明的是"27B级模型干活的天花板到了哪”,而你自己机器上能装的,是Qwen3.8-27B这一批。知乎

二、这周的实测替你把"能不能干"跑了一遍:16G卡们的真实成色

榜装不上,社区没闲着。这周两个高播放的"27B接入Hermes"教程的评论区,攒出了一批带着完整参数的实测。我把数字都抄下来:

  • UP主"洗衣约基因"(1.8万播放):16G显存跑Qwen3.8-27B的Q3_K_XL量化,64K上下文、加载视觉模块、开MTP投机解码,约70t/s,用Hermes生成PPT"效果超出预期"。他的关键参数是`–jinja --reasoning off`——思考模式全开"相当耗时";楼下也有回复不认同:改medium就好、不思考效果会差不少。哔哩哔哩

  • “荆棘の心”(23赞):16G显卡拉满256K上下文,权重12.1G全驻显存、KV缓存挪到锁页内存(自编译的adaptive-kv-streaming分支),在dsh里跑完"鹈鹕骑自行车"任务,12分钟、均速47t/s哔哩哔哩

  • “Kpa32”:4080 16G、linux、IQ3_XXS量化+MTP+128K上下文,100t/s;用dhs挂机跑了一小时,自己做出一个网页塔防游戏,“音效关卡画面都好,没有明显bug,就是思考要关低点,不然有小概率卡壳”。

  • “newmanzxk”:4070Ti Super 16G,实测稠密模型的MTP草稿长度`–spec-draft-n-max`设2最快,约50t/s。

  • 反面样本同样真实:“我不是贫坤户"跟着教程脚本在5060上只有1.5t/s,“慢得离谱”;4060用户直接认输"1token算它优化10倍也才10token,这就不是给端侧的模型”;8G卡用户被告知最狠的一刀——Q2最小版本也要9G,装都装不下

把这些排一起,三个此前没人明说的规律浮出来了:

1. 同一代消费卡,教程默认装法和调优装法差了近两个数量级(1.5t/s对100t/s)。 变量不是显卡,是量化格式、MTP开关和草稿长度、上下文与KV的驻留策略。"跑不动"这个判决,2026年9月对16G卡已经作废;但"跑起来"的前提是你得按实测参数装,而不是按教程里那条bat。

2. Agent本质是token焚化炉。 订票这种演示级任务,云旗舰都要12步(95秒);本地跑同等任务链是12分钟到一小时量级——一小时50t/s就是上千万token的产出,一次任务吃掉几百轮聊天的量。聊天时"47t/s有点慢"的体感,进Agent循环会被多步重试和逐层变长的上下文复读放大一个数量级。

3. "思考模式"是本地Agent唯一的免费午餐的反面。 这周所有跑通的任务都做了同一个动作:关思考或调低。速度换了智商会掉,掉多少benchmark里没有分项——它藏在"PPT一做就变傻子"(评论区原话:输出HTML很聪明,转PPT就拉胯)这种具体任务格式里。哔哩哔哩

三、要上车,先看三个数,不是一行综合分

已经装了27B、想把模型从聊天框挪进Hermes/Claude Code/Codex的人,我的建议只有一句话:别用榜单分数对齐预期,用你自己的任务建个基线。先把预期换成可测的东西:拿30个自己的真任务跑一遍,记录一次成功率、人工接管次数、P95延迟和单任务成本,然后才谈"能不能干"。下面我再按显卡分层给出结论:知乎

你要记的三个数——先拿30个自己的真任务跑一遍:

  1. 一次成功率:不接管、不重试就完成的百分比。行业榜首40.55%,你本地27B大概率低于它;低于你忍耐线的那部分活,老老实实给云端。

  2. P95延迟和接管次数:平均速度没意义,一次浏览器误点重试,单任务时间翻倍;决定体验的是最慢的那5%步骤。

  3. 任务类别命中率:按分项表排活——金融查询、地图、固定浏览器流程、Blender这类边界清楚的可以本地先试;开放搜索和代码仓库管理,连284B的V4-Flash都只有二十几到五十几的成功率,别为难16G。

按卡分层的结论

  • 8G显存:27B这班车确认与你无关。本周热度最高的替代路线是Qwen3.8-35B-A3B(35B总参、约3B激活的MoE)和2B级小模型接Hermes——播放量说明需求真实存在,但2B驱动Agent的天花板就是整理文件、跑固定脚本,当玩具别当产能。

  • 16G显存:这轮主力。Q3/IQ3档量化+MTP(草稿2)+64~128K上下文,实测带价47~100t/s;两个硬提醒:Q3档"中文阉割得比较狠"(评论区实测反馈),MTP与多模态不兼容——有人实测带图时开MTP反而从45t/s掉到28t/s,图文任务要分别测。哔哩哔哩

  • 24G及以上:精度和上下文余量解锁的是"能跑",不是"快够";先把手上卡的参数红利吃干净,再谈换卡——这轮的教训恰恰是参数比硬件值钱。

四、避坑位:这轮越热闹,这三种东西越多

  1. "破线/泄露/越狱"整合包。 本周冒出一批"Seedance2.5破线版泄露,本地无限生成"的视频,套路统一:评论区扣666→关注→私信发安装包。27B教程的评论区里"这个有越狱版吗"也在反复出现。来路不明、走私信分发的exe,装进的是你的电脑。

  2. 提速内容的流量生意。 知乎本周有回答把这层窗户纸捅破了:刷屏的"小显存部署"文,“煞有介事弄个小显存上LLM 跑得飞快”,而作者直说,写这些的人"都靠码字和流量吃饭"。上面的1.5t/s教程翻车就是反面证据——教程UP手里的优化版和讲给你的默认版,经常不是一个东西。知乎

  3. 代测/验真类水军。 实测视频评论区已出现话术模板一致、导向同一个"能力验真平台"的批量评论。凡是"建议先对照XX验真再决定"的,多留个心眼。

五、接下来盯什么

这份信通院成绩单的真正意义不是"27B赢了",也不是"参数没用了"——是本地27B级的干活能力第一次被机构级基准验证过,尽管验证的是天花板而不是你机器的地板。

后面三个信号值得盯:一是StartLux会不会兑现它"像安装Office一样,一键完成部署"的构想、放出权重,真开放的话比本文所有数字都更有讨论价值。二是Qwen3.8-35B-A3B的消费级量化版(本周已有人放出GGUF分支教程)能不能把8G/12G卡的Agent入门线真正拉起来;三是Hermes这类Agent框架v0.21.x一周三变更的迭代速度——这周的实测已经证明,换harness能改变同一个模型的成败,工具链还在剧烈增值期。量子位

至于"要不要现在把本地模型从聊天框挪进Agent":16G以上、有30个自己的边界清楚的任务、愿意花一晚调参数的——可以上了,这周有人用一小时的塔防游戏替你先踩过坑;只有8G、或者指望它替你管代码仓库的——这轮热闹跟你无关,等A3B那班车。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章