Claude Code 新增插件评估功能:一次“消融实验”,测出你装的 Skill 里哪些在白烧 Token

源自142位全网作者

06:15

9 月 12 日起,开发者的终端里多了一条新命令:`claude plugin eval`,它随 Claude Code 2.1.269 版本上线。次日知乎上就出现了直给的问题:怎么看 Claude Code 推出全新的插件评估功能,清理插件真的有必要吗?知乎知乎

装过一堆 Skill、MCP、Hook 的深度用户,看到这条功能的第一反应往往是复杂的:一方面"终于来了",另一方面"不太想面对"。因为它要干的活,恰恰是给每个插件做消融实验——同一个真实任务,加载插件跑一遍,不加载再跑一遍,然后打分对比,这个 eval 本质上就是标准的行为验收测试。换句话说:它不是来告诉你插件有什么功能的,是来告诉你,没有它会不会更好知乎

一、这个官方评估器到底测什么

它和 2.1.269 之前社区就在用的 `claude plugin validate` 完全不是一回事——差别大到需要重新理解这个生态在做什么。拆开看有三步。知乎

第一步,交互式起草测试:在插件根目录执行 `claude plugin eval init`,它会启动一个会话读取当前插件,反过来问你三个问题——什么样的输出算好?什么情况应该触发这个 Skill?哪些请求不应该触发?然后自动设计测试 Prompt 和评分器,试跑一遍,把测试套件写进插件目录下的 `evals/`。测试 Prompt 要模拟真实用户输入,不能直接指挥模型"调用某某 Skill"。知乎

第二步,六种 Grader,其中四种零评分成本:前四种完全从运行 Trace 和 Workspace 计算,不产生额外 Judge 费用;`llm` 和 `baseline` 会再调一次模型,默认用较小较快的 Judge。评分标准复杂时可以用 `–judge-model sonnet` 换大 Judge——但那是另外的钱。init 完成后还会先告诉你完整跑一遍的测试套件要花多少,再决定跑不跑。知乎微博

第三步,结果分和过程分必须一起看:`tool_used` 能证明任务完成的同时这个 Skill 确实参与了,`tool_order` 能验证工作流步骤的顺序有没有被遵守。另外它自带 fixture 和 MCP mock 机制,能把插件依赖的外部服务模拟掉,最后输出一份完整报告。知乎

二、为什么说"先测再留"是一笔划算账

社区里"我的插件好像没什么用"是长期情绪,但很少有人拿得出数字。把这周几份信源摆在一起,成本链条其实已经能算清楚。

1. 插件描述是常驻的,这本身就在收"启动税"。 知乎上关于 Skill 生态的讨论把机制说得很透:描述常驻在上下文里,正文按需加载,模型决定要不要用某个 skill,靠的是它读到的那一句描述,不是它记得你装过什么。装多了的代价不是占空间,是选择困难——好几个都能用的时候,它会犹豫,甚至干脆退回不用。知乎

2. 框架层的开销,比大多数人的想象大一个数量级。 极客邦 InfoQ 整理的一项独立基准,用同一个模型、相同的 12 个 Python 任务比较了 12 种智能体框架配置,每解决一个任务消耗的 Token 从约 3500 个到约 29.2 万个不等,而这个排名在两个互不相关的模型之间几乎没变——差异来自框架软件本身,不是模型行为。36氪

其中"启动税"——任务开始前框架自带的系统提示词、工具说明——从 Aider 的约 700 Token 到 OpenClaw 的约 2.6 万 Token;把启动税乘以交互轮数,对每项任务 Token 用量的解释力 R² 高达 0.99。你的插件常驻描述,就是这项税收的一部分。36氪

也要说公道话:这批基准每种配置只跑了一次、没有方差估计,结论强度只能到"机制存在且量级可观",别拿单个数字对号入座。36氪

3. 缓存命中率会改写账单。 Composio 用同一模型跑 30 个企业工作流的实验里,每次成功任务的成本从 PiAgent 的 0.028 美元到 Claude Code 的 0.195 美元不等,而 Claude Code 的输入 Token 缓存占比只有约 1.5%,Codex 约 70%——原始 Token 用得更少的 Claude Code,账单反而更贵。36氪

注意作者自己提醒过:这个近乎为零的缓存占比源于该测试环境的服务路径(经网关协议转换),不能直接套到官方订阅的日常使用上。但"同一种活,路径不同,账单差几倍"这个方向是实的。Spotify 那边甚至把这个方向做成了产品:其开源插件 Shunt 通过 Hook 机制拦截读取超长文件、写样板代码这类高耗能低推理任务,路由给更便宜的模型,把 Claude Code 的 Token 消耗削减了九成。36氪微博

4. 效果侧同样不乐观。 被知乎多篇文章引用的 Anthropic 会话研究显示,在其分析的约 40 万次 Claude Code 会话里,人平均做约 70% 的规划决策,Claude 做约 80% 的执行决策。知乎

更扎手的是收尾率:同一份研究里,软件相关职业的会话,能拿到测试通过、提交记录等硬证据的"已验证成功率"只有约 30%,放宽到部分成功才是 89%。能推进,不等于能收尾——这也解释了为什么有开发者感慨"大家都在用 AI 编程,代码产出水平的方差反而比以往更大"。知乎微博

四段账拼成一句话:Token 这么贵、模型本身这么强的 2026 年,你前两年囤下的一堆插件里,必然混着纯负资产——问题只是哪些。 官方现在把测量工具递到你手上了。

三、报告出来后,四类动作直接对号

不是所有用户都该今晚就跑 eval。按投入产出排一下:

  • 该马上跑的:装了 3 个以上第三方插件/Skill 的个人、月度额度经常见底的订阅用户、往项目里塞了一堆 MCP Server 的团队。

  • 可以先不动的:新手期只装了一两个官方插件的人——常驻描述还很少,启动税没到值得治理的规模,先把活干起来比调工具优先。

  • WITH 和 WITHOUT 分数一样的:删。 任务结果没有区别,插件只是多收了 Token。

  • 任务完成了,但 `tool_used` 是 false 的:先别删,改描述。 多数 Skill 的描述写的是"它是什么",模型需要的是"触发条件"——同一件 Skill,描述改一行,被用到的频率能差好几倍,差别不在能力上,在匹配上。知乎

  • 留下来之前,先过频率和安全两关。 留的底线标准就一句频率题:这个 skill 对应的活,一周会不会干上三次?不会的话,装了也基本是躺着。安全那一关更硬:对 GitHub 上 Star 数最高的 Claude Code 资源合集 awesome-claude-code 的第三方静态审计,在它的运维脚本里命中了命令注入类高危特征 3 处,全部集中在资源与 Issue 解析环节。社区顶流尚且如此,你随手装的第三方插件在进 eval、进日常工作流之前,值得先在隔离环境里跑一次。知乎专栏

  • 团队用户的进阶玩法: 把 `tool_order` 检查挂进 CI。代码审查类插件"先执行测试、读取 diff、最后提交 review"这类流程约定,从此有了机器验收。知乎

四、清理的另一面:官方在加速下场

值得连起来看的是,这不是一次孤立的产品动作。OpenAI 此前也表达过同一层意思:GPT-6 时代开始,你需要给 Skill 和 AGENTS.md 做一次大扫除。两大生态同时在从"鼓励多装"转向"证明有用",说明常驻上下文这件事,已经贵到连厂商自己都看不下去了。知乎

而清理的另一面是官方插件在下场抢位置:Unity 官方的 Claude Code 插件发布时自带 29 项原生技能,一条命令安装、无需配置、支持编辑器直控。官方背书、持续维护的插件,比社区杂烩更容易挣到自己的常驻成本。接下来值得盯三个信号——`plugin eval` 会不会变成插件市场收录的前置门槛;订阅策略会不会进一步对常驻描述"明码标价";以及类似的第三方插件安全审计会不会密集出现。微博

这个功能不是来给插件生态唱赞歌的,它更像是提醒每一个用 AI 写代码的人,回去补一堂最古老的工程课:任何工具,先证明有效,再留在流水线上。 今晚就可以从你那个"装完就没打开过"的 Skill 开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章