张大妈

我们对 Coding Agent 的评测,可能搞错了方向

源自公众号:Founder Park

02-02 20:55

当前对 Coding Agent 的评测普遍只关注任务是否完成、代码是否能跑,但这忽略了工程实践中的一个核心痛点:过程不规范。用户需要的不仅是能跑的代码,更是符合团队协作规范的代码。本文指出了当前评测体系的盲区,并引入了关注过程合规性的新视角,旨在推动 Coding Agent 从玩具走向真正的生产工具。

我们对 Coding Agent 的评测,可能搞错了方向智能速览

  • 用户对 Coding Agent 的不满常源于其不遵守指令和工程规范,而非无法完成编码任务。

  • 主流的 SWE-bench 等评测集仅关注结果导向,导致评估与真实使用场景错位。

  • MiniMax 开源的 OctoCodingBench 评测集,首次将“过程规范遵循”作为核心评估指标。

  • 评测显示,即便是最强的模型,在近三分之二的任务中过程也存在违规。

  • 下一代 Coding Agent 的发展需要引入细粒度的过程监督,学会在复杂约束下工作。

我们对 Coding Agent 的评测,可能搞错了方向精华内容

当评测只盯着代码能否运行,我们便错过了 Coding Agent 融入真实协作流程的关键。新的评测范式正在出现,它将目光从冰冷的执行结果,转向了充满细节与规范的协作过程。

评测的盲区

当前对 Coding Agent 的普遍不满,并非源于其“做不到”,而是“做得不好”。例如,Agent 可能无视“不要使用 emoji”的系统提示,或在用户要求备份后直接执行删除操作。这些行为虽然最终可能完成任务,但严重违反了工程规范和团队协作原则。用户需要的不仅是能跑的代码,更是符合团队标准的代码。然而,主流的学术榜单如 SWE-bench verified,其评估核心是结果导向——测试通过了吗?Bug 修复了吗?这种方式完全忽略了 Agent 的输出过程,导致评估与真实开发场景严重脱节。

过程合规评估

为弥合评估与现实的鸿沟,MiniMax 开源了 OctoCodingBench 评测集,将焦点从结果转向过程。它引入了 Check-level 准确率 (CSR) 和 Instance-level 成功率 (ISR) 两个维度。CSR 衡量 Agent 遵守规则的比例,而 ISR 则衡量 Agent 在所有规则约束下一次性成功完成任务的能力。这套体系旨在全面观测 Agent 是否遵循了 System Prompt、用户指令、仓库规范(如 [AGENTS.md])、Skills 调用流程和用户历史偏好等多层次指令。

评测新发现

基于 OctoCodingBench 的评估结果揭示了一些关键问题。所有模型在单一规则遵守上表现尚可(CSR 超过 80%),但一旦要求同时满足所有规则,成功率便断崖式下跌(ISR 仅为 10%-30%)。即便是表现最强的 Claude 4.5 Opus,其 ISR 也只有 36.2%,意味着在近三分之二的任务中,过程依然出错。这证实了“过程合规”是当前 Coding Agent 的普遍短板。值得注意的趋势是,开源模型正在快速追赶,MiniMax M2.1 和 DeepSeek V3.2 的 ISR 已超过部分知名的闭源模型。

未来进化方向

OctoCodingBench 的发现指明了下一代 Coding Agent 的核心命题:过程规范。未来的训练需要引入 Process Supervision(过程监督)。这意味着不仅要监督结果,更要细粒度地监督模型是否遵循了命名规范、是否正确调用工具、是否遵守安全规则等。同时,需要在训练数据中加入指令冲突场景,让模型学会判断指令优先级。最终,Agent 的角色将从简单的代码生成器,转变为一个懂规矩、守纪律的团队成员,真正从 Demo 走向生产环境。

对 Coding Agent 的评估,正从单纯的结果正确,转向复杂的过程合规。这一转变,不仅是评测体系的进步,更是推动 Agent 成为可靠生产伙伴的关键一步。当 AI 开始理解并遵守人类协作中的“潜规则”,我们离真正的 AI 协作时代还有多远?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章