张大妈

全行业盯了两年的编程能力榜,今天退役!OpenAI 停用 SWE-bench Verified:未来标准将看 AI 能顶替多少程序员?

源自公众号:InfoQ

02-27 13:31

曾被视为行业“北极星”的编程能力评测基准 SWE-bench Verified,因其高度数据污染与测试设计缺陷,已无法真实衡量模型进步。OpenAI 正式宣布其退役,并建议转向更具挑战性的新基准。此举不仅是更迭榜单,更引发了关于未来应如何评测 AI 代码能力的深刻思考,焦点正从单纯解题转向衡量其在真实世界中的价值。

全行业盯了两年的编程能力榜,今天退役!OpenAI 停用 SWE-bench Verified:未来标准将看 AI 能顶替多少程序员?智能速览

  • SWE-bench Verified 因数据污染和测试设计缺陷而失效。

  • 新基准 SWE-bench Pro 题目更难、周期更长且污染更少。

  • 未来评测将更关注真实世界影响,而非单纯的分数排名。

  • 理想的评测应衡量代码品味、设计决策和长期可维护性。

全行业盯了两年的编程能力榜,今天退役!OpenAI 停用 SWE-bench Verified:未来标准将看 AI 能顶替多少程序员?精华内容

榜单的更迭背后,是评估理念的深刻变革。当旧的标尺不再准确,整个行业都需要重新思考:我们真正想衡量的 AI 代码能力究竟是什么?

旧榜的致命缺陷

SWE-bench Verified 的退役源于两大核心问题。首先是严重的数据污染,几乎所有前沿模型都表现出对评测数据的熟悉度,甚至能仅凭任务 ID 就“猜”出解法,这使得评测失去了公平性。其次是测试设计本身存在缺陷,OpenAI 经审查发现,超过 60% 的未解决问题从描述上看就是无解的,其测试用例过于狭窄,有时会检查问题描述中未提及的参数或功能,导致大量正确实现无法通过测试,无法真实反映模型的代码能力。

新基准的进化

作为替代方案的 SWE-bench Pro,在设计上进行了显著升级。其题目更大、更复杂,明确要求“数小时甚至更久”才能完成,远超 Verified 中 90% 任务“一小时内搞定”的难度。此外,Pro 版本的仓库、语言和问题类型更加丰富,能更全面地评估模型能力。最重要的是,通过污染审计发现,Pro 版本目前几乎没有被污染的迹象,能更有效地区分不同模型的真实能力差异,为行业提供了一个更可靠的“新标尺”。

未来的评测方向

OpenAI 认为,评测的未来不应再局限于分数的微小差异。下一代代码评测应关注更接近真实工作的能力,例如开放式的设计决策、代码的品味(是否清晰、易维护),以及处理长达数天任务的能力。最终的衡量标准,将从“模型解决了多少问题”转向“AI 在多大程度上替代或增强了人类工作”,通过考察其在生产环境中的实际使用情况、吞吐量和带来的价值,来评估其真实影响力。

从追逐榜单分数到关注真实世界价值,AI 代码评测正迈入一个更成熟的新阶段。SWE-bench 的退役并非终点,而是一个起点,促使整个行业去探索更科学、更贴近实际的评估体系。未来,AI 将如何深度重塑软件工程,值得我们持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章