曾被视为行业“北极星”的编程能力评测基准 SWE-bench Verified,因其高度数据污染与测试设计缺陷,已无法真实衡量模型进步。OpenAI 正式宣布其退役,并建议转向更具挑战性的新基准。此举不仅是更迭榜单,更引发了关于未来应如何评测 AI 代码能力的深刻思考,焦点正从单纯解题转向衡量其在真实世界中的价值。
智能速览
SWE-bench Verified 因数据污染和测试设计缺陷而失效。
新基准 SWE-bench Pro 题目更难、周期更长且污染更少。
未来评测将更关注真实世界影响,而非单纯的分数排名。
理想的评测应衡量代码品味、设计决策和长期可维护性。
精华内容
榜单的更迭背后,是评估理念的深刻变革。当旧的标尺不再准确,整个行业都需要重新思考:我们真正想衡量的 AI 代码能力究竟是什么?
旧榜的致命缺陷
SWE-bench Verified 的退役源于两大核心问题。首先是严重的数据污染,几乎所有前沿模型都表现出对评测数据的熟悉度,甚至能仅凭任务 ID 就“猜”出解法,这使得评测失去了公平性。其次是测试设计本身存在缺陷,OpenAI 经审查发现,超过 60% 的未解决问题从描述上看就是无解的,其测试用例过于狭窄,有时会检查问题描述中未提及的参数或功能,导致大量正确实现无法通过测试,无法真实反映模型的代码能力。
新基准的进化
作为替代方案的 SWE-bench Pro,在设计上进行了显著升级。其题目更大、更复杂,明确要求“数小时甚至更久”才能完成,远超 Verified 中 90% 任务“一小时内搞定”的难度。此外,Pro 版本的仓库、语言和问题类型更加丰富,能更全面地评估模型能力。最重要的是,通过污染审计发现,Pro 版本目前几乎没有被污染的迹象,能更有效地区分不同模型的真实能力差异,为行业提供了一个更可靠的“新标尺”。
未来的评测方向
OpenAI 认为,评测的未来不应再局限于分数的微小差异。下一代代码评测应关注更接近真实工作的能力,例如开放式的设计决策、代码的品味(是否清晰、易维护),以及处理长达数天任务的能力。最终的衡量标准,将从“模型解决了多少问题”转向“AI 在多大程度上替代或增强了人类工作”,通过考察其在生产环境中的实际使用情况、吞吐量和带来的价值,来评估其真实影响力。
从追逐榜单分数到关注真实世界价值,AI 代码评测正迈入一个更成熟的新阶段。SWE-bench 的退役并非终点,而是一个起点,促使整个行业去探索更科学、更贴近实际的评估体系。未来,AI 将如何深度重塑软件工程,值得我们持续关注。