在软件工程智能体验证领域,传统的代码执行验证面临扩展成本高、信号稀疏等问题,而非执行式验证又存在可靠性低的缺陷。这篇研究提出了一种创新的代理式评分标准验证方法,通过智能体主动探索代码库,生成针对特定代码库的结构化评分细则,在无需执行代码的情况下实现高效验证。该方法在SWE-Bench Verified基准上展现出优异性能,为SWE智能体的规模化验证提供了新思路。
智能速览
代理式评分标准通过探索代码库生成具体评估细则
相比执行验证成本更低,相比非执行验证更可靠
在SWE-Bench Verified基准上实现78%的高实用性判定
模型能力直接影响生成评分细则的数量和质量
仓库交互能将评价标准锚定在具体实体上,减少歧义
精华内容
随着SWE智能体向更复杂任务扩展,验证器必须同时具备可扩展性和针对特定代码库的能力。代理式评分标准通过智能体探索代码库,生成结构化评估细则,实现了这一目标。
验证方法对比
研究对比了三种主要验证方法:代理式测试通过生成测试文件并执行验证,但扩展成本高昂;代理式补丁相似度通过生成参考补丁并对比相似度,但容易受浅层线索误导;代理式评分标准则通过探索代码库生成结构化评分细则,在运行上更为轻量且可靠性更高。
实验结果显示,评分标准与测试结果一致时,78%的判定具有高实用性,主要体现在对核心语义、API兼容性和边界情况的覆盖。
评分标准有效性
当评分标准比测试更严格时,仍有54%的拒绝判定具有高实用性,能够发现标准测试未能覆盖的根本原因和边界情况。这表明评分标准具有补充测试覆盖不足的优势。
失效模式主要表现为对修复要求过细、信号冗余等问题,未来可通过引入人在回路机制优化。
模型能力影响
实验发现,评分细则生成模型的能力直接影响验证表现。Sonnet-4.5平均每个实例生成超过20条评分细则,是Qwen3-32B和CWM的两倍。
评分细则颗粒度的增加能够对备选方案进行更细致的区分,这解释了模型能力与筛选性能之间的相关性。
仓库交互价值
通过对比智能体与非智能体评分细则,证实了仓库交互的关键价值。智能体评分细则通过工具调用将评价标准锚定在具体仓库实体上,使评分项更具体、标准更具一致性。
非智能体评分细则通常较为笼统,增加了歧义性并可能导致误报。
训练与优化
研究表明,生成结构化评分细则的能力是可以通过训练获得的。智能体评分细则生成器显著优于补丁分类验证器和未经微调的基座模型。
判别模型的能力对性能有微小但不可忽视的影响,但由于评分细则被设计为自包含且原子化,对判别模型的推理能力要求并不极高。
代理式评分标准验证方法为SWE智能体的规模化验证提供了新的解决方案,通过智能体探索代码库生成针对性评估细则,在轻量化和可靠性之间找到了平衡点。未来如何进一步优化评分标准的颗粒度、结合人工反馈机制,以及在不同类型代码库中的泛化能力,都值得持续探索。