传统提升智能体能力多依赖训练,而本文提出一种让其在推理时就实现自我演进的创新方案。通过构建一套验证-反思-重做的闭环机制,该方案在不增加训练成本的前提下,显著提升了智能体在复杂任务中的准确率,为AI Agent发展提供了新视角。
智能速览
提出一种基于推理时验证的智能体自我演进新范式。
通过构建Agent失败分类学来制定精准的验证标准。
核心机制是利用“验证比生成更简单”的非对称性。
关键性能指标F1分数实现了12%至48%的大幅提升。
集成该方案后,研究代理在GAIA基准测试中准确率优化8%-11%。
该方案已在开源模型微调中得到验证并公开了相关数据集。
精华内容
这项研究的核心在于构建了一套能够让智能体在推理时自我迭代的机制,其关键在于巧妙利用了验证与生成之间的非对称性。
构建失败分类学
研究的第一步是系统性地梳理智能体在执行任务时可能出现的失败模式。通过合成数据,团队构建了一个包含5大类和13个子类的Agent Failure Taxonomy。
这个分类学如同一份详细的“病历”,为后续的验证环节提供了精准的靶点。基于此,研究者制定了评估答案质量的Rubrics(评分标准),使得每一次验证都有据可依,而非凭空判断。
验证-反思循环
基于上述评分标准,研究搭建了“验证->反思->重做”的自动化流程。其精妙之处在于利用了验证的非对称性——判断一个答案的好坏通常比从头生成一个好答案要简单得多。
在这个闭环中,智能体首先生成答案,然后DeepVerifier模块会根据Rubrics给出详细的、分类的反馈。智能体根据这些反馈进行反思和修正,再生成新答案,如此迭代,实现了在测试时(推理时)的自我进化。
性能显著提升
实验结果有力地验证了该方案的有效性。在验证任务上,DeepVerifier相较于传统的Agent-as-Judge和LLM Judge基线,F1分数提升了12%到48%不等,显示出更高的判断准确性。
当集成到Deep Research Agent中后,在具挑战性的GAIA和XBench-DeepResearch子集上,Agent的准确率获得了8%至11%的显著优化。这意味着,智能体解决复杂问题的能力得到了实质性加强。
开源实践验证
为了推动整个领域的发展,研究者不仅将这套机制作为即插即用的模块,还进一步将其能力融入开源模型。
团队收集了整个自我演进过程中的验证、反思和重做数据,并发布了包含4646个高质量样本的DeepVerifier-4K监督微调数据集。实验证明,基于此数据集微调的开源模型也能获得强大的验证能力,证实了方案的普适价值。
这项研究为智能体的能力进化开辟了一条新路径,将重心从训练后转向了推理时。这种“自我进化”的范式,让智能体拥有了在实战中学习和优化的潜力。未来,随着验证标准的进一步精细化,Agent能否实现更高效、更自主的迭代,值得期待。