张大妈

Agent自我进化的新范式

源自小红薯:🎃量子智心

02-06 19:32

深度研究智能体在自动化知识发现中潜力巨大,但常因错误和幻觉导致输出不可靠,长任务中的人工监督成本高昂。一种名为DeepVerifier的新范式,通过在推理时引入验证机制,让智能体能自我修正并持续进化,为提升AI可靠性提供了全新思路,无需额外训练即可显著增强性能。

Agent自我进化的新范式智能速览

  • 深度研究智能体普遍面临错误与幻觉的可靠性挑战。

  • 提出推理时验证新范式,让智能体无需训练即可自我进化。

  • DeepVerifier框架利用验证比生成更简单的非对称性原理。

  • 通过标准驱动的反馈机制,驱动智能体迭代优化自身表现。

  • 实验证实该方法能将智能体在部分任务上的准确率提升11%。

Agent自我进化的新范式精华内容

DeepVerifier框架的巧妙之处在于,它不再局限于训练阶段的优化,而是将进化过程前置到推理环节。这如何实现?其核心在于一个分解、验证与评判的闭环系统。

问题所在

深度研究智能体(DRA)在处理复杂、长链路的知识发现任务时,展现出强大的自动化潜力。然而,其可靠性是实际应用的主要障碍。这些智能体时常会产生错误的动作或“幻觉”式的内容,导致最终输出的结果不可信。在需要长时间运行的任务中,持续的人工监督变得不切实际且成本高昂,因此,业界迫切需要一种能够自动化提升智能体可靠性的有效方法。

核心思路

该研究的核心思路打破了传统范式,将优化的重点从训练阶段转移到推理阶段。它基于一个关键洞察:验证一个答案的正确性,通常比从零开始生成一个正确的答案要简单得多。这种非对称性构成了新范式的基础。研究团队设计了一个名为DeepVerifier的框架,旨在利用这一原理,让智能体在执行任务的过程中,能够自我验证并不断进化,而无需进行额外的模型训练。

框架解析

DeepVerifier框架包含三个核心模块。首先是分解模块,它负责将复杂的验证任务拆解成一系列更简单、可管理的子任务。接着是验证模块,它会针对每个子任务去检索和验证信息。最后是评判模块,它根据预设的分类标准对验证结果进行打分,并生成具体的、可操作的反馈。这些反馈将直接驱动智能体进入下一轮迭代,修正之前的错误,从而实现性能的持续提升。

实测效果

为验证DeepVerifier的有效性,研究团队在GAIA和XBench-DeepSearch等多个权威数据集上进行了测试,并使用了Claude-3.7-Sonnet等先进模型作为基础。实验结果非常显著:DeepVerifier在验证任务上的F1分数实现了12%到48%的大幅提升。当该框架被集成到深度研究智能体中后,智能体在GAIA数据集子集上的任务准确率提高了8%至11%。值得注意的是,即使是开源模型,经过微调后也能从中获得显著的性能增益。

DeepVerifier为提升AI智能体的可靠性开辟了一条新路径,其推理时缩放的范式具有广阔的应用前景。未来,随着这种自我进化机制的成熟,我们是否将看到更多能独立完成复杂研究任务的智能体出现,从而真正解放人类生产力?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章