张大妈

自进化数据+验证式RL训练Agent

源自小红薯:🎃量子智心

02-07 13:51

训练能进行复杂多轮交互的AI智能体,常面临高质量数据匮乏和强化学习噪声两大瓶颈。一项新研究提出突破性框架,结合自进化合成数据与可验证奖励的强化学习,实现无需人工标注的高效训练,显著提升智能体在真实任务中的表现,为构建更强大的交互式智能体提供了新思路。

自进化数据+验证式RL训练Agent智能速览

  • 交互式AI智能体训练面临数据稀缺和用户模拟器噪声的挑战。

  • EigenData引擎能自主合成并自我进化高质量的多轮工具使用数据。

  • 采用可验证奖励的强化学习食谱,稳定训练过程并提升效率。

  • 该方法在τ 2-bench基准测试中,使Qwen3-235B模型在电信领域达到98.3%的成功率。

  • 消融实验证实了框架中每个关键环节对最终效果都至关重要。

自进化数据+验证式RL训练Agent精华内容

究竟如何解决数据与噪声这两大难题?该框架的核心创新在于,将一个能自我进化的数据生成引擎与一套精巧的强化学习训练策略相结合,打造了一个高效且可扩展的训练闭环。

自进化数据引擎

为突破数据瓶颈,研究团队设计了EigenData,一个分层多智能体数据引擎。该引擎的核心能力是自主合成用于工具交互的对话数据,并同时生成可执行的验证函数来检验数据质量。

通过引入闭环反馈机制,EigenData能够不断从生成数据的效果中学习,实现自我进化,逐步提升数据的多样性和可靠性,从而彻底摆脱了对昂贵人工标注的依赖。

验证式强化学习

针对强化学习中的用户模拟器噪声问题,该研究设计了一套两阶段的训练食谱。首先,通过监督微调(SFT)对用户模拟器模型进行训练,确保其行为稳定,减少随机性。

随后,采用GRPO算法进行大规模强化学习训练。训练中结合了轨迹级组间相对优势评估、动态过滤低质量轨迹,并直接使用数据引擎生成的验证函数作为奖励信号,有效降低了噪声干扰,提升了训练效率与稳定性。

性能跃升与验证

在权威的τ 2-bench基准测试中,该框架展现了卓越性能。实验覆盖航空、零售和电信三大领域,结果显示,仅经过SFT微调的模型已表现优异,而经过完整的RL训练后,性能上限被进一步推高。

具体而言,Qwen3-235B模型在电信领域取得了98.3%的pass@1成功率,在航空和零售领域也匹配或超越了多个前沿模型。消融实验进一步证明,从EigenData的自我进化到RL中的动态过滤,每一个组件都对最终的成功起到了不可或缺的作用。

该研究通过巧妙融合自进化数据与验证式RL,为解决高级AI智能体训练中的核心难题提供了切实可行的方案。它不仅显著提升了模型性能,更展示了一条低成本、高效率的自动化训练路径。未来,这种结合数据合成与强化学习的范式,能否成为训练通用智能体的标准流程?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章