张大妈

EigenData:会自我进化的数据引擎

源自小红薯:每日ComputerScience

02-11 13:15

训练能熟练使用工具的多轮对话智能体,长期面临数据难获取、奖励信号噪声大的两大瓶颈。一项名为EigenData的新研究提出统一的后训练框架,通过自进化数据引擎和可验证的强化学习方法,系统性解决了这些问题。其核心价值在于,完全基于开源模型实现了对顶级闭源模型的超越,为高性能智能体的开源发展提供了可复现的新路径。

EigenData:会自我进化的数据引擎智能速览

  • 提出EigenData框架,解决多轮工具智能体的数据和奖励瓶颈。

  • 自进化数据引擎能自动生成高质量对话数据及验证函数。

  • 可验证奖励机制通过程序化校验,直接作为强化学习信号。

  • 采用先SFT用户模型再进行RL的训练策略,稳定信号来源。

  • 基于Qwen3开源模型,在τ²-bench上超越GPT-5等闭源模型。

EigenData:会自我进化的数据引擎精华内容

EigenData框架的精妙之处在于,它将数据生成与模型训练融为一体,构建了一个能够自我完善的闭环系统。接下来将深入解析其两大核心支柱:自进化数据引擎和可验证奖励机制。

自进化数据引擎

为了解决高质量多轮工具数据难以规模化获取的问题,该框架构建了一个分层多Agent系统。这个系统能够自动生成包含多轮、多步、工具实际落地的对话数据。

与传统一次性数据合成不同,它具备工作流级的自进化能力。系统会基于任务执行的失败反馈,自动优化自身的Prompt和工作流,形成一个持续改进的闭环。这意味着数据生成的质量和效率会随着时间推移而不断提升。

可验证奖励RLVR

在交互式强化学习中,奖励噪声是一个巨大挑战,尤其是来自用户模拟的噪声。EigenData摒弃了依赖文本相似度的传统奖励方式,创新性地提出了“可验证奖励”机制。

该机制通过对“最终环境状态”和“关键工具调用”进行程序化校验来生成奖励信号。这种方法不依赖主观判断,而是基于客观的程序化结果,天然适配可验证奖励的强化学习(RLVR),极大地降低了噪声干扰。

创新训练配方

研究团队发现,用户模拟是交互式RL训练中的主要噪声源。为此,他们设计了一套独特的训练配方:首先对用户模型进行有监督微调(SFT),然后再用其进行rollout,这显著稳定了训练信号。

在强化学习阶段,采用Group Relative Policy Optimization(GRPO)算法。该算法在同一任务内对多条轨迹进行标准化比较,有效缓解了绝对奖励稀疏的问题。此外,系统还会动态过滤掉那些所有轨迹全成功或全失败的无信息任务,避免零优势噪声污染梯度。

卓越性能表现

EigenData框架的效能已在业界权威的τ²-bench基准测试中得到验证。整个实现完全基于Qwen3开源模型,且不依赖任何人工标注和闭源奖励模型。

结果显示,其性能达到了当前最优水平(SOTA):在Airline任务上达到73.0%的通过率,在Telecom任务上更是达到了惊人的98.3% pass 1。这一成绩全面超越了GPT-5、Gemini 3.0 Pro与Claude Sonnet等顶尖闭源模型。

EigenData框架的成功,为解决智能体训练中的关键难题提供了全新的开源范式。它证明了通过巧妙的工程设计与算法创新,开源模型同样可以达到顶尖水平。这项研究是否会加速高性能智能体的普及,并催生更多自进化AI系统的诞生?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章