张大妈

Qwen 发布 ArenaRL:解决开放域 Agent 的奖励建模难题

源自知乎:0xC001

01-18 20:49

针对开放域Agent任务中缺乏客观真值的核心难题,通义实验室提出了ArenaRL框架。该研究揭示了传统点式奖励模型的’判别崩塌’现象,并通过基于锦标赛的相对排序机制,为复杂旅行规划、深度搜索等开放任务提供了更稳定的强化学习训练方案。

Qwen 发布 ArenaRL:解决开放域 Agent 的奖励建模难题智能速览

  • 发现开放域Agent训练中的判别崩塌现象

  • 传统点式奖励模型在高质量轨迹组中信噪比极低

  • ArenaRL采用锦标赛相对排序替代绝对评分

  • 种子单败淘汰制实现效率与性能最佳平衡

  • 在Open-Travel等基准测试中表现优异

  • LLM Judge与人类评估一致性达73.9%

Qwen 发布 ArenaRL:解决开放域 Agent 的奖励建模难题精华内容

当前开放域Agent训练面临根本性挑战:当模型能力提升后,传统奖励模型提供的信号几乎全是噪声。ArenaRL从决策理论汲取灵感,用相对排名解决了这一难题。

判别崩塌现象

开放域Agent任务如旅行规划、深度分析报告撰写,缺乏明确的正确答案。现有方法依赖LLM作为裁判,对生成轨迹进行标量评分。然而研究发现,随着策略能力提升,候选轨迹质量收敛到狭窄范围,此时奖励模型的噪声量级与真实信号相当甚至更高。对于依赖组内归一化的RL算法,归一化操作实际上在放大噪声,导致训练停滞。统计分析显示,在高质量轨迹组中,信噪比极低,优化过程不再由真实优势驱动,而是拟合奖励模型的噪声。

相对排序机制

ArenaRL放弃不稳定的绝对标量分数,引入基于组内相对排名的在线策略优化框架。核心是Arena Judge模块,它接收查询、两条候选轨迹和详细评价标准,进行过程感知评估。为消除位置偏差,采用双向评分协议,交换顺序评估两次。相比传统方法只关注最终答案,Arena Judge审查思维链、工具使用、环境交互和结果质量等多个维度,通过成对比较获得更稳定的质量判断。

锦标赛拓扑优化

完全准确的全连接循环赛复杂度过高,ArenaRL系统研究了五种锦标赛拓扑,寻求效率与准确性的平衡。最终采用种子单败淘汰制,分为种子排位和淘汰赛两个阶段。种子排位通过锚点法快速分组,淘汰赛则逐步淘汰弱者。这种拓扑将O(n²)复杂度降至O(n log n),同时保持较高的排名准确性。实验证明,该方案在计算效率和性能评估上都达到了最佳权衡。

优势信号转化

ArenaRL将离散排名转化为归一化优势信号,驱动策略优化。给定轨迹组相对排名,通过数学变换得到每条轨迹的优势值。这种转化方式将组内相对质量差异转化为稳定的梯度信号,避免了传统方法中噪声主导的问题。强化学习训练基于这些稳定的优势信号进行策略更新,使模型向更强的推理和规划能力进化。整个框架不需要预设奖励函数,完全通过相对比较学习。

基准测试验证

针对现有基准缺乏完整训练管线的问题,作者构建了Open-Travel和Open-DeepResearch两个高质量基准。在Open-Travel测试中,ArenaRL相比基线方法提升显著。为验证通用性,还在WritingBench、HelloBench、LongBench-write等公开数据集测试,特别是在长文写作任务上,得益于对逻辑结构的成对比较优化,提升尤为明显。高德地图实际业务数据也验证了方法的有效性。

人类对齐验证

关键问题是RL提升是否真正符合人类价值观。实验测试显示,ArenaRL使用的LLM Judge与人类评估的一致性达到73.9%,混淆矩阵主要集中在对角线。这证明优化过程中模型学到的是真实的能力提升,而非拟合裁判偏见。实际案例对比显示,经过ArenaRL训练的Agent在复杂旅行规划中,能够生成推理更严密、工具使用更高效的策略,体现了方法的实用价值。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章