在旅行规划等开放式任务中,传统强化学习方法因缺乏客观标准答案而效果不佳,甚至会出现训练停滞。通义实验室提出的ArenaRL框架,通过创新的锦标赛式相对排名机制,有效解决了奖励判别的“塌缩”问题,显著提升了智能体在复杂任务中的表现,为开放式Agent训练提供了新思路。
智能速览
首次系统提出并解决开放式Agent强化学习中的“判别塌缩”问题。
创新性地将奖励机制从“绝对打分”转向“相对排名”,提升优化稳定性。
设计种子单败淘汰赛,以低复杂度实现高精度排序。
评测过程兼顾思维链与工具调用,避免模型投机取巧。
在多个真实任务上,ArenaRL的胜率显著优于GRPO等主流方法。
精华内容
传统强化学习方法在开放式任务中为何失效?核心在于奖励信号的模糊与噪声。ArenaRL的思路是放弃不稳定的绝对分数,转而通过智能体间的两两对决来寻找更优策略,这便是其稳定性的根源。
奖励塌缩之困
在处理旅行规划这类开放式任务时,强化学习长期面临“无客观标准答案”的挑战。当前主流方法通常采用LLM-as-Judge来给出一个具体的分数,即点式标量奖励。然而,当模型能力逐渐增强,不同生成的轨迹质量趋于相似,奖励的方差会急剧缩小。
此时,评估中的噪声成分开始主导优化过程,导致模型训练不仅停滞不前,甚至可能出现性能退化。这种现象被系统性地定义为“判别塌缩”,其根本原因在于开放式任务中点式奖励的信噪比过低(σ_group ≈ σ_noise)。
从打分到排名
为解决判别塌缩问题,ArenaRL提出了一个根本性的范式转变:从“打分”转向“排名”。该方法不再纠结于一个轨迹“好多少”的绝对分数,而是关注“谁更好”的相对顺序。通过在生成轨迹的组内进行两两比较和相对排序,优化目标变得更加清晰和稳定。
这种相对排名的奖励机制,对噪声的鲁棒性更强。即使绝对分数存在波动,只要能稳定地判断出两个轨迹的优劣,就能为模型提供有效的学习信号,从而显著提升了在开放式任务中训练的稳定性。
锦标赛机制
为了高效地实现大规模轨迹的相对排名,ArenaRL设计了一套“种子单败淘汰赛”机制。该方法首先通过greedy解码生成一些基础轨迹作为“种子”或“锚点”,然后让新生成的轨迹与这些种子进行对决,优胜者晋级,继续与其他胜者比较。
这种锦标赛式的结构巧妙地将传统需要O(N²)复杂度的全量两两比较,降低到了O(N)的线性复杂度,同时排序精度却能接近全量对比的效果。这一设计使得在有限的计算资源下,对大规模轨迹集进行高效且准确的排序成为可能。
过程感知评测
ArenaRL的评测机制不仅仅是看最终答案的质量,更引入了“过程感知”的成对评测。在比较两个轨迹时,系统会综合评估其思维链的逻辑一致性、工具调用的合理性以及生成结果的可靠性。
这种多维度的评测方式,有效避免了模型为了获得更高分数而采取的表面投机行为,例如通过生成冗长但无实质内容的答案来“刷分”。它引导模型关注解决问题的真实过程,从而学习到更可靠的策略,而非仅仅是迎合评分规则的技巧。
性能显著领先
在多个真实复杂的任务基准上,ArenaRL展现了其卓越的性能。在Open-Travel任务中,ArenaRL的平均胜率达到41.8%,远超GRPO的16.4%和GSPO的17.2%。在更具挑战性的Open-DeepResearch任务中,其胜率更是高达64.3%,有效生成率从SFT的32%大幅提升至99%。
此外,在开放式写作任务中,ArenaRL在WritingBench、HelloBench等多个榜单上均取得领先。值得注意的是,该方法还展现出强大的冷启动能力,即使在没有经过SFT预训练的情况下,也能从零开始稳定地提升模型性能,有效缓解了强化学习的冷启动难题。
ArenaRL不仅为开放式Agent训练提供了切实方案,还通过开源基准推动领域发展。从绝对评价到相对比较的范式转移,或为更多复杂系统优化带来启发。未来智能体的进化,是否会更多地依赖这种“竞技场”模式?