AI Agent训练常遇成功率突然归零的崩塌难题,令人束手无策。UCLA团队的ARLArena研究系统拆解了这一痛点,发现训练不稳定的根源在于特定样本持续提供错误梯度。其提出的SAMPO算法,成功解决了这一难题,甚至让一个40亿参数小模型在特定任务上超越了GPT-5.2,为Agent稳定训练提供了新范式。
智能速览
Agentic RL训练普遍存在成功率突然归零的崩塌问题。
训练崩塌根源是负优势、低IS比率样本持续提供错误梯度。
SAMPO算法通过序列级裁剪和步骤级优势解决此问题。
新方法在多个任务上平均提升25.2%,超越现有基线。
4B参数模型经训练后,特定任务表现超越GPT-5.2和o3。
精华内容
AI Agent训练为何频繁崩溃?UCLA的ARLArena研究揭示了传统方法在多轮交互中的致命缺陷,并提出了一套系统性的稳定训练方案,其核心发现直指策略梯度的优化过程。
训练三大难题
Agentic强化学习(ARL)面临三重挑战,导致训练极易崩塌。首先是奖励信号极度稀疏,模型需连续完成数十步决策后才能获得最终的成败反馈,学习效率低下。其次是策略更新后,之前采集的数据迅速过期,与当前策略产生偏差,导致梯度估计失准。最致命的是,前期的一个微小错误会通过环境状态逐步放大,到后期彻底无法挽回,最终导致成功率断崖式下跌,且不同随机种子的训练结果差异巨大,难以复现。
定位崩塌根源
论文通过对策略梯度公式的系统解剖,将矛头指向了重要性采样裁剪环节。研究发现,现有方法如CISPO和SAPO采用的容忍型裁剪是训练崩塌的直接诱因。统计分析显示,每次训练崩溃前,一类“负优势且低IS比率”的危险序列会急剧增多。这类序列代表模型不愿采纳且实际错误的路径,理应被舍弃。但容忍型裁剪却允许它们继续提供梯度信号,相当于强迫模型反复学习错误方向,最终引发梯度爆炸,导致训练彻底失败。
序列级裁剪
针对上述问题,SAMPO提出了序列级裁剪这一核心改进。传统方法是对每个token独立进行裁剪,导致少数极端token的权重可能绑架整条轨迹的梯度更新。序列级裁剪则将裁剪粒度提升至整个轨迹,计算轨迹内所有token重要性采样权重的几何平均值,用该单一指标判断整条轨迹是否应被裁剪。这种设计能有效隔离危险序列,防止个别异常点污染全局,从根源上消除了梯度爆炸的风险,被实验验证为提升稳定性的最关键单项设计。
步骤级优势
SAMPO的另一个创新是引入细粒度的步骤级优势估计,以缓解奖励稀疏问题。传统方法只为整个轨迹打一个总分,模型无法知晓具体是哪一步决策导致了最终结果。步骤级优势通过横向比较在相同环境状态下不同轨迹的选择,为每一步操作单独计算相对优劣。这相当于将稀疏的轨迹级奖励精细化为每个决策点的信用分配,使模型能更精准地学习到哪些行为是有效的,显著提升了学习效率。
实验效果显著
实验数据充分证明了SAMPO的有效性。在ALFWorld任务中,基于Qwen3-4B的SAMPO成功率高达92.72%,远超GRPO基线的62.36%,提升近30个百分点。在Sokoban任务上,容忍型裁剪方法CISPO和SAPO成功率仅26%和30%,而SAMPO达到83.9%,凸显设计缺陷的巨大代价。最引人注目的是,SAMPO训练的4B模型在ALFWorld上甚至超越了GPT-5.2单Agent(51.56%)和o3多Agent系统(56.25%),表明稳定的环境对齐训练能带来推理时工程难以企及的性能飞跃。
ARLArena的价值不仅在于提出了SAMPO这一高效算法,更在于它建立了一套系统性的ARL训练分析与评测框架,为该领域混乱的现状带来了秩序和基准。它揭示了训练崩塌的深层机理,并提供了切实可行的修复方案。这套训练配方未来能否成功应用于更复杂、开放的真实世界Web Agent任务中,将是极具价值的探索方向。