张大妈

Agentic RL:解耦 Reasoning 与 Tool-use

源自知乎:sheriyuo

03-03 15:16

在智能体强化学习(Agentic RL)领域,一个普遍的认知是推理与工具使用能力可以协同优化。然而,这项研究通过实证分析揭示了两者间普遍存在的负向交互效应,即“跷跷板”现象。为突破这一性能瓶颈,研究提出了一种名为DART的解耦调优方法,通过参数隔离让两种能力独立进化,显著提升了模型在复杂任务中的表现,为Agent系统设计提供了新范式。

Agentic RL:解耦 Reasoning 与 Tool-use智能速览

  • Agentic RL中推理与工具使用能力存在显著的负向交互,而非协同增益。

  • 根本原因在于两类能力在参数空间的梯度方向接近正交,导致优化冲突。

  • 研究提出DART方法,通过独立的LoRA适配器实现推理与工具使用的参数解耦。

  • 实验显示DART在多个基准测试中带来显著性能提升,接近双智能体系统水平。

  • 核心启示是并非所有能力都适合共享参数空间,解耦是解决结构性冲突的有效途径。

Agentic RL:解耦 Reasoning 与 Tool-use精华内容

传统Agentic RL方法隐含地假设推理与工具使用能协同优化,但事实并非如此。当模型被迫在同一参数空间中同时学习两种能力时,性能上限反而被梯度冲突所限制。

能力冲突现象

在Agentic RL的训练中,普遍存在一种“跷跷板”现象:提升模型的工具使用能力,往往以牺牲其推理能力为代价,反之亦然。这种负向交互效应并非特定任务或小模型的偶然结果,而是在不同数据集和不同规模模型上都能稳定复现的普遍规律。这直接挑战了“共享参数联合训练必然带来协同”的传统假设。

梯度正交根源

冲突的根源隐藏在优化动力学之中。通过分析token级别的梯度发现,来自推理token的梯度更新方向与来自工具调用token的梯度更新方向几乎正交,夹角接近90度。在高维空间中,这近乎常态,意味着两种能力在参数空间中追求的是截然不同的最优解,联合优化只能导向一个对双方都次优的“折中方向”。

量化干扰框架

为量化这一现象,研究提出了诊断框架LEAS。该框架通过构造多种模型变体解线性方程组,得到不同能力间交互项的系数。实验结果证实,在NQ与HotpotQA等多工具问答任务中,推理与工具使用的交互系数几乎全为负值,且干扰最严重的区域恰恰对应最需要多步推理与工具交互的复杂问题。

解耦调优方案

针对此问题,研究提出DART(Disentangled Action-Reasoning Tuning)方案。其核心是冻结模型主干参数,为推理和工具使用分别引入独立的LoRA适配器,并通过token级路由机制,让推理token的梯度只更新推理LoRA,工具token的梯度只更新工具LoRA,从而在训练阶段实现显式的梯度隔离,让两种能力在各自的低秩子空间中独立进化。

性能显著提升

实验结果显示,DART策略效果显著。在3B模型上,其平均EM分数相比Search-R1-GRPO提升超过6%,在多跳推理任务上相对提升幅度接近30%。与理论上无冲突的双Agent系统相比,DART在单模型结构下复现了其大部分性能优势,同时避免了多模型系统在显存占用和工程成本上的巨大开销。

这项研究揭示了Agentic RL性能瓶颈可能源于能力的结构性冲突,而非单纯的数据或算法问题。DART方法证明了参数解耦的有效性,为构建更强大的单一Agent模型提供了实用且高效的新思路。未来,如何识别并解耦更多潜在的能力冲突,将是值得探索的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章