面向复杂知识任务时,Deep Research代理的强化学习训练常面临不稳定性挑战。一项研究系统拆解了其核心变量,提出新基线Search-R1++。通过优化Prompt、奖励和算法,该策略显著提升了多跳问答表现与推理效率,为构建更可靠的搜索智能体提供了明确路径。
智能速览
Fast Thinking Prompt模板能显著提升训练稳定性。
单纯使用F1奖励会诱导模型出现拒答塌陷。
F1+策略通过行为惩罚成功修复了F1奖励的缺陷。
REINFORCE算法在收敛稳定性上优于PPO与GRPO。
REINFORCE能自适应优化推理成本,减少不必要搜索。
精华内容
揭开强化学习在搜索智能体中的神秘面纱,关键在于三大核心变量的精细调控。接下来将深入探讨这些发现如何重塑AI的搜索与推理能力。
Prompt模板革新
研究团队发现,Prompt设计是决定训练稳定性的首要因素。传统Slow Thinking模板强制模型进行显式、分步的推理,容易导致“思考膨胀”,即推理链过长且不稳定,最终引发训练崩溃。而提出的Fast Thinking模板则去除了显式推理要求,让模型直接生成答案。实测表明,这种简洁的方式不仅大幅提升了训练过程的稳定性,最终的精度也更高。
奖励函数陷阱
奖励机制的设计同样充满陷阱。实验发现,单纯使用F1分数作为奖励,会诱导模型为了规避错误而选择“不回答”,出现严重的Answer Avoidance现象,导致模型性能塌陷。相比之下,EM(Exact Match)奖励虽然看似粗糙,但因不惩罚部分正确的答案,反而更稳定。为此,研究提出了F1+奖励,在F1基础上对“不搜索”和“不回答”等消极行为施加轻量惩罚,成功抑制了塌陷问题,并使F1+训练的最终效果超越了EM。
算法性能对决
在统一的实验设置下,三种主流策略优化算法的性能差异明显。REINFORCE算法展现出最佳的综合性能,收敛过程更平稳,搜索次数更少,最终准确率最高。GRPO的稳定性最差,而广受欢迎的PPO则存在搜索次数僵化的问题,无法根据问题难度自适应调整。REINFORCE能够学习到更紧凑的搜索策略,有效减少不必要的搜索动作,实现了推理成本的可控优化。
这项研究不仅为搜索型智能体的强化学习训练设立了新标杆Search-R1++,更重要的是揭示了Prompt、奖励与算法间的深刻联系。它为未来构建更高效、更稳定且成本可控的AI系统提供了宝贵的理论依据与实践指导。这些发现会如何改变下一代Agent的设计思路?