张大妈

超越GRPO:GDPO如何解决多奖励优化难题

源自公众号:机器之心

01-14 14:31

随着语言模型能力升级,单一奖励优化已无法满足复杂人类偏好。GDPO算法的提出,正是为了解决多奖励场景下GRPO算法的优势信号压缩问题,它通过解耦归一化,为模型训练带来了更稳定、更精准的优化效果,推动AI行为对齐迈出新一步。

超越GRPO:GDPO如何解决多奖励优化难题智能速览

  • GRPO在多奖励优化中会压缩奖励信号,降低训练效果

  • GDPO通过解耦归一化各奖励,保留了信号差异

  • 英伟达在三个核心任务上验证了GDPO的有效性

  • GDPO显著提升了训练稳定性,避免了模型性能坍塌

  • 在工具调用和数学推理任务中,GDPO准确率提升最高达6.7%

超越GRPO:GDPO如何解决多奖励优化难题精华内容

深入来看,GDPO的核心创新在于其对奖励信号的处理方式,这直接解决了GRPO的固有缺陷,并在多个关键任务中验证了其优越性。

GRPO的局限

GRPO在处理多奖励时,会将不同奖励组合归一化为相同的优势值。例如,奖励组合(0,2)与(0,1)在计算优势时可能被等同处理,削弱了模型对更优结果的奖励强度,导致训练信号信息损失,甚至可能引发训练不稳定。

GDPO的方案

GDPO的解决方案是“解耦归一化”。它不再将所有奖励聚合后再归一化,而是先对每个独立的奖励信号分别进行群组级归一化,再将其优势相加。这样,(0,2)和(0,1)等不同组合就能产生区分度更大的优势值,使学习信号更精准。

工具调用实测

在工具调用任务中,使用Qwen2.5-Instruct-1.5B模型训练,GDPO将平均工具调用准确率提升了约2.7%,格式正确率提高了4%以上。对比实验显示,单纯移除标准差归一化的GRPO变体在格式奖励上完全失败,凸显了GDPO方法的稳定性。

数学推理提升

在数学推理任务中,GRPO在约400步后出现正确率下降的训练坍塌现象,而GDPO则持续改善。最终,GDPO训练的DeepSeek-R1-1.5B模型在MATH、AIME基准上的准确率分别提升了2.6%和6.7%,同时将超长回答比例降低了高达80%。

代码推理验证

GDPO的有效性在代码推理任务的多奖励设置中得到进一步验证。无论是优化两个还是三个奖励目标,GDPO都能实现更有利的权衡。例如,在双奖励设置下,它在Codecontests任务上将通过率提升了2.6%,且未显著增加超长比例。

GDPO通过精细化的奖励处理机制,为多目标强化学习提供了一个更稳定、高效的优化范式。它不仅解决了GRPO的理论缺陷,更在实践中带来了性能的实质性提升。随着AI模型日趋复杂,这种能够精准对齐多元偏好的技术,将成为推动其发展的关键力量。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章