在追求更强大AI模型的道路上,多奖励强化学习成为关键,但其背后隐藏的’优势崩溃’问题正阻碍着技术进步。英伟达最新提出的GDPO方法,通过巧妙的解耦归一化策略,有效解决了这一痛点,为多奖励RL训练提供了更稳定、高效的全新思路。
智能速览
多奖励RL训练中存在’优势崩溃’问题,会抹平奖励信号差异。
英伟达提出的GDPO方法,通过解耦归一化解决此问题。
GDPO先对每个奖励单独归一化,再聚合,保留了信号价值。
GDPO相比GRPO训练更稳定,收敛速度更快。
GDPO与GRPO代码差异极小,可视为’一键替换’。
精华内容
多奖励训练为何会失效?根源在于训练信号的’分辨率’下降。GDPO的提出,正是为了恢复这些关键信号,让模型训练重回正轨。
优势崩溃的困境
随着模型能力提升,单一奖励已难以满足复杂任务需求,多奖励策略应运而生。当前主流的GRPO方法,将多个奖励信号相加后统一优化,却引发了一个被忽视的关键问题:优势崩溃。GRPO的组内归一化机制会将不同奖励组合压缩成几乎相同的优势值,导致训练信号分辨率大幅下降,模型无法有效分辨行为的优劣。这就好比将多种颜料混合,最终只得到一团模糊的灰色,宝贵的训练信息就此丢失。
解耦归一化之道
GDPO的核心在于一个巧妙的转变:先归一化,再聚合。具体而言,它首先对每一个奖励信号单独进行组内归一化,这一步确保了每个奖励的相对差异被完整保留。随后,将这些处理后的奖励信号进行聚合,最后再进行批次级别的归一化,以防止数值尺度膨胀。这种’解耦归一化’策略,从根本上避免了优势崩溃的发生,确保了每个奖励的信号价值都能在训练中得到体现。
效果与稳定性
英伟达团队在多个任务上对GDPO进行了系统验证。结果明确显示,GDPO不仅在收敛速度上超越GRPO,更重要的是,它在整个训练过程中表现出极高的稳定性,有效规避了GRPO常见的训练失败问题。令人惊喜的是,GDPO与GRPO的代码实现差异极小,几乎可以视为’一键替换’,这为研究者们提供了极大的便利,使其成为一种低门槛、高回报的优化方案。
GDPO的出现,为多奖励RL训练领域拨开了迷雾,证明了解决问题的关键不在于增加奖励数量,而在于如何有效利用信号。这一简洁而高效的方案,或将成为未来大模型能力提升的重要基石。多奖励优化的下一个突破口会在哪里?