在大型语言模型追求满足多种人类偏好的过程中,多奖励强化学习成为关键技术。然而,主流方法 GRPO 存在“奖励坍缩”的致命缺陷。NVIDIA 提出的 GDPO 算法,通过解耦归一化,有效解决了这一难题,为模型对齐训练提供了更可靠的优化路径。
智能速览
主流的 GRPO 方法在多奖励优化中存在“奖励坍缩”缺陷。
简单加总多个奖励会降低训练信号的分辨率。
NVIDIA 提出名为 GDPO 的新算法来解决此问题。
GDPO 通过解耦归一化保留奖励信号的差异性。
该新方法能有效避免训练不收敛或早期失败。
精华内容
GDPO 算法的核心创新在于其独特的奖励处理方式。它如何通过解耦与归一化,精确捕捉每个奖励信号的独特价值,从而提升模型训练的整体效果与稳定性?
奖励坍缩难题
在大型语言模型的多奖励对齐训练中,开发者常采用 GRPO 算法,将正确性、安全性等不同维度的奖励值直接相加。
NVIDIA 研究发现,这种操作会引发“奖励坍缩”问题。其根本原因在于,不同奖励的量纲与分布各异,直接加总会抹平它们之间的差异性,导致训练信号分辨率下降。模型因此难以分辨细微的优劣差异,最终造成训练过程不收敛,甚至在对齐初期就宣告失败。
解耦归一化
为解决奖励坍缩,NVIDIA 提出了 GDPO 算法。其核心思想是“解耦归一化”。GDPO 不再将所有奖励混为一谈,而是先对每个独立的奖励信号进行组内归一化处理。这一步确保了每个奖励都能在自身维度上保持清晰的区分度,从而保留了训练信号的有效信息量。通过这种方式,算法能够更精确地评估模型在不同方面的表现。
提升训练稳定性
GDPO 的实践意义在于显著提升了多奖励强化学习的稳定性和效率。通过保留各奖励信号的独特性,模型能够接收到更高质量、更高分辨率的反馈。这不仅解决了训练不收敛的痛点,还使得模型能够更好地平衡和满足复杂的人类偏好。对于追求高精度、高安全性的 LLM 应用场景,GDPO 提供了一个更为可靠的优化范式,有望成为未来模型对齐训练的新标准。
GDPO 算法的提出,精准打击了多奖励强化学习的核心痛点,为构建更智能、更安全的语言模型铺平了道路。这一技术突破不仅提升了训练效率,也引发了对未来对齐方法的思考。除了奖励解耦,还有哪些技术能进一步释放模型的潜力?