张大妈

多奖励场景全面领先!清华新作高熵驱动,强化学习效率飙升

源自公众号:新智元

01-31 19:51

针对流模型强化学习中的奖励稀疏与归因模糊难题,清华大学团队提出E-GRPO框架。该创新方法通过熵驱动的步骤合并,聚焦高价值探索,显著提升了模型训练效率与人类偏好对齐效果,为视觉生成AI的优化开辟了新路径。

多奖励场景全面领先!清华新作高熵驱动,强化学习效率飙升

多奖励场景全面领先!清华新作高熵驱动,强化学习效率飙升智能速览

  • E-GRPO解决核心痛点:奖励稀疏与归因模糊

  • 通过合并低熵步骤,聚焦高熵探索,提升效率

  • 在单/多奖励场景下,性能均超越主流方法

  • HPS指标提升10.8%,ImageReward最高提升32.4%

  • 生成内容在语义与细节上更贴合人类偏好

多奖励场景全面领先!清华新作高熵驱动,强化学习效率飙升精华内容

深入探究E-GRPO的核心机制,其如何通过创新的熵感知策略,重塑强化学习的优化路径,实现效率与效果的双重飞跃。

痛点与发现

主流的基于分组相对策略优化(GRPO)的流模型强化学习方法,在多步去噪过程中存在效率瓶颈。该方法对所有去噪时间步进行均匀优化,但不同步骤的探索价值差异巨大。实验发现,高熵步骤探索空间大,能生成多样性丰富的样本,是优化的核心驱动力;而低熵步骤的样本差异极小,奖励信号区分度低,如同给最终图像添加10%的随机噪声,难以引导有效优化,甚至会因累积随机性导致奖励归因模糊。

数据证实,仅优化前8个高熵步骤的模型性能,显著优于优化全部16个步骤的模型。这表明低熵步骤的“无效性”,它们不仅消耗了大量计算资源,还干扰了模型的优化方向。如何利用高熵步骤的价值,同时规避低熵步骤的干扰,成为提升效率的关键。

核心创新

为解决上述难题,E-GRPO框架提出两大核心创新。首先是熵驱动的自适应步骤合并策略。该策略设计自适应熵阈值,将连续的低熵步骤合并为单一的高熵有效步骤。这不仅将多个低价值SDE步骤转化为一个高价值SDE步骤,减少了无效计算,还通过扩大单步探索范围提升了熵值,并避免了多步采样带来的累积随机性,让奖励信号能精准归因。

其次是多步分组归一化优势估计方法。针对合并后的高熵步骤,该方法在每个样本组内直接计算组内相对优势,确保奖励信号能够一致地归因到合并步骤。这种设计为模型提供了更密集、更可靠的反馈,使其能快速锁定优化方向,提升训练的稳定性。

性能实测

在HPD数据集上,以FLUX.1-dev为骨干模型的全面评估显示,E-GRPO性能全面超越现有主流方法。在单奖励设置下,其HPS指标达到0.391,相比DanceGRPO提升10.8%,ImageScore指标达到1.324,位列第一。在能有效避免奖励作弊的多奖励设置下,E-GRPO不仅保持了HPS指标的领先,在跨域指标上也实现突破:ImageReward提升32.4%,PickScore提升4.4%,展现出更强的泛化能力。

此外,E-GRPO的训练奖励曲线呈现出更快的早期增长和更平滑的收敛趋势,同时因减少了无效步骤的计算而降低了训练成本。在可视化结果对比中,E-GRPO生成的内容也更精准地贴合文本提示,例如在“带眼睛和微笑的勺子”这一提示下,其成功保留了金属质感并生成了自然的拟人化效果,而其他方法则存在面部融合不自然或材质失真等问题。

未来展望

尽管E-GRPO成效显著,但研究也指出当前奖励模型仍存在“奖励作弊”的风险,即模型可能利用奖励函数的漏洞获取高分,而非真正满足人类偏好。因此,未来的研究重点将聚焦于设计更鲁棒的奖励模型,使其能够精准捕捉审美、语义一致性、上下文适配性等复杂的人类偏好。

E-GRPO的提出,不仅为流模型的优化提供了新范式,也为其他生成模型的强化学习训练带来了重要启发。基于熵等物理特性来引导模型的探索,或许是提升各类AI模型效率的关键路径之一。

E-GRPO不仅为流模型优化提供了高效新范式,也为整个生成式AI的强化学习训练带来了重要启发。如何将这种基于内在物理特性引导探索的思路,应用到更广泛的AI模型中,将是未来值得期待的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章