传统的视觉生成奖励模型常因评估标准僵化而无法精确评判内容。复旦团队提出的 UnifiedReward-Flex 模型,通过动态构建评估标准,实现了对生成内容的个性化评判。这一创新显著提升了模型在复杂指令遵循和视觉质量上的表现,为高质量视觉生成提供了新的技术路径。
智能速览
UnifiedReward-Flex解决了传统奖励模型“一刀切”的评估僵化问题。
模型通过动态层级推理架构,实现个性化的内容评估标准。
两阶段训练流程结合了推理蒸馏与偏好优化,增强模型判别力。
集成到GRPO框架后,有效缓解了强化学习中的奖励黑客行为。
在多个关键基准测试中,模型评分实现了显著提升。
精华内容
UnifiedReward-Flex的核心突破在于其灵活的评估机制,它不再拘泥于固定的评分维度,而是像一位经验丰富的评委,根据具体作品“因材施教”。
动态评估架构
该模型突破了传统奖励模型固定评分维度的限制。其工作流程是首先解释用户输入的提示词意图,并从中提取关键的视觉证据。随后,模型会在预设的锚点维度下,根据具体内容动态实例化出更细粒度的子标准。甚至在必要时,它能引入全新的高阶评估维度,真正做到为每个生成内容量身定制评估方案。
两阶段训练法
为了实现这种灵活的推理能力,模型采用了两阶段训练流水线。第一阶段通过SFT(监督微调)从先进的闭源多模态大模型(如GPT-5.2)中蒸馏结构化的推理链路,让模型学会如何灵活组合评估准则。第二阶段则采用推理感知偏好DPO(直接偏好优化),不仅对最终决策进行对齐,更对推理轨迹的质量进行排序,优先选择逻辑严密的评估路径,从而显著增强了模型的判别力。
集成GRPO框架
为了将这套精细的评估体系应用于生成模型的优化,UnifiedReward-Flex被集成到GRPO(组相对策略优化)强化学习框架中。它通过结合预设锚点维度的平均胜率和全局综合胜率,为生成模型提供更稳健、更细致的奖励信号。这种多维度的反馈机制有效缓解了强化学习过程中常见的“奖励黑客”行为,即模型找到评估漏洞刷分而非真正提升质量的问题。
跨模态设计
该模型在设计上兼顾了静态图像和动态视频的特性。在处理视频生成任务时,模型能够自动增强对动作动力学、物理真实性及跨帧一致性等动态特征的评估比重。实验数据证明了其有效性,在MMRB2榜单上提升了3.2分,在GenAI-Bench-Video上提升了2.2分,大幅提升了视频生成的动态表现力。
UnifiedReward-Flex通过其自适应和精细化的评估机制,为视觉生成模型的质量控制树立了新标杆。它不仅提升了生成内容的语义一致性,更增强了模型对复杂指令的执行力。这项技术预示着未来AI生成内容将更加贴近人类真实、多元的审美与需求,我们离真正的个性化创作还有多远?