张大妈

推理多模态大模型随笔记记-二

源自知乎:vasgaowei

03-04 18:57

多模态大模型在复杂推理任务上仍面临泛化性不足的挑战。近期一系列研究通过引入强化学习(RL),显著提升了模型的视觉与视频理解深度。本文系统梳理了六项关键工作,从奖励机制设计到训练策略优化,揭示了强化学习如何推动多模态推理能力迈向新高度。

推理多模态大模型随笔记记-二智能速览

  • 强化学习训练易导致模型学习捷径,影响泛化能力。

  • Visionary-R1通过“先描述后推理”的机制缓解捷径问题。

  • Video-R1引入时序奖励,专门解决视频推理的时序建模难题。

  • LMM-R1采用两阶段训练,先增强文本推理再泛化至多模态。

  • 奖励函数的设计是决定RL效果的关键,涵盖准确率、格式、时序等多个维度。

推理多模态大模型随笔记记-二精华内容

为突破多模态大模型在复杂推理任务中的瓶颈,研究者们正探索以强化学习为核心的新训练范式,致力于提升模型的深度思考与泛化能力。

挑战与应对

研究发现,直接对多模态大模型(MLLM)进行强化学习(RL)训练,模型倾向于在简单样本上学习“捷径”,生成简短且信息量低的推理链,导致在困难样本上泛化性能显著下降。

Visionary-R1工作针对此问题提出了解决方案。该方法要求模型在正式推理和回答前,先对输入图片进行描述。这种“先描述,后推理,再回答”的三步走策略,强制模型先深入理解视觉内容,再进行逻辑推导,从而有效规避了捷径学习。

实验显示,该策略显著提升了模型在困难样本上的表现。其奖励函数由准确率奖励、格式奖励和新增的描述奖励三部分组成,确保模型输出的每一步都受到监督与激励。

视频时序建模

将强化学习应用于视频多模态模型时,存在两大挑战:时序信息建模的缺失和高质量视频推理数据的匮乏。Video-R1工作针对性地提出了创新方案。

在数据层面,研究者构建了包含图像和视频的冷启动数据集Video-R1-CoT-165k,用于模型的监督微调(SFT),并构建了Video-R1-260k用于后续的RL训练。

在算法层面,Video-R1对GRPO算法进行了改进,引入了时序奖励。通过向模型输入原始视频和随机打乱帧顺序的视频,比较两者输出的正确率来计算奖励。只有当模型对原始视频的回答正确时,时序奖励才会生效,以此激励模型在推理时有效利用帧间的时序关系。

训练策略创新

不同于直接在多模态数据上进行RL训练,LMM-R1提出了一种两阶段的训练策略,旨在系统性提升模型的推理能力。

第一阶段是基础推理增强(FRE),该阶段仅使用纯文本的数学问题等可验证数据,通过基于规则的近端策略优化(PPO)算法,强化模型的基础逻辑推理能力,为后续多模态学习打下坚实基础。

第二阶段是多模态泛化训练(MGT),将第一阶段学到的推理能力迁移到视觉-语言任务中。该阶段使用有限的复杂多模态数据,涵盖几何问题、科学问答、图表理解乃至智能体任务,继续用基于规则的PPO进行训练,实现推理能力在多模态领域的有效泛化。

奖励机制设计

奖励函数的设计是强化学习成功的关键,不同工作根据具体任务设计了多样化的奖励机制。

例如,Visual-RFT在目标检测任务上设计了包含交并比(IoU)、置信度和格式合规性的复合奖励函数,引导模型生成更精准的检测框。在分类任务上,则简化为准确率和格式奖励。

InternLM-XComposer2.5-Reward则另辟蹊径,没有采用GRPO,而是探索了基于PPO的RLHF范式,先训练一个专门的奖励模型IXC-2.5-Reward,再用其指导策略模型的训练。这展示了不同的技术路线在提升多模态模型性能上的可行性。

强化学习为多模态大模型的推理能力注入了新的活力,从设计精巧的奖励函数到创新的训练范式,这些探索正推动模型从“看懂”向“会思考”迈进。未来,如何更高效地利用RL、构建更高质量的推理数据,仍是值得持续探索的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章