张大妈

降低mlm幻觉的成本-效率-困难感知偏好优化

源自小红薯:刘东瑞 上海 AI Lab

02-06 21:20

多模态大语言模型在处理复杂任务时常常产生“幻觉”,即输出不符合事实的内容。传统方法在抑制幻觉时往往会影响模型的通用能力。DA-DPO框架的出现,为这一难题提供了全新解法,它通过一种巧妙的动态加权机制,在不牺牲通用性的前提下,高效、低成本地降低了模型幻觉,为构建更可靠的AI系统铺平了道路。

降低mlm幻觉的成本-效率-困难感知偏好优化智能速览

  • 多模态DPO存在“易-难失衡”,导致模型过度拟合简单样本。

  • DA-DPO框架利用预训练模型动态估计偏好难度并加权损失。

  • 该方法无需额外训练数据或新增参数,效率极高。

  • 实验证明,该框架能将幻觉率降低10%至25%。

  • 相比训练传统奖励模型,DA-DPO提速高达300倍。

  • 该框架对不同模型架构和数据集表现出强大的鲁棒性。

降低mlm幻觉的成本-效率-困难感知偏好优化精华内容

DA-DPO框架究竟如何实现这一突破?其核心在于一个巧妙的动态加权机制,让模型学会“抓大放小”,专注于攻克难题。

问题根源

当前主流的多模态直接偏好优化方法存在一个根本缺陷:偏好对构建中的“易-难失衡”。具体来说,用于训练的偏好数据集中,包含了大量简单易于判断的样本和少量难以区分的样本。模型在训练过程中会过度拟合这些简单样本,因为它们更容易获得优化奖励,而真正能抑制幻觉的困难样本却被忽视。这导致模型虽然学会了一些简单规则,但在复杂场景下的幻觉抑制能力不足,甚至可能损害其原有的通用能力。

动态加权

为解决此问题,DA-DPO框架提出了一种无需监督的创新思路。它巧妙地利用预训练的CLIP模型和多模态大语言模型本身,来无监督地估计每一个偏好对的“难度”。这个难度评估结果随后被用于动态调整损失函数中的权重。

对于那些模型难以判断的困难偏好对,其损失权重会被放大,使得优化过程更关注它们;而对于那些易于判断的简单偏好对,其损失权重则被压缩。通过这种方式,模型被迫集中“精力”学习如何处理那些棘手案例,从而有效提升了对幻觉的抑制能力。

高效验证

研究团队在LLaVA-7B/13B、LLaVA-OneVision及Qwen2.5-VL-3B等多个主流视觉语言模型上对DA-DPO进行了全面验证。测试范围覆盖了9个权威基准,其中4个专门评估幻觉,5个评估通用能力。

结果令人振奋:在所有模型和基准上,DA-DPO均实现了一致性的幻觉降低,降幅达到10%至25%。同时,模型的通用能力不仅没有下降,部分基准上甚至略有提升。更关键的是,由于省去了训练传统奖励模型的繁琐过程,其训练效率相比传统方法提升了惊人的300倍。

鲁棒性优势

一个优秀的算法框架不仅要效果好,更要具备广泛的适用性。通过详尽的消融实验,DA-DPO证明了其出色的鲁棒性。无论面对的是不同架构的VLM模型,还是来源各异的数据集,框架都能稳定地发挥作用,其性能对超参数的选择也不敏感。

这意味着DA-DPO并非一个只能应用于特定场景的“特制”工具,而是一个通用性强、易于部署的解决方案,为未来多模态模型的训练和优化提供了坚实且可靠的技术支撑。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章