张大妈

UC Davis携手Google DeepMind:让AI模型学会

源自今日头条:科技行者

02-12 13:17

人工智能训练正经历一场范式转变:从关注“说什么答案”转向优化“该看哪里”。加州大学戴维斯分校与Google DeepMind的研究提出强化注意力学习(RAL),直接训练模型的注意力分配机制,使其在处理图像和视频时能聚焦关键信息,大幅提升了多模态AI的理解与推理能力,为解决传统训练方法的瓶颈提供了全新路径。

UC Davis携手Google DeepMind:让AI模型学会智能速览

  • 传统AI训练方法在多模态任务中效果不佳,甚至可能损害模型性能。

  • 强化注意力学习(RAL)创新性地将模型内部的注意力机制作为优化目标。

  • RAL在多个图像和视频理解基准测试中,均显著超越了现有方法。

  • 信息越复杂,RAL相对于传统方法的优势越明显。

  • 该研究还将注意力学习扩展至知识蒸馏领域,提升了知识传递效率。

UC Davis携手Google DeepMind:让AI模型学会精华内容

当AI面对图文并茂的复杂世界,教会它“如何观察”远比直接给出答案更重要。强化注意力学习正是这一理念的突破性实践。

传统训练的困境

传统的AI训练类似于给学生答案并进行评分。这种方法在纯文本任务中很有效,但当处理混合了图像、视频和文本的多模态任务时,其局限性就暴露无遗。模型可能知道正确答案,但不知道在视觉场景中应该关注何处。

这常常导致“奖励欺骗”,即模型利用文本线索或表面视觉特征来得出看似正确的答案,而缺乏真正的理解,有时甚至损害其基础的感知能力。

何为强化注意力

强化注意力学习将注意力机制本身——即模型的“眼睛”——转变为一个独立的优化目标。它不再仅仅奖励正确的输出,而是奖励那些产生正确答案的注意力模式。

当一个模型正确识别出物体时,RAL会强化其视觉焦点;反之,它会惩罚导致错误的注意力模式。这种“优势加权注意力散度”的方法实现了对模型在每个处理步骤中观察之处的精细调整,教给它一个寻找答案的稳健策略。

实验验证的成效

实验结果证实了RAL的有效性。在Qwen-2.5-VL-7B模型上,RAL在所有八个图像理解基准上都超越了传统的GRPO方法,在V*基准上取得了5.8个百分点的提升,在MME基准上提升了94.1分。

在视频理解方面,它在七个基准中的六个上表现出色,在NExTQA上提升了3.4个百分点。值得注意的是,RAL的优势随着视觉信息复杂度的增加而增长;在2048像素的图像上,其性能优势(6.3个百分点)远高于512像素的图像(1.6个百分点),这证明其特别擅长处理密集信息。

技术前景与应用

从技术上讲,RAL采用了像詹森-香农散度这样的数学工具来确保训练稳定性和有效的梯度传播。它的实际应用前景广阔,在医疗影像领域,它可以训练AI更精确地聚焦于潜在病灶;在自动驾驶中,它可以优先关注关键的交通安全信息。

从理论上讲,这标志着AI训练从“结果导向”到“过程导向”的根本性转变,为构建更稳健、更智能的系统开辟了新途径。

强化注意力学习不仅是一次技术升级,更是AI训练理念的根本性革新。它证明了优化模型的“思考过程”比单纯追求正确答案更为关键。随着多模态AI日益普及,这项技术或将成为构建更智能、更可靠系统的基石。我们是否正处在教会AI真正“看懂”世界的门槛上?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章