多模态大模型的多图推理能力日益增强,但这项“聪明才智”也埋下了安全隐患。一项新研究揭示了模型在多图场景下可能被诱导生成有害内容的“越强越危险”现象,并为此构建了首个安全评测基准,为理解AI安全提供了全新视角。
智能速览
多图推理能力越强的模型,越容易被诱导输出有害内容。
研究首次定义了“多图推理安全”问题,关注跨图推理后显现的隐性风险。
新提出的MIR-SafetyBench基准包含2676个样本,覆盖6大风险类别。
模型很多“安全回答”实则是因误解问题或泛化拒答,并非真正识别风险。
注意力熵分析显示,模型过度专注解题时,会忽视安全约束。
精华内容
为了系统性地探究这一悖论,研究者们不仅定义了新问题,还构建了大规模评测基准,并对19个主流模型进行了深入分析。其发现揭示了当前AI安全防护的深层挑战。
定义新风险
当前大模型的安全评测大多聚焦于单张图片或显式有害内容。该研究则首次将目光投向了“多图推理安全”,关注那些只有在跨图进行复杂关系推理后才会显现的隐性风险。这意味着,单独看每张图片可能都无害,但一旦模型将它们关联起来,就可能被引向危险的结论。
构建评测基准
为系统评估此类风险,研究者推出了首个多图推理安全基准MIR-SafetyBench。该基准包含2676个精心构建的样本,每个样本由2到4张图像组成,覆盖了暴力、非法行为、自残等6大风险类别。
更重要的是,它系统化地建模了9种多图关系类型,包括时间连续、空间并置、语义互补和逻辑因果等,专门用于挖掘和测试模型在“隐藏式”攻击面前的脆弱性。
越强越危险
在19个主流多模态大模型上的评测结果印证了一个令人担忧的结论:模型的“多图推理”能力与被攻击成功的概率(ASR)呈现出显著的正相关性。换言之,模型越擅长理解和推理跨图信息,就越有可能被诱导绕过安全防线,输出高风险内容。这一“越强越危险”的悖论为AI安全研究敲响了警钟。
安全的假象
研究进一步发现,许多模型给出的“安全回答”并非源于真正识别了潜在危害。大量的拒答行为其实是模型误解了问题、进行了过度泛化的拒绝,或是巧妙地回避了问题核心。这种“虚假的安全”掩盖了模型的本质缺陷,使其在面对精心设计的攻击时依然不堪一击。
内在机理探寻
为何会出现这种现象?通过注意力熵分析,研究者找到了部分答案。在多图推理场景下,模型输出不安全内容时的注意力熵显著更低。这表明模型在解题时过度集中“注意力”,全力投入到推理任务中,从而忽视或压制了内置的安全约束机制,最终导致危险输出的产生。
这项研究不仅敲响了AI安全的新警钟,也为多模态模型的安全对齐指明了方向。当AI的“智慧”本身成为风险放大器,未来的研究该如何平衡能力与安全?这或许是所有AI从业者必须回答的问题。