随着多模态大语言模型日益普及,其安全性,尤其是在多轮对话中依赖视觉场景与上下文演进的风险,成为关键挑战。现有的单轮评测基准难以捕捉恶意意图的逐步演化。为此,研究团队推出了多轮多模态上下文安全评测基准 MTMCS-Bench,旨在更真实、全面地评估模型在复杂交互中的安全表现。
智能速览
现有评测基准多为单轮形式,难以捕捉风险演化。
新基准 MTMCS-Bench 专为多轮多模态上下文安全设计。
该基准包含3万余条样本,评估意图识别、安全意识和有用性。
评测发现模型安全性与实用性之间存在持续权衡。
现有安全防护机制仍无法完全解决多轮对话的安全风险。
精华内容
MTMCS-Bench 的设计理念与评测维度,直接回应了多轮多模态交互中的核心安全痛点。
现有评测的局限
当前主流的上下文安全评测基准大多是单轮对话形式,这种设计存在明显短板。它难以模拟恶意意图在多轮交互中如何逐步演化并暴露,也无法反映同一张图片在不同对话语境下可能从良性用途转变为不良用途的现实情况。这导致模型可能通过单次测试,却在连续的真实对话中翻车。
新基准的设计
为应对上述挑战,MTMCS-Bench 应运而生。该基准基于真实图像与多轮对话构建,围绕“升级式风险”和“语境切换”两种核心场景进行评测。它包含了超过3万条多模态与单模态样本,并设计了专门的评测指标,用于衡量模型对上下文意图的识别能力、在不安全场景下的安全意识表现,以及在良性场景下的有用性。
安全与实用的权衡
在对8个开源与7个闭源商用MLLM的实测中,一个普遍现象浮出水面:上下文安全性与实用性之间存在持续的权衡关系。模型要么容易忽视逐步升级的风险,表现出过于“天真”;要么倾向于对良性的对话进行过度拒答,牺牲了用户体验和实用性,变得过于“敏感”。
防护机制的不足
研究进一步评估了5种现有的安全防护机制,结果并不乐观。这些机制虽然在一定程度上能够缓解部分安全问题,但它们依然无法完全根除多轮对话中动态变化的上下文安全风险。这表明,在构建更稳健、更智能的安全防护体系方面,业界仍有很长的路要走。
MTMCS-Bench 的推出,为多模态大模型的安全研究提供了更精准的“标尺”。它揭示了安全与实用之间的固有矛盾,也指明了现有防护技术的边界。未来,如何打破这种权衡,构建既安全又智能的模型,将是业界持续探索的方向。