张大妈

从LLM到MLLM再到Agent,万字长文览尽大模型安全进化之路!(中科院最新综述)

源自知乎:大模型没那么大

01-16 13:20

人工智能从处理单一文本的LLM,发展到融合多模态信息的MLLM,再到具备自主决策能力的Agent,其能力边界不断拓宽,但安全风险也随之呈指数级增长。这篇综述系统梳理了这条演进链路中的越狱攻击与防御技术,为理解复杂的大模型安全生态提供了清晰框架与前瞻视角。

从LLM到MLLM再到Agent,万字长文览尽大模型安全进化之路!(中科院最新综述)智能速览

  • 大模型安全风险从文本扩展到多模态,再到智能体决策层面。

  • 越狱攻击可按“攻击影响”和“攻击者权限”两大维度进行系统分类。

  • 现有数据集与评估方法存在语言、模态和动态性不足的瓶颈。

  • 防御策略需覆盖输入、输出及全流程,多技术融合是应对复杂攻击的主流。

  • 未来研究需聚焦动态数据集、统一评估框架并深化智能体的攻防技术。

从LLM到MLLM再到Agent,万字长文览尽大模型安全进化之路!(中科院最新综述)精华内容

从文本到多模态再到自主智能体,大模型能力边界不断拓宽,其安全攻击面也随之指数级增长。理解其安全演进,是构建可靠AI生态的第一步。

风险演进

大语言模型(LLMs)的安全风险主要集中于文本层面,攻击者通过伪装或重构提示词诱导模型生成有害内容。

当模型演进至多模态大语言模型(MLLMs)时,攻击面显著扩大。攻击者可利用对抗性图像、情感化语音等非文本输入,绕过文本安全过滤,其隐蔽性更强。

而智能体(Agents)带来的挑战最为严峻,攻击目标从诱导有害文本生成转向篡改其自主决策行为,例如污染其记忆系统或劫持工具调用,甚至引发多智能体间的连锁风险。

攻击分类

为系统化理解攻击技术,综述提出了“攻击影响”和“攻击者权限”两大分类维度。

“攻击影响”从攻击阶段(训练中或推理中)和干预层级(输入层、模型层或输出层)进行划分,覆盖了攻击发生的全过程。

“攻击者权限”则依据对模型内部信息的访问程度,分为白盒攻击(已知模型参数)和黑盒攻击(仅知输入输出),并按目标模型(LLMs、MLLMs、Agents)细分,为研究者提供了清晰的分析框架。

评估挑战

高质量的数据集与科学的评估指标是衡量安全能力的基础,但目前存在明显局限。

现有数据集多模态样本少、语言文化覆盖不全,且缺乏动态更新机制,难以跟上快速迭代的攻击技术。

评估方法上,人工评估成本高,自动化工具(如Perspective API)跨语言适应性差,LLM评估存在拒评风险,而关键词匹配则过于粗糙。不同研究采用的自定义评估标准不一,导致结果难以横向比较。

防御体系

防御策略可从响应时机和技术手段两个维度构建。响应时机分为输入防御(过滤恶意prompt)、输出防御(审查有害响应)和联合防御(全流程防护)。

技术手段上,规则/启发式防御快速但脆弱;ML/DL防御依赖数据,泛化能力有限;对抗检测无需攻击样本,但对低扰动攻击不敏感;目前主流是融合多种技术的混合策略。

当前防御面临多模态能力不足、智能体防御滞后以及安全与能力难以平衡的三大挑战。

未来方向

面向未来的研究需突破现有瓶颈。数据集应建立动态更新机制,拓展视频、生物信号等模态,并增强语言文化多样性。

评估体系需要制定统一的指标定义,构建通用评估平台,并引入真实场景测试,提升评估的实用性与可比性。

攻防技术上,需提升攻击的跨模型、跨模态泛化能力,并深耕智能体攻击路径。防御则要向主动预测、多模态融合和智能体体系化防护演进,同时兼顾伦理规范与监管。

该综述不仅梳理了技术脉络,更揭示了安全与能力同步演进的规律。面对日益复杂的智能体生态,构建主动、协同的全链路防御体系,将是确保AI技术向善发展的关键挑战与机遇,需要学术界、工业界和政策制定者共同努力。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章