随着AI智能体日益自主,其调用工具过程中的安全风险成为新挑战。传统安全护栏仅能审查最终输出,无法感知中间步骤的隐患。AgentDoG框架的出现,旨在为这一难题提供可解释、可溯源的系统性诊断方案,将AI安全从内容层面提升至行为层面。
智能速览
传统AI安全护栏无法感知智能体行为轨迹中的风险。
AgentDoG提出三维风险分类法,系统性识别风险来源与危害。
该框架具备可解释的诊断能力,能精准定位风险触发的具体步骤。
配套的ATBench评测基准覆盖超10万轨迹,检验模型泛化能力。
精华内容
要解决智能体的安全问题,关键在于深入其行为轨迹。AgentDoG正是这样一套体系,它不仅发现问题,更清晰地揭示了问题是如何发生的。
风险感知的缺失
当前主流的内容安全护栏模型,如LlamaGuard等,其设计核心是针对AI的最终输出内容进行“安全”或“不安全”的二元分类。这种机制在处理单纯文本生成时或许有效,但在AI智能体场景下却存在巨大盲区。智能体的行为由多步骤构成,包括工具调用、环境观察、推理决策等,风险可能在任何一个中间环节产生并累积,即便最终结果是“干净”的。传统护栏缺乏对这一完整轨迹的“风险感知”能力,无法识别过程中的动态隐患。
可解释的三维分类
为解决诊断模糊的问题,AgentDoG构建了一套统一且可扩展的三维风险分类法。它不再是简单的“是/否”判断,而是从“风险来源”(如恶意工具、错误数据)、“失效模式”(如权限滥用、逻辑漏洞)和“现实危害”(如隐私泄露、财产损失)三个维度进行精细化标注。这种方法将一个抽象的风险事件解构为具体、可分析的组成部分,让安全评估变得结构化且富有深度。
精准溯源与诊断
基于三维分类法,AgentDoG实现了可解释的诊断功能。当检测到风险时,系统不仅能发出警报,还能清晰指出风险源于哪一步操作、哪一行代码或哪一次工具调用。这种精准溯源能力对于开发者至关重要,它极大地降低了调试和修复安全缺陷的门槛。同时,透明的诊断过程也有助于建立用户信任,并为监管审计提供了清晰的证据链。
大规模基准测试
为了验证和推动该领域发展,研究团队同步推出了大规模评测基准ATBench。该基准覆盖了超过1万个合成工具和10万条交互轨迹,场景丰富多样。更重要的是,它包含了对“未见工具”的泛化能力测试,确保AgentDoG不仅能在已知场景下工作,更能面对未来层出不穷的新工具和新应用,具备长期有效的防护潜力。