张大妈

复旦发布 Web Agent 安全统一考场

源自小红薯:每日ComputerScience

01-18 18:07

Web Agent 在订票、下单等高风险操作中的安全问题日益突出,但现有评测方法碎片化且难以复现。复旦大学推出的 WebTrap Park 平台,通过观测真实网页行为,构建了首个统一、可扩展的安全评测基础设施,为该领域带来了系统性的解决方案。

复旦发布 Web Agent 安全统一考场智能速览

  • 系统划分恶意指令、提示注入、欺骗网页三大风险源。

  • 包含1226个源自真实攻击模式的可执行评测任务。

  • 评测范式从依赖内部日志转向观测真实行为。

  • 提供模型无关、架构无关的统一评测接口。

  • 通过容器化技术实现分钟级接入的全自动测试。

复旦发布 Web Agent 安全统一考场精华内容

面对 Web Agent 安全评测的碎片化难题,一个统一的、可扩展的基础设施显得尤为关键。WebTrap Park 的出现,正是为了填补这一空白,它从攻击视角系统建模,实现了评测范式的革新。

风险建模

平台首次将 Web Agent 面临的安全威胁系统划分为三类:恶意用户指令、提示注入攻击和欺骗式网页设计。这种分类并非简单罗列,而是深入到攻击目标、策略和呈现形式等多个维度,形成了一个完整的风险谱系。

通过这种系统化的建模,WebTrap Park 确保了评测的全面性,能够覆盖从社工欺骗到非法行为诱导等几乎所有已知的攻击路径。

海量任务

为使评测贴近真实世界,平台整合并重构了多个已有数据集,在剔除缺陷任务后进行了细粒度扩展,最终形成了 1226 个可在真实网页中运行的评测任务。

这些任务直接来源于真实的攻击模式,覆盖了社工欺骗、非法行为诱导、隐形注入、暗黑模式等典型场景,为衡量 Agent 在复杂环境下的安全性提供了可靠的数据基础。

行为观测

传统评测方法高度依赖 Agent 的推理链或内部日志,这不仅难以复现,也给了 Agent “伪装”的空间。WebTrap Park 彻底改变了这一范式。

通过在网页端进行插桩,平台直接捕获 Agent 的点击、输入等关键操作,以“实际发生了什么”为唯一评判标准。这种从“看日志”到“看行为”的转变,显著提升了评测结果的客观性与可复现性。

统一接口

为了实现不同 Agent 之间的公平比较,WebTrap Park 提供了一个模型无关、架构无关的统一评测接口。开发者无需修改 Agent 的核心代码或适配特殊的日志格式。

任何 Web Agent 只需按照标准流程在平台环境中运行,即可自动接入评测。这大大降低了使用门槛,使得跨框架、跨模型的横向比较成为可能。

自动化测试

效率是评测平台能否大规模应用的关键。WebTrap Park 借助 Docker 和 Kubernetes 技术,为每一个评测任务分配独立的容器环境。

整个测试过程,包括任务调度、行为记录与评分计算,均实现全自动化,支持大规模并发,且无需人工干预。开发者可以实现分钟级快速接入,极大地提升了安全测试的效率和规模。

复旦大学的 WebTrap Park 平台为 Web Agent 安全领域树立了新的标杆,其系统性、真实性和自动化特性,将有力推动该领域的健康发展。未来,随着攻击者模型的不断演进,这样的评测平台又将如何持续保持其有效性?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章