随着网页智能体(Web Agent)应用日益广泛,其安全风险备受关注。复旦大学团队推出的 WebTrap Park 平台,旨在解决现有评测方法碎片化、难复现的痛点。它通过构建统一、自动化的评测环境,以实际行为为依据,为 Web Agent 的安全能力提供了公平、可靠的度量衡,是该领域一次重要的基础设施升级。
智能速览
系统性地将安全风险划分为恶意指令、提示注入和欺骗设计三类。
构建了包含1226个可执行任务的安全评测库,均源自真实攻击模式。
评测范式从依赖内部日志转变为观测真实网页行为,提升客观性。
提供模型无关、架构无关的统一接口,无需修改 Agent 即可接入。
借助容器化技术实现全自动测试,支持分钟级快速接入与大规模并发。
精华内容
WebTrap Park 的核心价值在于其系统化的评测框架和创新的评测范式。它不再拘泥于 Agent 的内部“思考过程”,而是聚焦于其在真实网络环境中的“行动表现”,从而实现了评测的质的飞跃。
系统风险建模
平台从攻击者视角出发,系统地将 Web Agent 面临的安全威胁建模为三大类:恶意用户指令、提示注入攻击和欺骗式网页设计。每一大类下又细化为具体的攻击目标、策略和呈现形式,构成了一套完整的风险谱系。这种系统性的分类,使得评测不再是零散的、偶然的,而是全面、有针对性的覆盖了主要的安全隐患。
海量任务驱动
为了确保评测的真实性和有效性,平台整合并重构了多个已有的安全数据集。在剔除了存在缺陷的任务后,研究团队进行了细粒度的扩展,最终形成了包含1226个可在真实网页中运行的安全评测任务。这些任务广泛覆盖了社会工程学欺骗、非法行为诱导、隐形注入、暗黑模式等典型攻击场景,为 Agent 的安全能力提供了丰富且高强度的“试炼场”。
行为观测新范式
传统评测方法高度依赖 Agent 的推理链或内部日志,这不仅与具体实现强耦合,也难以复现。WebTrap Park 彻底改变了这一范式,通过在网页端进行插桩,直接捕获 Agent 的点击、输入等关键交互行为。评测的唯一评判标准是“实际发生了什么”,而非“Agent 认为自己在做什么”,这种客观的观测方法显著提升了评测结果的可信度与可复现性。
通用易用设计
为了促进学术和工业界的广泛应用,平台设计了模型无关、架构无关的统一评测接口。开发者无需修改 Agent 的代码或适配特殊的日志格式,只需按标准流程运行,即可接入评测,真正实现了跨框架、跨模型的公平比较。此外,借助 Docker 与 Kubernetes 技术,WebTrap Park 能为每个任务分配独立的容器环境,自动化完成调度、记录与评分,支持大规模、无人工干预的并发测试,实现了分钟级的快速接入。
WebTrap Park 为 Web Agent 安全领域提供了一个坚实、可扩展的评测基准。它不仅是一个工具,更是一种新范式的确立。未来,随着智能体技术的深入发展,此类平台将对推动整个行业的安全与对齐产生深远影响。如何构建更智能、更鲁棒的 Agent,或许是下一个值得思考的问题。