当前GUI智能体评测多依赖静态截图,难以反映真实世界表现。MobileBench-OL应运而生,它通过在真实手机设备上执行任务,引入长程操作、环境噪声等复杂场景,为评估智能体的推理与抗噪能力提供了一个更贴近实际、更具挑战性的新标准。
智能速览
MobileBench-OL是一个在真实手机设备上运行的在线评测基准。
该基准包含80个中文APP和1080个测试任务。
基准分为五个子集,全面评估基础能力、泛化能力等。
长程任务要求超过20步操作,测试智能体的长程规划能力。
抗噪能力子集引入弹窗、延迟等真实噪声,考验智能体鲁棒性。
精华内容
为了更深入地理解MobileBench-OL的独特之处,下面将从其设计的核心维度出发,剖析它如何构建一个更贴近真实世界的移动智能体评测体系。
评测痛点
传统的GUI Agent评测基准存在明显局限。它们大多基于静态截图或模拟器环境,任务指令也过于简单僵化。这种方式无法有效考察智能体在真实环境中的推理探索能力,也无法模拟弹窗、网络延迟等突发状况的干扰,导致评测结果与实际应用表现存在偏差。
基准构成
MobileBench-OL基准的规模相当可观,涵盖了80个中文APP。这些应用不仅包括微信、B站、高德地图等主流软件,也包含了众多长尾应用,旨在全面测试智能体的泛化能力。
基于这些应用,基准设计了总数高达1080个测试任务,为智能体提供了丰富多样的挑战场景,确保评测的广度与深度。
五大维度
基准被精心划分为五个子集,从不同维度对智能体进行考察。
基础能力子集聚焦主流APP的核心功能,评估基本操作水平。
长尾应用子集则检验智能体在面对不常用软件时的适应与泛化能力。
长程任务子集要求步骤超过20步,例如跨应用操作,深度考验其长程规划与记忆能力。
GUI推理子集通过隐藏功能、深层菜单等设计,重点评估探索与逻辑推理能力。
抗噪能力子最具挑战性,它会随机引入重复执行、操作无响应、页面延迟和弹窗广告四种噪声,检验智能体的鲁棒性与稳定性。
MobileBench-OL的出现,无疑为移动端GUI智能体的研发与评估树立了新的标杆。它推动行业从理想化的测试环境转向复杂的真实世界,这对于催生更强大、更可靠的智能体至关重要。未来,这套基准能否成为行业标准,值得期待。