张大妈

移动端gui 新benchmark:MobileBench-OL

源自小红薯:林子于

02-25 14:40

当前GUI智能体评测多依赖静态截图,难以反映真实世界表现。MobileBench-OL应运而生,它通过在真实手机设备上执行任务,引入长程操作、环境噪声等复杂场景,为评估智能体的推理与抗噪能力提供了一个更贴近实际、更具挑战性的新标准。

移动端gui 新benchmark:MobileBench-OL智能速览

  • MobileBench-OL是一个在真实手机设备上运行的在线评测基准。

  • 该基准包含80个中文APP和1080个测试任务。

  • 基准分为五个子集,全面评估基础能力、泛化能力等。

  • 长程任务要求超过20步操作,测试智能体的长程规划能力。

  • 抗噪能力子集引入弹窗、延迟等真实噪声,考验智能体鲁棒性。

移动端gui 新benchmark:MobileBench-OL精华内容

为了更深入地理解MobileBench-OL的独特之处,下面将从其设计的核心维度出发,剖析它如何构建一个更贴近真实世界的移动智能体评测体系。

评测痛点

传统的GUI Agent评测基准存在明显局限。它们大多基于静态截图或模拟器环境,任务指令也过于简单僵化。这种方式无法有效考察智能体在真实环境中的推理探索能力,也无法模拟弹窗、网络延迟等突发状况的干扰,导致评测结果与实际应用表现存在偏差。

基准构成

MobileBench-OL基准的规模相当可观,涵盖了80个中文APP。这些应用不仅包括微信、B站、高德地图等主流软件,也包含了众多长尾应用,旨在全面测试智能体的泛化能力。

基于这些应用,基准设计了总数高达1080个测试任务,为智能体提供了丰富多样的挑战场景,确保评测的广度与深度。

五大维度

基准被精心划分为五个子集,从不同维度对智能体进行考察。

基础能力子集聚焦主流APP的核心功能,评估基本操作水平。

长尾应用子集则检验智能体在面对不常用软件时的适应与泛化能力。

长程任务子集要求步骤超过20步,例如跨应用操作,深度考验其长程规划与记忆能力。

GUI推理子集通过隐藏功能、深层菜单等设计,重点评估探索与逻辑推理能力。

抗噪能力子最具挑战性,它会随机引入重复执行、操作无响应、页面延迟和弹窗广告四种噪声,检验智能体的鲁棒性与稳定性。

MobileBench-OL的出现,无疑为移动端GUI智能体的研发与评估树立了新的标杆。它推动行业从理想化的测试环境转向复杂的真实世界,这对于催生更强大、更可靠的智能体至关重要。未来,这套基准能否成为行业标准,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章