针对现有手机智能体评测基准普遍存在“刷满分”的现象,阿里发布了全新的评测体系 MobileWorld。该基准通过引入长时序、多应用和用户交互等复杂任务,显著提升了评测难度,旨在更精准地刻画下一代移动智能体的真实能力上限,暴露当前模型的短板。
智能速览
MobileWorld 包含 201 个高难度任务,平均步数是 AndroidWorld 的近两倍。
首次引入 Agent-User 交互任务,评测智能体主动提问澄清歧义的能力。
原生支持 MCP 工具调用,检验智能体在 GUI 与 API 间的协同执行能力。
评测体系完全可复现,避免了传统“LLM-as-a-judge”的随机性。
在新基准上,顶级模型与框架的成功率被显著拉开,暴露真实短板。
精华内容
MobileWorld 的突破性在于构建了一个更接近真实世界的移动评测环境,它从四个维度系统性地提升了评测的深度与广度。
真实任务升级
MobileWorld 设计了 201 个任务,覆盖 20 个应用。其平均完成步数高达 27.8 步,几乎是上一代基准 AndroidWorld 的两倍,这极大地考验了智能体的长程规划能力。
其中,超过六成(62.2%)的任务需要跨应用操作,迫使智能体必须在多个应用间维护和切换上下文状态,难度远超单一应用内的线性任务。
创新交互模式
基准的一大创新是系统性地引入了 Agent-User 交互任务。在 22.4% 的任务中,关键信息被刻意移除,评测标准不再是智能体能否“猜”对,而是它能否主动识别出指令的歧义点,并通过 `ask_user` 行为向用户发问,以澄清需求。这直接检验了智能体在人机协作中的实用性与可靠性。
融合工具调用
现代移动操作早已超越了单纯的 GUI 点击。MobileWorld 敏锐地捕捉到这一点,原生支持智能体调用外部工具。19.9% 的任务要求智能体在操作界面(GUI)之外,还需调用 MCP(Model Context Protocol)工具,如访问 GitHub API、查询地图或检索金融数据。这评测了其在 GUI 操作和 API 调用之间进行策略选择与协同执行的综合能力。
确定性评测体系
为了确保评测结果的客观公正,MobileWorld 摒弃了易产生随机性的“LLM-as-a-judge”模式。它通过 Docker 化 Android 环境、自托管应用后端、数据库直查等一系列技术手段,实现了端到端、完全确定性的评测。任何一次评测结果都可被精确复现,为模型能力的横向对比提供了坚实可靠的基础。
MobileWorld 的出现,为移动智能体的能力评估树立了新标杆,迫使业界从追求“刷分”转向攻克真实难题。面对如此严苛的考验,下一代模型将如何突破长程规划与多模态理解的瓶颈?