现有的手机智能体评测基准已难以衡量模型的真实能力。为此,通义实验室推出了MobileWorld,一个专为真实用户需求设计的评测基准。它通过更长任务链、跨App协同等设定,旨在更严苛地检验智能体水平,推动技术发展。
智能速览
MobileWorld是通义实验室发布的手机智能体评测基准。
其任务链平均长度是AndroidWorld的近两倍。
超过六成的任务需要智能体跨多个App协同完成。
基准支持对模糊指令进行澄清,考验模型的主动交互能力。
当前最优模型在该基准上的成功率仅为51.7%。
精华内容
MobileWorld究竟是如何构建一个更真实的测试环境的?它又揭示了当前主流模型的哪些短板?下面的细节将一一解答。
任务复杂度升级
MobileWorld显著提升了任务复杂度,以贴近真实使用场景。其任务链平均长度达到27.8步,远超AndroidWorld的14.3步,这要求智能体具备更强的多步推理和执行能力。
同时,62.2%的任务需要跨越多个App协同完成,而AndroidWorld的这一比例仅为9.5%。这一设计直接挑战了智能体在应用间信息流转和任务切换的连贯性能力。
交互与混合操作
评测基准新增了对模糊指令的澄清能力测试,要求智能体在面对不确定信息时能主动发问,但目前主流模型在此项的准确率不足10%,暴露了其在主动交互上的普遍短板。
此外,MobileWorld还引入了工具调用与界面操作的混合任务,例如一边查资料一边下单购物。这种组合式任务对现有模型的综合能力提出了更高要求,目前端到端方案的准确率趋近于0%。
模型表现揭示差距
在如此严苛的评测标准下,当前最优的模型在MobileWorld上的端到端任务成功率也仅为51.7%,这表明手机智能体距离在复杂场景中可靠使用仍有较大差距。
而端到端方案的表现则更为惨淡,成功率最高仅20.9%。这一数据直观地展示了现有技术在处理综合性、长链条真实任务时的局限性,也为后续的技术攻关指明了方向。
MobileWorld的推出,为手机端智能体的评估设立了一个新的、更贴近真实世界的标杆。它的开源属性将吸引全球开发者共同参与测试和改进,加速技术迭代。未来,随着模型能力的提升,手机智能体将能承担更复杂的任务,这会为用户带来怎样的体验变革?