一个名为Phone Agent的AI智能体,展示了如何像真人一样操控手机。它不依赖App接口,而是通过视觉与语音指令,完成跨应用复杂任务,为AI Agent的实际应用方向带来了新思路。
智能速览
Phone Agent是一款能像真人一样操控手机的AI智能体。
它通过视觉识别屏幕并结合语音指令来执行操作。
该智能体无需依赖App的专用接口即可运行。
演示中它成功完成发朋友圈、刷抖音点赞等跨应用任务。
其混合驱动能力结合了文字识别与视觉模型分析。
精华内容
这个AI智能体最值得关注的是它模仿人类操作的实现路径和技术细节。
核心工作原理
Phone Agent的核心运作模式是模拟真人操作。它不调用任何App的特定API接口,而是通过视觉模型“看”手机屏幕,再通过物理方式“点”击屏幕来执行命令。
整个流程始于语音识别,智能体理解用户的语音指令后,会自主规划操作步骤,然后将指令下发给手机执行。这种设计使其具备了通用性,理论上可以操作手机上的任何应用。
跨应用任务实测
在演示中,Phone Agent接到了一个复杂的跨应用指令:打开微信发布一条纯文字朋友圈,然后切换到抖音给视频点赞,最后打开小红书。
智能体首先打开微信,并通过长按相机图标这一“冷知识”操作,成功发布了“快过年了大家的年货都备齐了吗”的朋友圈。随后,它无缝切换到抖音应用,自动滑动并给第二个视频执行了双击点赞。最后一步,它顺利打开了小红书,整个流程一气呵成,全程无人干预。
混合驱动能力
该智能体最大的技术亮点在于其混合驱动能力。对于界面上有明确文字标签的按钮,它可以快速识别并精准点击。
面对没有文字说明的图标,例如朋友圈发布界面的相机图标,它会调用视觉大模型(VLM)进行视觉分析,理解图标的含义并计算出其屏幕坐标,然后完成点击操作。这种结合了传统文字识别和高级视觉理解的能力,是其实现复杂操作的关键。
Phone Agent的演示展示了AI Agent在端侧设备操控上的巨大潜力,摆脱了API依赖,更具通用性。这项技术未来能解锁哪些全新的自动化应用场景?