张大妈

微软推出「Computer-Using世界模型」

源自小红薯:大模型知识分享

02-27 10:35

当AI代理在复杂软件中操作时,一次失误就可能导致任务彻底失败。微软提出的“Computer-Using 世界模型”通过让AI在执行前模拟和预测动作结果,有效解决了这一难题,显著提升了其在桌面环境中的决策鲁棒性与任务成功率。

微软推出「Computer-Using世界模型」智能速览

  • 真实软件环境不支持试错,AI决策风险高。

  • CUWM是一种能预测下一UI状态的桌面世界模型。

  • 采用文本预测与可视化合成的两阶段分解方法。

  • 基于与Office应用的离线交互数据训练,并通过强化学习优化。

  • 在Office任务中,显著提升了决策质量与执行鲁棒性。

微软推出「Computer-Using世界模型」精华内容

CUWM的核心在于赋予AI一种“预见”能力,其实现机制巧妙地将抽象推理与具体视觉呈现相结合,确保决策的可靠性。

决策困境

在复杂的桌面软件环境中,AI代理面临的挑战远超简单任务。由于真实执行环境不允许进行反事实的探索,任何一次错误的用户界面(UI)操作,例如误删文件或关闭关键窗口,都可能造成不可逆的后果,使需要长时间运行并保留工作成果的任务流彻底中断。这种高风险特性使得依赖大规模试错的传统学习与规划方法在“Computer-Using”场景下几乎无法实施,AI因此陷入了“不敢犯错”的决策困境。

两阶段预测

微软提出的CUWM通过一种创新的两阶段分解来预测UI动态。首先,模型会预测由Agent的候选动作所引发的、与任务相关的状态变化,并以自然语言生成文本描述。紧接着,模型会将这些文本化的变化信息转化为视觉元素,合成出执行该动作后可能出现的下一帧UI截图。这种方法将抽象的推理过程具象化,为AI提供了直观的决策参考。

数据驱动优化

CUWM的训练数据来源于Agent与真实Microsoft Office应用交互时采集的离线UI转换数据集,确保了模型学习的真实性与有效性。在此基础上,研究团队还引入了轻量级的强化学习阶段对模型进行进一步微调。这一步的关键作用是让模型的文本转换预测能力与“Computer-Using”环境的内在结构要求(如UI元素的层级关系、功能逻辑等)实现对齐,从而提升了预测的精准度。

测试时提升

评估CUWM效能的方式被称为“测试时动作搜索”。在此机制下,Agent的模型参数被冻结,它在执行任何真实操作前,会先利用CUWM对多个候选动作进行模拟推演,并比较其预测结果,从中选择最优解。在一系列针对Microsoft Office的自动化任务测试中,由CUWM引导的这种测试时计算扩展策略,被证明能显著提升AI的决策质量与任务执行的鲁棒性,有效避免了灾难性操作的发生。

CUWM为AI在复杂软件环境中的自主操作提供了新的解决思路,它通过构建世界模型让AI学会“三思而后行”,显著降低了操作风险。这项技术不仅提升了现有AI Agent的实用性,也为未来实现更智能、更可靠的桌面自动化助手奠定了基础。未来,我们与软件的交互方式是否会因此被彻底改变?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章