张大妈

港大:统一将世界模型、动作生成与力预测

源自小红薯:每日ComputerScience

03-02 14:32

面对真实环境的动态挑战,传统机器人操作策略常显脆弱。一种名为AdaWorldPolicy的新框架应运而生,它创新性地将世界模型、动作生成与力预测融为一体,并通过在线自适应机制,让机器人在部署后仍能持续学习与修正,显著提升了在复杂多变场景下的操作鲁棒性与稳定性。

港大:统一将世界模型、动作生成与力预测智能速览

  • 将世界模型、动作生成与力预测统一到单一扩散架构中。

  • 世界模型通过预测误差反向驱动策略更新,实现主动监督。

  • 通过“行动—预测—对比”的双模式运行,形成在线纠错回路。

  • 利用LoRA技术,仅调整少于0.1%的参数即可实现低开销实时适配。

  • 引入力矩预测器,有效增强了机器人接触操作的稳定性。

港大:统一将世界模型、动作生成与力预测精华内容

该框架的突破性在于其巧妙的结构设计与运行机制,它不仅实现了多模块的深度融合,还赋予了机器人在部署阶段持续进化的能力。其核心构造与工作原理如下:

统一扩散架构

该框架将一个拥有20亿参数的世界模型(Cosmos-Predict2)、一个4亿参数的动作模型和一个4亿参数的力预测器,整合进一个统一的多模态自注意力网络。这种设计既保持了各模块的独立功能性,又通过深度交互实现了信息的高效流转,为后续的协同工作奠定了基础。

主动监督与双模式

与传统方法不同,此处的世界模型不再是被动评估器,而是通过预测未来状态的误差来反向驱动策略更新,实现主动监督。其双模式运行机制是关键:模式I负责生成当前动作,模式II则“想象”未来状态,通过“行动—预测—对比”的闭环,机器人能够实时发现并纠正错误。

低开销在线自适应

为实现部署后的持续学习,框架引入了AdaOL在线自适应机制。该机制利用世界模型的预测误差作为自监督信号,指导策略优化。更关键的是,它结合LoRA低秩更新技术,在适配新环境时仅需调整不到0.1%的模型参数,实现了低计算开销下的实时环境适应能力。

力反馈增强稳定性

针对真实物理世界中力反馈的复杂性,该框架特别引入了力矩预测器。该模块能够预测操作过程中的力偏移,使机器人能提前调整接触力度,有效缓解了因物体材质、位置变化等导致的动态力干扰问题,从而显著提升了接触操作的稳定性与成功率。

AdaWorldPolicy通过统一世界模型、动作与力预测,并赋予其在线自适应能力,为解决机器人操作的真实世界难题提供了全新思路。它标志着从离线模仿到在线进化的关键一步,未来这种架构能否催生出更多能在复杂环境中长期稳定工作的智能机器人

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐