机器人训练常面临数据匮乏和Sim-to-Real鸿沟。清华等团队提出的VR-Robo框架另辟蹊径,仅需少量真实RGB视频,便能重建出高保真、可交互的数字孪生环境。该框架在仿真中训练的机器人策略,能够零样本、免微调地成功迁移至现实世界,为机器人智能的快速进化提供了新思路。
智能速览
VR-Robo是一个Real-to-Sim-to-Real闭环框架,解决机器人数据稀缺问题。
仅凭RGB图像即可重建高真实感、可物理交互的数字孪生环境。
训练出的视觉导航策略可实现零样本、免微调的真实世界部署。
方法在多种干扰(光照、背景、人为)下展现出强鲁棒性。
精华内容
该框架的精妙之处在于构建了一条从现实到仿真、再回归现实的数据与策略闭环,它如何仅用RGB就能实现这一切?
重建数字孪生
VR-Robo首先利用真实拍摄的RGB图像序列,结合基础模型提供的先验知识,通过运动恢复结构技术重建出几何一致的三维场景。随后,它创新性地采用高斯-网格混合表征,将高斯 splats 的逼真渲染效果与网格的物理交互特性相结合,在Isaac Sim物理引擎中构建出一个既真实又可交互的数字孪生环境。这一过程为机器人提供了一个与真实世界高度一致的训练场。
仿真内策略训练
在这个高保真环境中,机器人智能体以第一视角的高斯逼真渲染图像作为视觉观测输入,无需任何深度或激光雷达数据。研究团队采用深度强化学习算法,让智能体在重建的复杂场景中进行自主学习,以完成抵达指定目标点等视觉导航与移动任务。训练过程完全在仿真中进行,高效且安全,能够生成海量交互数据。
零样本真实部署
最关键的一步是Sim-to-Real迁移。研究团队将仿真中训练好的策略直接部署到真实机器人上,实现了零样本、免微调的部署。在红色锥体抵达任务中,视频连续展示了9次成功案例,证明了方法的可靠性。该方法还在不同目标颜色(红、绿锥体)、弱光条件、人为干扰和背景更换等多种变化条件下保持了稳定性能,展现了强大的泛化能力与鲁棒性。
VR-Robo框架的价值在于,它用低成本的单目RGB数据,巧妙地绕过了机器人训练中的数据墙和Sim-to-Real鸿沟。这种“用少量真实数据重建,在无限仿真中进化”的思路,或将为具身智能的快速发展注入新的动力。未来的机器人训练会因此变得更加高效和普及吗?