人形机器人在真实世界持续学习面临安全与数据效率两大瓶颈。LIFT框架提出新范式,通过大规模预训练与物理信息增强的世界模型,将高风险探索转移至虚拟环境,从而在保障安全的前提下,实现用极少真机交互即可高效微调机器人策略,为构建可持续学习的机器人系统提供了现实路径。
智能速览
传统机器人策略部署后难以在真实世界持续学习。
LIFT框架结合了大规模预训练与高效真机微调。
利用世界模型进行安全探索,避免真机损坏风险。
实测仅需数百秒真实数据即可显著提升机器人性能。
研究发现SAC算法在数据受限时比PPO更具样本效率。
精华内容
如何让机器人在真实世界中安全地学习,而非“一锤子买卖”?LIFT框架给出了具体方案。
当前困境
目前主流的Sim2Real路线,即“仿真里练到很强,上真机直接用”,存在明显短板。策略网络一旦部署往往被冻结,真实世界中摩擦、载荷等未知变化会让机器人表现打折,需返回仿真重新训练。
若想在真机上直接学习,则面临安全和数据的双重阻碍。随机探索可能导致机器人摔倒损坏,而真实的交互数据采集成本高昂且速度极慢,这导致机器人缺少真正意义上的持续学习能力。
LIFT框架
LIFT框架分为两个核心阶段。第一阶段,在仿真环境中使用离策略强化学习算法SAC进行大规模预训练,充分利用数据复用提升样本效率,并获得一个可在真机零样本部署的稳定策略。
第二阶段,在真实世界,机器人主要执行确定性、可控的动作来采集少量数据。这些数据用于微调一个物理信息增强的世界模型,而策略的“试错”和“探索”过程则完全在这个虚拟世界模型内完成,从而将风险与真实硬件隔离。
三大洞察
该框架基于三个核心洞察。首先,相比于常用的PPO算法,SAC的离策略特性使其在数据量和多样性受限时样本效率更高,更适合真机微调场景。
其次,经过系统优化的SAC策略能实现零样本真机部署,为后续微调提供了稳定的起点。最后,将物理动力学模型融入世界模型,能显著提升预测的准确性和鲁棒性,避免了纯神经网络模型可能产生的物理不合理预测。
实测效果
研究团队在Booster T1和Unitree G1两款人形机器人上验证了LIFT的有效性。在预训练阶段,优化后的SAC算法收敛时间从7小时降至半小时以内,且策略可直接部署到真机。
在微调阶段,LIFT展现出极高的样本效率。在仿真器中,仅需约4万环境步(相当于真实世界的800秒)即可在分布内、长尾及分布外场景中收敛。在Booster T1真机上,LIFT仅需80-590秒的真实交互数据,就能将一个失败的策略逐步修正至稳定行走,步态更平顺,速度偏差显著降低。
LIFT框架为构建可闭环、自动化的机器人学习系统指明了方向。它通过将风险探索内化于世界模型,有效解决了真机持续学习的难题。尽管在状态估计、安全机制等方面仍有挑战,但这无疑是迈向通用人工智能的关键一步。