人形机器人在现实环境中的持续学习一直面临安全和效率的双重挑战。北京通用人工智能研究院提出的LIFT框架,通过结合离策略强化学习与物理信息增强的世界模型,实现了真机环境下的安全高效微调,为人形机器人的持续学习开辟了新路径。
智能速览
传统Sim2Real路线存在策略冻结和重训成本高的问题
LIFT采用SAC离策略算法提高样本效率
物理信息增强的世界模型将探索风险转移到虚拟环境
在Booster T1和Unitree G1平台验证了框架有效性
仅需80-590秒真实数据即可修正不稳定行为
精华内容
如何让人形机器人在真实世界持续学习?LIFT框架给出了答案:把高风险探索留在世界模型里,用有限的真实交互实现安全高效的策略优化。
真机学习瓶颈
当前主流的Sim2Real路线存在根本缺陷:仿真中训练的策略一旦部署就被冻结,无法适应真实环境的动态变化。而真机强化学习面临两道门槛:安全性和数据获取成本。随机探索可能导致机器人摔倒损坏,而真机交互速度慢、次数有限,使得持续学习几乎不可行。传统的在策略算法如PPO虽然收敛快,但无法复用旧数据,在真实环境中既不安全也不经济。
LIFT核心设计
LIFT框架基于三个核心洞察构建:首先,SAC相比PPO在数据受限时样本效率更高,其状态相关的随机策略能促进世界模型中的有效探索;其次,优化后的SAC能在半小时内完成收敛,并获得真机零样本部署能力;最后,物理信息增强的世界模型通过结合Ensemble网络与人形机器人动力学模型,显著提升了预测准确性和策略微调性能。
训练流程创新
LIFT采用两阶段训练策略:仿真阶段使用SAC进行大规模预训练,充分利用数据复用;同时离线训练物理信息增强的世界模型。真机微调时,机器人仅执行确定性动作采集数据,用新数据微调世界模型,然后在模型中进行随机探索生成合成轨迹更新策略。这种设计将探索风险控制在虚拟空间,确保真机交互的安全性。
实验验证
在Booster T1与Unitree G1平台的实验显示,LIFT预训练收敛时间与PPO相当,但具备零样本部署能力。在分布内、长尾分布和分布外三种场景下,LIFT均能在4×10⁴样本量级收敛,相当于真实世界的800秒。Booster T1真机实验中,仅需80-590秒的真实数据就能从失败策略逐步修正为稳定策略,展现了卓越的样本效率。
技术优势
消融实验证明了各组件的必要性:去除世界模型预训练后收敛速度明显下降;完全去除预训练则容易陷入局部最优。相比纯Ensemble网络模型,物理信息增强的设计能避免不合理的物理预测,提供更强的归纳偏置。LIFT成功将预训练速度与微调效率、安全可控性统一起来,突破了传统方法的局限。
LIFT框架为人形机器人真实环境强化学习提供了可行路径,但要实现规模化仍需突破观测状态估计、安全重置机制和系统吞吐量等瓶颈。随着这些要素逐步完善,强化学习将在真实世界发挥更大作用,推动通用人工智能的发展。