这篇内容通过100多次真实机器人实验,揭示了“仿真预训练+在线微调”中策略反向退化的根本原因。它提供了一套几乎不改动算法,仅通过调整训练流程就能显著提升稳定性的实用方案,对推动强化学习在真实硬件上的落地具有重要参考价值。
智能速览
大规模真实实验验证了跨三种机器人平台的sim-to-online稳定性问题。
仿真与真实世界的动力学差异会引发策略性能的“下行螺旋”。
混合使用历史数据是在线微调的关键稳定器,能加速收敛。
不对称的Actor-Critic更新策略对训练稳定性至关重要。
大规模并行仿真环境是确保稳健迁移的前提,数量需达1000+。
保留仿真数据可作为正则项,有效抑制Q函数过估计问题。
精华内容
将仿真训练的成果成功迁移到真实机器人,并在线持续学习,是当前机器人学领域的核心挑战之一。
下行螺旋之谜
研究发现,经典的“仿真预训练+真实在线微调”流程存在一个致命缺陷。由于仿真环境与现实世界存在不可避免的动力学差异,这种分布偏移会持续放大对状态价值函数Q的估计误差。这导致一个“下行螺旋”效应:策略在真实环境中收集的数据越来越差,反而进一步恶化了策略模型,最终甚至完全遗忘在仿真中习得的能力,造成性能反向退化。
数据是稳定器
解决上述问题的关键在于数据管理。实验证明,将仿真或历史试验数据与在线收集的新数据混合采样,是提升稳定性的有效手段。具体做法是设置一个混合系数α,从0.5开始逐步退火至1(即完全使用在线数据)。即便只保留少量历史数据,也能显著加速收敛。若无法保留离线数据,一种名为“Warm Start”的替代方案也有效:先使用预训练策略在真实环境中收集若干个试验片段填充缓冲区,再开始微调,同样能极大缓解初期的不稳定。
不对称更新
除了数据策略,训练流程的更新节奏也至关重要。研究指出,必须采用非对称的Actor-Critic更新频率。具体而言,在Critic网络更新20次之后,Actor网络才更新1次。同时,需要将Actor的学习率降至极低水平,如1e-5。实验在Franka机械臂、Unitree Go1四足机器人等三个平台上均证实,这种不对称更新策略对稳定性的提升效果显著,而传统的对称更新方式几乎全部失败。
仿真基石
一个稳健的“仿真到现实”迁移,其根基在于高质量的仿真预训练。论文强调,必须使用大规模的域随机化环境,实验表明环境数量Ne需要达到1000+以上,才能保证策略的泛化能力。仅使用128个环境的仿真,虽然表现良好,但部署到真实机器人上性能会大幅退化。此外,这些海量的仿真数据在在线微调阶段也并非无用,它们可以作为正则项,约束Q函数在低误差区域内,有效抑制由分布漂移带来的过估计问题。
这项研究通过详实的工程实验,为机器人强化学习的落地提供了极具价值的实践指南。它揭示了流程优化的力量,即便算法不变,也能显著提升训练的稳定性。未来的自动化系统是否都将遵循这一套稳定配方?