具身智能正面临高成本数字孪生与难规模化真机操作的路线之争。RL-Co 提出虚实协同训练新范式,通过强化学习释放仿真环境的交互潜力,以低成本仿真实现真机性能的显著提升,为行业提供了极具性价比的“第三条路”。
智能速览
两阶段协同架构兼顾模拟交互深度与真实分布约束
强化学习挖掘仿真交互逻辑,避免浪费其核心优势
OpenVLA在真实任务中成功率提升24%,性能飞跃
仅需20条真机数据即可达到基线200条数据的效果
精华内容
针对具身智能数据痛点,RL-Co 证明了只要将低成本仿真中的交互逻辑用对,即可实现真机性能的跨越式飞跃。
打破数据困局
当前具身智能领域陷入了两难:高成本的极致数字孪生与规模化困难的真机遥操作。大多数传统方案将仿真环境仅视为“静态轨迹库”,通过监督微调进行训练,这实际上浪费了仿真环境最核心的“闭环交互性”优势。寻找一种既能利用仿真低成本优势,又能保证真机高性能的“第三条路”,成为行业亟待解决的难题。
双阶段架构
RL-Co 构建了严谨的两阶段协同训练架构来解决这一问题。第一阶段利用少量真机演示与大规模仿真数据进行混合数据预热,通过监督微调为预训练模型注入任务先验,确保策略具备基础的闭环执行能力。第二阶段进入交互优化,在仿真环境中进行强化学习以提升鲁棒性,同时引入真机监督微调损失作为正则项,将策略分布“锚定”在真机空间,有效防止灾难性遗忘。
性能实测
在四个真实桌面操作任务中,RL-Co 展现出了显著的性能提升。相比仅依赖监督微调的协同训练,OpenVLA 在真实世界中的成功率暴涨了 24%,另一主流架构提升 20.3%。此外,面对未见过的物体或未知的初始状态,该方案练就的交互逻辑展现出了极强的稳定性,掉点幅度显著小于传统基线方法,证明了其强大的泛化能力。
极致数据效率
数据利用效率是衡量方案实用性的关键指标。实验显示,在开抽屉任务中,RL-Co 仅需 20 条真机数据,其效果就能对标甚至优于需要 200 条真机数据的基线方法。这表明,单纯堆砌真机数据并非唯一出路,只要将仿真里的闭环交互逻辑运用得当,就能以极低的真机数据成本撬动巨大的性能提升,为具身智能的规模化落地提供了新思路。
RL-Co 成功验证了仿真-真机协同训练的巨大潜力,打破了昂贵物理孪生的依赖。这种虚实结合的思路,不仅大幅降低了具身智能的训练门槛,也为解决数据稀缺问题提供了新范式,未来有望推动机器人技术更快落地。