当前位置:
AIGC文章详情

张大妈

RL-Co: 虚实协同强化学习,VLA训练新范式

源自小红薯:THU_NICSefc_RL

03-03 15:12

具身智能正面临高成本数字孪生与难规模化真机操作的路线之争。RL-Co 提出虚实协同训练新范式,通过强化学习释放仿真环境的交互潜力,以低成本仿真实现真机性能的显著提升,为行业提供了极具性价比的“第三条路”。

RL-Co: 虚实协同强化学习,VLA训练新范式智能速览

  • 两阶段协同架构兼顾模拟交互深度与真实分布约束

  • 强化学习挖掘仿真交互逻辑,避免浪费其核心优势

  • OpenVLA在真实任务中成功率提升24%,性能飞跃

  • 仅需20条真机数据即可达到基线200条数据的效果

RL-Co: 虚实协同强化学习,VLA训练新范式精华内容

针对具身智能数据痛点,RL-Co 证明了只要将低成本仿真中的交互逻辑用对,即可实现真机性能的跨越式飞跃。

打破数据困局

当前具身智能领域陷入了两难:高成本的极致数字孪生与规模化困难的真机遥操作。大多数传统方案将仿真环境仅视为“静态轨迹库”,通过监督微调进行训练,这实际上浪费了仿真环境最核心的“闭环交互性”优势。寻找一种既能利用仿真低成本优势,又能保证真机高性能的“第三条路”,成为行业亟待解决的难题。

双阶段架构

RL-Co 构建了严谨的两阶段协同训练架构来解决这一问题。第一阶段利用少量真机演示与大规模仿真数据进行混合数据预热,通过监督微调为预训练模型注入任务先验,确保策略具备基础的闭环执行能力。第二阶段进入交互优化,在仿真环境中进行强化学习以提升鲁棒性,同时引入真机监督微调损失作为正则项,将策略分布“锚定”在真机空间,有效防止灾难性遗忘。

性能实测

在四个真实桌面操作任务中,RL-Co 展现出了显著的性能提升。相比仅依赖监督微调的协同训练,OpenVLA 在真实世界中的成功率暴涨了 24%,另一主流架构提升 20.3%。此外,面对未见过的物体或未知的初始状态,该方案练就的交互逻辑展现出了极强的稳定性,掉点幅度显著小于传统基线方法,证明了其强大的泛化能力。

极致数据效率

数据利用效率是衡量方案实用性的关键指标。实验显示,在开抽屉任务中,RL-Co 仅需 20 条真机数据,其效果就能对标甚至优于需要 200 条真机数据的基线方法。这表明,单纯堆砌真机数据并非唯一出路,只要将仿真里的闭环交互逻辑运用得当,就能以极低的真机数据成本撬动巨大的性能提升,为具身智能的规模化落地提供了新思路。

RL-Co 成功验证了仿真-真机协同训练的巨大潜力,打破了昂贵物理孪生的依赖。这种虚实结合的思路,不仅大幅降低了具身智能的训练门槛,也为解决数据稀缺问题提供了新范式,未来有望推动机器人技术更快落地。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐