张大妈

π0.6的RL能力被开源平替了?学习噪声+仿真

源自小红薯:AI烤红薯

02-01 18:41

Flow Matching模型π0系列虽推理飞快,却因likelihood计算难题难以用强化学习(RL)提升。一项名为πRL的开源方案,通过引入学习噪声和仿真,成功破解了这一技术瓶颈,让模型在复杂任务中的成功率实现翻倍增长,为具身智能研究开辟了新路径。

π0.6的RL能力被开源平替了?学习噪声+仿真智能速览

  • π0系列模型因likelihood计算难题,难以用强化学习提升性能。

  • πRL方案通过Flow-Noise和Flow-SDE两条技术路径,解决了该核心问题。

  • 新方法使模型在多项任务中的成功率实现翻倍,数据利用效率也提升2倍。

  • 与π0.6的RECAP路线相比,πRL支持纯仿真并行训练,复现门槛更低。

π0.6的RL能力被开源平替了?学习噪声+仿真精华内容

面对π0系列模型“快而不强”的窘境,学术界给出了直面核心挑战的答案,让强化学习与Flow Matching模型的结合不再是空中楼阁。

π0的核心矛盾

π0与π0.5模型采用Flow Matching技术生成动作,仅需5步推理、耗时63ms,比传统的Diffusion模型快了10倍,是实现实时控制的关键。然而,这种高效推理机制带来了一个致命缺陷:无法计算出强化学习(RL)训练所必需的likelihood值。这导致模型性能提升只能依赖监督微调(SFT)硬堆数据,一旦遇到超出训练范围的场景(OOD),表现便会急剧下降。

πRL的破局之道

针对likelihood计算难题,清华、北大与CMU的研究团队联合提出πRL方案,包含两条技术路线。第一条是Flow-Noise,通过在去噪过程中注入可学习的噪声,将原本连续的ODE(常微分方程)过程转化为离散的马尔可夫过程,从而得到了likelihood的解析解,噪声网络在训练完成后即可丢弃。第二条是Flow-SDE,它通过数学等价转换将ODE变为SDE(随机微分方程),引入了天然的随机性以利于探索,并能通过混合采样将训练速度提升一倍。

效果与效率飞跃

πRL方案的效果体现在硬核数据上。在SIMPLER基准测试中,基于π0模型的πRL方案将成功率从67.2%大幅提升至86.7%。在包含4352种任务的MultiTask评估中,成功率更是从41.6%跃升至85.7%,提升幅度高达106%。这表明模型能力实现翻倍的同时,数据利用效率也提升了两倍以上,学习效果显著增强。

路线之争与展望

πRL的出现,形成了与π0.6官方路线的直接竞争。π0.6采用RECAP方法,将强化学习的advantage信号作为条件融入prompt,巧妙地绕开了likelihood计算问题,但该方法依赖真实机器人和人工纠偏,成本较高。相比之下,πRL选择正面攻克likelihood计算的难关,实现了纯仿真环境下的并行训练,并完全开源,代表了学术界对工程化workaround的一次有力“平替”。

πRL的出现,不仅为Flow VLA模型打通了RL技术栈,更重要的是展示了开源社区的力量。它有效降低了尖端技术的复现门槛,为工程师、创业者和投资者提供了新的机遇和思考。当技术壁垒被逐渐打破,具身智能的下一个爆点会在哪里?

π0.6的RL能力被开源平替了?学习噪声+仿真关键评论

  • 有观点认为,通过噪声模拟得到正解的概率可能过小,对方案的实际效果提出质疑。

  • 部分评论指出,该方法可能仅适用于仿真环境,在现实场景中的实用性存疑。

  • 有技术爱好者关注到,Flow+RL的结合或likelihood的解决在VLA领域并非全新课题。

  • 也有评论指出,类似优化方法已被提出,并认为对相关领域前沿进展的跟进略显不足。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章