Flow Matching模型π0系列虽推理飞快,却因likelihood计算难题难以用强化学习(RL)提升。一项名为πRL的开源方案,通过引入学习噪声和仿真,成功破解了这一技术瓶颈,让模型在复杂任务中的成功率实现翻倍增长,为具身智能研究开辟了新路径。
智能速览
π0系列模型因likelihood计算难题,难以用强化学习提升性能。
πRL方案通过Flow-Noise和Flow-SDE两条技术路径,解决了该核心问题。
新方法使模型在多项任务中的成功率实现翻倍,数据利用效率也提升2倍。
与π0.6的RECAP路线相比,πRL支持纯仿真并行训练,复现门槛更低。
精华内容
面对π0系列模型“快而不强”的窘境,学术界给出了直面核心挑战的答案,让强化学习与Flow Matching模型的结合不再是空中楼阁。
π0的核心矛盾
π0与π0.5模型采用Flow Matching技术生成动作,仅需5步推理、耗时63ms,比传统的Diffusion模型快了10倍,是实现实时控制的关键。然而,这种高效推理机制带来了一个致命缺陷:无法计算出强化学习(RL)训练所必需的likelihood值。这导致模型性能提升只能依赖监督微调(SFT)硬堆数据,一旦遇到超出训练范围的场景(OOD),表现便会急剧下降。
πRL的破局之道
针对likelihood计算难题,清华、北大与CMU的研究团队联合提出πRL方案,包含两条技术路线。第一条是Flow-Noise,通过在去噪过程中注入可学习的噪声,将原本连续的ODE(常微分方程)过程转化为离散的马尔可夫过程,从而得到了likelihood的解析解,噪声网络在训练完成后即可丢弃。第二条是Flow-SDE,它通过数学等价转换将ODE变为SDE(随机微分方程),引入了天然的随机性以利于探索,并能通过混合采样将训练速度提升一倍。
效果与效率飞跃
πRL方案的效果体现在硬核数据上。在SIMPLER基准测试中,基于π0模型的πRL方案将成功率从67.2%大幅提升至86.7%。在包含4352种任务的MultiTask评估中,成功率更是从41.6%跃升至85.7%,提升幅度高达106%。这表明模型能力实现翻倍的同时,数据利用效率也提升了两倍以上,学习效果显著增强。
路线之争与展望
πRL的出现,形成了与π0.6官方路线的直接竞争。π0.6采用RECAP方法,将强化学习的advantage信号作为条件融入prompt,巧妙地绕开了likelihood计算问题,但该方法依赖真实机器人和人工纠偏,成本较高。相比之下,πRL选择正面攻克likelihood计算的难关,实现了纯仿真环境下的并行训练,并完全开源,代表了学术界对工程化workaround的一次有力“平替”。
πRL的出现,不仅为Flow VLA模型打通了RL技术栈,更重要的是展示了开源社区的力量。它有效降低了尖端技术的复现门槛,为工程师、创业者和投资者提供了新的机遇和思考。当技术壁垒被逐渐打破,具身智能的下一个爆点会在哪里?
关键评论
有观点认为,通过噪声模拟得到正解的概率可能过小,对方案的实际效果提出质疑。
部分评论指出,该方法可能仅适用于仿真环境,在现实场景中的实用性存疑。
有技术爱好者关注到,Flow+RL的结合或likelihood的解决在VLA领域并非全新课题。
也有评论指出,类似优化方法已被提出,并认为对相关领域前沿进展的跟进略显不足。