π0.6*模型的推出,标志着机器人学习能力的重大突破。它不再仅仅依赖人类演示,而是通过RECAP强化学习算法,从自主实践中汲取经验、自我纠错,从而在速度与鲁棒性上实现超越,为通用机器人的实用化部署铺平了道路。
智能速览
π0.6*模型能通过自主执行、奖励反馈和专家纠正三种方式自我提升。
其核心的RECAP算法通过优势标签区分好坏动作,让模型学习最优策略。
在叠衣服任务中,RECAP让困难版任务的吞吐量翻倍,失败率降低2倍。
机器人能连续13小时制作浓缩咖啡,展示了长时序任务的实用性。
在真实工厂场景下,组装纸箱任务的整体成功率接近90%。
相比传统强化学习方法,RECAP在训练效率和稳定性上表现出显著优势。
精华内容
π0.6*的核心突破在于其名为RECAP的训练算法,它让机器人像人一样通过实践获得经验,实现能力的自我超越。
模型架构解析
π0.6*是在π0.6基础模型上通过强化学习升级的版本。其架构采用了Gemma 3的4B参数作为视觉-语言骨干网络,负责理解多模态信息,并配合一个约8.6亿参数的“动作专家”模块来生成具体的操作指令。
该模型能够同时接收并处理最多4个摄像头的图像输入,包括基础相机和腕部相机等,这为其在复杂环境下的精确操作提供了丰富的感知基础。
RECAP算法核心
π0.6*采用了名为RECAP(通过优势条件策略进行经验与纠正的强化学习)的算法。该算法包含三个循环迭代的步骤:首先,让机器人自主执行任务并记录成败,人类专家可在早期进行干预纠正;其次,利用收集到的所有数据训练一个价值函数,用以预测当前状态距离成功还有多远;最后,进行优势条件训练,这是算法的创新点,它会给每个动作打上“好”或“坏”的优势标签,并通过提示词引导模型在推理时只生成好的动作。
实战任务表现
π0.6*在三类实际任务上展现了卓越性能。在叠衣服任务中,标准版成功率超90%,困难版(11种衣物)的吞吐量翻了一倍多,而要求衣领朝上的严格标准版成功率高达97%。在制作咖啡的长时序任务中,吞吐量同样翻倍,成功率超90%,并实现了连续13小时不间断作业。在工厂场景的纸箱组装任务中,整体成功率接近90%,两次迭代后吞吐量提升了2倍。
与传统方法对比
研究对比了RECAP与传统强化学习方法AWR(优势加权回归)和PPO(近端策略优化)的效果。结果显示,在叠衣服任务上,RECAP的吞吐量远超另外两种方法。AWR虽然成功率尚可,但执行速度慢;PPO在离线数据上训练则表现出不稳定性。RECAP算法凭借其简单高效、利用多源数据的特点,实现了既快又稳的训练效果,特别适合大型VLA模型。
π0.6*模型与RECAP算法的结合,实现了机器人从“会做”到“做得又快又好”的关键跨越。这种通过自主练习、反馈和纠错不断进化的能力,让机器人真正开始具备“熟能生巧”的特质。这是否意味着我们离真正通用的、能适应各种现实环境的机器人又近了一步?