传统机器人训练耗时漫长,而智元新发布的SOP系统带来了革命性突破。它让机器人在真实环境中边干边学,一旦犯错被纠正,经验会瞬间共享给所有机器人,实现集群的秒级进化。这为通用机器人大规模落地铺平了道路。
智能速览
SOP系统让机器人实现真实环境下的“边干边学”。
一台机器人的犯错经验可秒级共享给整个机器人集群。
3小时在线学习的提升效果远超80小时传统离线训练。
多台机器人并行训练,效率提升近60%,打破边际效应递减。
在叠衣服等复杂任务中,机器人效率实现翻倍。
精华内容
机器人训练的战场正从仿真世界转向真实物理世界。SOP系统如何构建一个让机器人集群持续进化的闭环,让每一次试错都成为共同进步的阶梯?
为何后训练难
机器人大模型的训练路径与语言模型类似,都需经历预训练和后训练。但机器人的后训练一直是个难题,因为其学习依赖于物理世界的试错,成本高昂且周期漫长。每次失败都意味着重置场景,10次失败就可能耗费一小时。这种离线、单机、周期长的方式,导致机器人训练无法扩展,智能进化极为缓慢。
SOP的运作逻辑
SOP系统构建了一个“前线-后方”的持续闭环架构。前线的机器人既是执行者也是数据采集员,将实战中的成功与失败经验实时上传云端。后方的云端大脑则异步运转,持续学习并更新模型参数,分钟级下发至所有机器人。它动态混合在线实战数据与离线专家数据,根据模型表现调整学习权重,哪里薄弱就补哪里,实现精准高效进化。
异构数据即优势
传统观点认为不同环境、不同任务的数据是“噪声”,但SOP将其视为天然的数据增强。实验中,10台机器人分布在不同场景执行理货、叠衣服、组装纸箱等任务。当一台在光滑桌面打滑,另一台在粗糙地毯卡住时,这些多样的失败经验共同教会模型学习通用的动作逻辑,而非过拟合特定环境,极大提升了模型的泛化能力。
实验数据说话
实验结果证明了SOP的卓越性能。对比发现,仅用3小时在线交互,SOP就将模型成功率从0.571提升至0.800,效果远超追加80小时离线演示的0.612。在可扩展性测试中,从1台机器人扩展到4台,训练180分钟后的成功率从0.805提升至0.925,达到目标所需时间从173.6分钟降至71.7分钟。在叠衣服任务中,吞吐量从21次/小时飙升至42次/小时,效率翻倍。
新范式,新可能
SOP的核心设计哲学是将系统层与算法层解耦,使其成为一个算法无关的平台,可以适配不同的学习方法。这标志着机器人训练的范式转变:主战场从仿真环境转移至真实物理世界,学习方式从离线复盘转为在线进化。当真实世界的经验成为可无限扩展的训练资源时,通用机器人大规模商用化的前景变得前所未有的清晰。
SOP系统的价值不仅在于技术本身,更在于它开启了机器人学习的新范式。当真实世界的经验成为可扩展的资源,通用机器人真正融入生活或许已不再遥远。这会是机器人的“GPT时刻”吗?