机器人具备通用能力后,如何走向规模化部署?智元机器人的SOP系统提供了解决方案。它通过分布式在线后训练,让机器人在真实环境中持续进化,将“规模”转化为“智能”,解决了当前VLA模型后训练的痛点。
智能速览
业界首个面向真实世界部署的VLA在线后训练系统
构建Actor-Learner异步架构,实现数据即时采集与模型同步
多机并行探索显著提升效率,有效缓解分布偏移问题
商超场景实测综合性能提升33%,叠衣服吞吐量提升114%
部署即进化,机器人仅用数小时即可适应全新复杂环境
精华内容
机器人走出实验室后,面临环境复杂多变的巨大挑战。传统的离线训练模式已难以满足规模化部署需求,SOP系统应运而生,旨在重构机器人的学习范式。
真实世界的规模化瓶颈
通用机器人要在真实世界中大规模运行,必须同时满足稳定性与泛化能力这两个看似矛盾的要求。现有的VLA预训练模型虽然提供了通用性,但在高精度任务面前,受困于离线数据采集边际效益递减的难题。主流的VLA后训练方法仍受离线、单机、串行采集等因素制约,难以支撑高效、持续的真实世界学习,限制了机器人智能的进一步进化。
分布式在线训练架构
SOP的核心在于将VLA后训练从“离线、单机、顺序”重构为“在线、集群、并行”。该系统采用Actor-Learner异步架构:多台机器人作为Actor并行执行任务并采集数据;云端作为Learner进行在线学习,动态调整数据比例。更新后的模型参数在分钟级别内同步回所有机器人,形成一个低延迟的闭环,让个体经验在群体中高效复用。
性能与效率实测
实验结果表明,SOP带来了显著的性能提升。在商超场景中,结合SOP的方法实现了33%的综合性能提升;在叠衣服任务中,吞吐量更是跃升114%。更重要的是,多机并行有效阻止了模型过拟合,四机集群相比单机将训练速度提升至2.4倍。这证明了分布式架构能够将硬件扩展转化为学习效率的大幅缩短。
突破预训练瓶颈
研究发现,SOP能有效突破VLA性能瓶颈。在预训练出现边际效应递减时,仅增加3小时的在轨经验就能带来约30%的性能提升,而额外增加80小时的人类专家数据仅带来4%的提升。这意味着,通过SOP系统利用真实世界的在线经验,比单纯堆砌离线数据更能高效地提升机器人的特定任务能力。
SOP系统的提出,标志着机器人技术从“固定标品”向“持续进化的生命体”转变。部署不再是终点,而是更大规模学习的起点。随着机器人集群在真实世界中不断积累经验,智能的边界将被无限拓宽。