当前机器人领域常依赖海量数据与算力“暴力堆规模”,成本高昂且效率低下。一项名为X0的新工作提出了一种颠覆性范式,通过模式一致性、模型算法与阶段优势三大核心理念,仅需20小时演示数据和8台A100 GPU,即可在服装操控等复杂任务中实现100%可靠性,为高效推进具身智能研究提供了全新思路。

智能速览
仅需20小时数据与8台GPU,即可实现机器人操作100%可靠度。
通过模式一致性,最小化从训练到执行的分布偏移。
提出模型算术法(MA),低成本高效融合不同数据训练出的模型。
利用阶段优势信号,为长时程任务提供更精准的步骤指导。
该方法显著降低了模型训练与迭代成本,加速了研发周期。
精华内容
这套名为X0的方案究竟是如何运作的?其核心在于对传统训练范式的三重优化,从数据对齐、模型融合到策略指导,环环相扣,共同构筑了通往100%可靠性的低成本路径。
数据对齐之道
机器人操作失败的根源,常在于数据分布的偏移。传统方法下,人类演示数据、模型内部知识与真实世界执行动作三者之间存在动态不一致,如同“打地鼠”般此消彼长,导致策略在部署时失效。
X0的核心对策是“模式一致性”,即严格对齐这三个分布。具体通过两种技术实现:一是采用DAgger方法,将在线策略中失败的轨迹注入数据集,增强模型的错误恢复能力;二是在推理时结合分块时间平滑与实时分块技术,确保模型输出的动作能被流畅、连贯地执行。
实验数据证明,优化后的数据采集与在线策略反馈,不仅将任务成功率提升至新高,还显著降低了每次失败后的重试次数。推理优化则有效减少了执行抖动,直接提升了单位时间内的任务吞吐量,保证了策略的预期效果。
融合模型之巧
具身智能研究面临一个长期困境:迭代式采集新数据后,若用全量数据重训模型,成本高昂得令人望而却步。如何低成本地融合新知识,成为加速研发的关键。
为此,研究者提出了“模型算术法”(Model Arithmetic, MA)。该方法无需全量重训,仅在新采集的数据子集上训练一个新模型,然后通过“在线策略优化引导的权重插值”技术,将新旧模型的知识合并成一个单一模型。
其核心见解在于,不同数据子集训练出的模型学习到了不同的策略流形,MA则像一条捷径,将这些流形有效融合。结果显示,通过MA合并后的模型,性能甚至超越了直接用全量数据训练的基准模型,成功实现了低成本的知识迭代。

长时视野之策
在服装折叠这类长时程操控任务中,一个关键难题是:在某个状态下,存在多个看似合理的动作,但只有少数能真正推动任务进展。如何给予模型“长时视野”至关重要。
传统方法通过评估状态值之差来间接计算优势信号,存在误差累积问题。X0则采用更直接的方案:将优势作为独立的建模目标,通过配对观测来预测状态间的相对进展,从而获得更平滑、更可靠的监督信号。
进一步地,“阶段优势”法将任务拆解为多个语义阶段,模型只需判断当前动作是否推进了当前阶段目标即可。这种方法让策略在每一步都有了明确的子目标牵引,最终实现了比基准方法更平滑、更稳定的任务进展,大幅提升了成功率。
X0项目有力地证明,实现机器人操作的极致精通,关键在于战略层面的精巧设计,而非资源层面的简单堆砌。这套方法不仅为复杂操控任务提供了高性价比的解决方案,也为整个具身智能领域的快速迭代开辟了新路径。未来,这种高效范式能否催生出更多实用化的机器人应用?