李弘扬老师团队最新工作X0!超低成本高效实现机器人操作任务~

源自知乎:具身智能之心

02-06 01:28

当前机器人领域常依赖海量数据与算力“暴力堆规模”,成本高昂且效率低下。一项名为X0的新工作提出了一种颠覆性范式,通过模式一致性、模型算法与阶段优势三大核心理念,仅需20小时演示数据和8台A100 GPU,即可在服装操控等复杂任务中实现100%可靠性,为高效推进具身智能研究提供了全新思路。

李弘扬老师团队最新工作X0!超低成本高效实现机器人操作任务~

李弘扬老师团队最新工作X0!超低成本高效实现机器人操作任务~智能速览

  • 仅需20小时数据与8台GPU,即可实现机器人操作100%可靠度。

  • 通过模式一致性,最小化从训练到执行的分布偏移。

  • 提出模型算术法(MA),低成本高效融合不同数据训练出的模型。

  • 利用阶段优势信号,为长时程任务提供更精准的步骤指导。

  • 该方法显著降低了模型训练与迭代成本,加速了研发周期。

李弘扬老师团队最新工作X0!超低成本高效实现机器人操作任务~精华内容

这套名为X0的方案究竟是如何运作的?其核心在于对传统训练范式的三重优化,从数据对齐、模型融合到策略指导,环环相扣,共同构筑了通往100%可靠性的低成本路径。

数据对齐之道

机器人操作失败的根源,常在于数据分布的偏移。传统方法下,人类演示数据、模型内部知识与真实世界执行动作三者之间存在动态不一致,如同“打地鼠”般此消彼长,导致策略在部署时失效。

X0的核心对策是“模式一致性”,即严格对齐这三个分布。具体通过两种技术实现:一是采用DAgger方法,将在线策略中失败的轨迹注入数据集,增强模型的错误恢复能力;二是在推理时结合分块时间平滑与实时分块技术,确保模型输出的动作能被流畅、连贯地执行。

实验数据证明,优化后的数据采集与在线策略反馈,不仅将任务成功率提升至新高,还显著降低了每次失败后的重试次数。推理优化则有效减少了执行抖动,直接提升了单位时间内的任务吞吐量,保证了策略的预期效果。

融合模型之巧

具身智能研究面临一个长期困境:迭代式采集新数据后,若用全量数据重训模型,成本高昂得令人望而却步。如何低成本地融合新知识,成为加速研发的关键。

为此,研究者提出了“模型算术法”(Model Arithmetic, MA)。该方法无需全量重训,仅在新采集的数据子集上训练一个新模型,然后通过“在线策略优化引导的权重插值”技术,将新旧模型的知识合并成一个单一模型。

其核心见解在于,不同数据子集训练出的模型学习到了不同的策略流形,MA则像一条捷径,将这些流形有效融合。结果显示,通过MA合并后的模型,性能甚至超越了直接用全量数据训练的基准模型,成功实现了低成本的知识迭代。

李弘扬老师团队最新工作X0!超低成本高效实现机器人操作任务~

长时视野之策

在服装折叠这类长时程操控任务中,一个关键难题是:在某个状态下,存在多个看似合理的动作,但只有少数能真正推动任务进展。如何给予模型“长时视野”至关重要。

传统方法通过评估状态值之差来间接计算优势信号,存在误差累积问题。X0则采用更直接的方案:将优势作为独立的建模目标,通过配对观测来预测状态间的相对进展,从而获得更平滑、更可靠的监督信号。

进一步地,“阶段优势”法将任务拆解为多个语义阶段,模型只需判断当前动作是否推进了当前阶段目标即可。这种方法让策略在每一步都有了明确的子目标牵引,最终实现了比基准方法更平滑、更稳定的任务进展,大幅提升了成功率。

X0项目有力地证明,实现机器人操作的极致精通,关键在于战略层面的精巧设计,而非资源层面的简单堆砌。这套方法不仅为复杂操控任务提供了高性价比的解决方案,也为整个具身智能领域的快速迭代开辟了新路径。未来,这种高效范式能否催生出更多实用化的机器人应用?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐