蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争

源自知乎:量子位

01-31 19:28

蚂蚁灵波开源了具身智能基座模型LingBot-VLA,基于20000小时真实世界数据训练,首次系统性验证了VLA模型的数据缩放定律,其性能与泛化能力为行业迈向规模化落地提供了新解法。

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争智能速览

  • LingBot-VLA基于目前开源最大规模的20000小时真实机器人数据训练。

  • 在权威评测中,其性能全面超越π0.5与英伟达GR00T等国际顶尖模型。

  • 凭借强大的泛化能力,可在多种不同构型的机器人上执行复杂任务。

  • 采用专家混合架构与流匹配模型,实现了更丝滑连贯的动作控制。

  • 首次在真实世界系统性验证了VLA模型的数据缩放定律,性能尚未饱和。

蚂蚁具身智能明牌了:做大脑,和宇树们错位竞争精华内容

超越π0.5的VLA模型是如何炼成的?答案藏在20000小时的真实世界数据与一系列技术创新中。

海量真实数据

模型的核心优势源于其庞大的数据基础。团队摒弃了与真实世界存在鸿沟的仿真数据,选择从2023年开始,通过真实遥控操作,收集了20000小时的机器人操作数据。

这些数据覆盖了抓取、放置、组装等原子动作,且源自9种不同品牌和构型的双臂机器人。这种数据的异构性和丰富性,为模型强大的泛化能力打下了坚实基础,使其能够适应不同硬件和视角。

架构与感知创新

模型架构上,LingBot-VLA采用了专家混合Transformer,可理解为一套大脑与小脑协同工作的系统,二者通过共享的自注意力机制深度耦合,实现高效信息交互。

动作生成上,它引入流匹配模型,学习动作变化的平滑流场,而非预测离散点位,使机器人动作更接近人类演示的自然度。此外,团队还自研了LingBot-Depth深度估计模型,让机器人能看清透明物体并感知三维空间。

算力效率革命

训练20000小时高维数据对算力是巨大挑战。团队通过系统级优化,打造了高性能开源代码库,在分布式策略、算子级别和数据处理管道上进行了革新。

优化后,在8卡GPU配置下,实现了每秒每GPU 261个样本的吞吐量,训练速度比主流框架提升1.5至2.8倍。这使得原本需要一个月的实验周期缩短至一到两周,让万小时级数据迭代VLA模型变得可行。

性能全面超越

在权威的GM-100基准测试中,LingBot-VLA迎来了π0.5、英伟达GR00T N1.6等对手的挑战。该评测在三种真实机器人平台,对100个精细操作任务进行了总计22500次测试。

结果显示,融合深度信息的LingBot-VLA在各项指标上均显著超越π0.5。例如,在AgileX平台上,其平均任务成功率为18.93%,而π0.5为17.20%;在更具挑战性的Galaxea平台上,优势更明显(20.98% vs 14.10%)。

通用大脑战略

蚂蚁灵波的定位是提供通用智能基座,即“大脑”,而非机器人的“身体”,旨在解决行业场景碎片化与硬件非标化的痛点。通过在海量异构数据上预训练,模型学会了跨越硬件平台的本质操作逻辑。

这种“一次训练,多端部署”的愿景,在LingBot-VLA的跨本体泛化能力上得到验证。为此,团队不仅开源了模型和代码,还贡献了“交钥匙”式的评估基准,推动行业从实验室演示迈向规模化落地。

LingBot-VLA的开源不仅是技术突破,更推动了具身智能从演示走向落地。一个通用大脑的生态雏形已现,规模化应用的未来还有多远?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐