2万小时真实数据炼就地表最强VLA模型!蚂蚁LingBot-VLA到底有多能打?

源自公众号:具身智能大讲堂

02-20 10:57

蚂蚁集团发布的LingBot-VLA模型,凭借近2万小时真实世界数据训练,在机器人操控领域实现了显著突破。该模型不仅在多项基准测试中性能全面领先,其创新的混合架构和高效训练策略,也为具身智能的发展提供了新的技术路径和实践参考。

2万小时真实数据炼就地表最强VLA模型!蚂蚁LingBot-VLA到底有多能打?智能速览

  • LingBot-VLA使用近2万小时真实世界数据训练,覆盖9种机器人构型。

  • 采用混合Transformer架构,分离视觉语言理解与动作生成模块。

  • 通过深度信息融合,显著提升了模型在空间推理任务上的精度。

  • 优化训练代码库,将吞吐量提升1.5-2.8倍,加速模型迭代。

  • 在GM-100基准测试中,平均成功率达到35.41%,远超同类主流模型。

2万小时真实数据炼就地表最强VLA模型!蚂蚁LingBot-VLA到底有多能打?精华内容

具身智能模型的性能瓶颈,往往受限于训练数据的规模与真实性。LingBot-VLA的出现,正是基于对这一核心痛点的精准回应和深度探索。

真实数据筑基

与传统依赖仿真数据的模型不同,LingBot-VLA的训练完全基于真实世界。研究团队动用9种主流双臂机器人,通过VR遥操作等方式,累计采集了近2万小时的操控数据。

为确保数据质量,团队设计了人工拆解与模型标注相结合的流程,将连续操作分解为原子动作,并匹配精准的语言指令,最终构建了丰富的视觉-语言-动作三元组数据集,为模型的泛化能力奠定了坚实基础。

混合架构创新

LingBot-VLA的核心是一套混合Transformer(MoT)架构。它将Qwen2.5VL作为语义主干,专门处理多视角图像与文本指令,同时引入独立的动作专家模块负责本体感知和动作预测。

两个模块通过共享自注意力机制协作,但处理路径分离,有效避免了不同模态信息间的干扰。此外,模型采用流匹配算法生成动作,使机器人操作更流畅,并融合深度信息以增强空间感知能力,解决了传统VLA模型空间推理弱的痛点。

效率与性能并进

面对大模型训练的高昂成本,LingBot-VLA团队从分布式策略和算子优化入手,打造了高效训练代码库。通过全分片数据并行(FSDP)策略和混合精度训练,显著降低了单卡显存压力并提升了计算速度。

在8-GPU集群上,其训练吞吐量达到每卡每秒261个样本,较主流框架提升1.5至2.8倍。在GM-100基准测试中,LingBot-VLA的平均成功率达到35.41%,远超π0.5的13.02%和GR00T N1.6的7.59%,性能优势全面。

LingBot-VLA不仅是一次技术上的成功实践,更验证了“高质量、大规模真实数据”是推动具身智能发展的关键。随着模型及数据的开源,它将为整个社区注入新的活力。未来,当数据规模继续扩展,模型的性能天花板将被推向何处?这值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐