蚂蚁集团发布的LingBot-VLA模型,凭借近2万小时真实世界数据训练,在机器人操控领域实现了显著突破。该模型不仅在多项基准测试中性能全面领先,其创新的混合架构和高效训练策略,也为具身智能的发展提供了新的技术路径和实践参考。
智能速览
LingBot-VLA使用近2万小时真实世界数据训练,覆盖9种机器人构型。
采用混合Transformer架构,分离视觉语言理解与动作生成模块。
通过深度信息融合,显著提升了模型在空间推理任务上的精度。
优化训练代码库,将吞吐量提升1.5-2.8倍,加速模型迭代。
在GM-100基准测试中,平均成功率达到35.41%,远超同类主流模型。
精华内容
具身智能模型的性能瓶颈,往往受限于训练数据的规模与真实性。LingBot-VLA的出现,正是基于对这一核心痛点的精准回应和深度探索。
真实数据筑基
与传统依赖仿真数据的模型不同,LingBot-VLA的训练完全基于真实世界。研究团队动用9种主流双臂机器人,通过VR遥操作等方式,累计采集了近2万小时的操控数据。
为确保数据质量,团队设计了人工拆解与模型标注相结合的流程,将连续操作分解为原子动作,并匹配精准的语言指令,最终构建了丰富的视觉-语言-动作三元组数据集,为模型的泛化能力奠定了坚实基础。
混合架构创新
LingBot-VLA的核心是一套混合Transformer(MoT)架构。它将Qwen2.5VL作为语义主干,专门处理多视角图像与文本指令,同时引入独立的动作专家模块负责本体感知和动作预测。
两个模块通过共享自注意力机制协作,但处理路径分离,有效避免了不同模态信息间的干扰。此外,模型采用流匹配算法生成动作,使机器人操作更流畅,并融合深度信息以增强空间感知能力,解决了传统VLA模型空间推理弱的痛点。
效率与性能并进
面对大模型训练的高昂成本,LingBot-VLA团队从分布式策略和算子优化入手,打造了高效训练代码库。通过全分片数据并行(FSDP)策略和混合精度训练,显著降低了单卡显存压力并提升了计算速度。
在8-GPU集群上,其训练吞吐量达到每卡每秒261个样本,较主流框架提升1.5至2.8倍。在GM-100基准测试中,LingBot-VLA的平均成功率达到35.41%,远超π0.5的13.02%和GR00T N1.6的7.59%,性能优势全面。
LingBot-VLA不仅是一次技术上的成功实践,更验证了“高质量、大规模真实数据”是推动具身智能发展的关键。随着模型及数据的开源,它将为整个社区注入新的活力。未来,当数据规模继续扩展,模型的性能天花板将被推向何处?这值得期待。