蚂蚁出手VLA,就是开源超越Pi0.5的基座模型

源自今日头条:机器之心Pro

01-31 19:27

具身智能领域迎来重要突破,蚂蚁灵波开源的LingBot-VLA模型在100项真实任务评测中整体表现超越Pi0.5,成为跨本体、跨场景泛化的开源具身基座新标杆。

蚂蚁出手VLA,就是开源超越Pi0.5的基座模型

蚂蚁出手VLA,就是开源超越Pi0.5的基座模型智能速览

  • LingBot-VLA基于20000小时、覆盖9种双臂机器人构型的真实世界数据训练

  • 在GM-100评测基准上,成功率比Pi0.5平均提高4.28%

  • 模型采用Mixture-of-Transformers架构,结合视觉语言理解与动作生成

  • 训练效率显著提升,吞吐量达每秒261个样本

  • 全链路开源,包含模型权重、代码和后训练工具链

  • 首次揭示VLA模型在真实机器人数据上的Scaling Law

蚂蚁出手VLA,就是开源超越Pi0.5的基座模型精华内容

具身智能的突破不仅在于单一任务的完成,更在于跨本体、跨场景的泛化能力。LingBot-VLA的出现,为这一目标提供了有力支撑。

数据规模突破

LingBot-VLA的训练数据规模达到20000小时,覆盖9种主流双臂机器人构型,这一规模在开源具身模型中实属罕见。

传统上,不同机器人间的传感器、控制接口、本体结构差异巨大,数据难以统一利用。LingBot-VLA成功打破了这一瓶颈,实现了多源异构数据的高效整合。

数据规模从3000小时逐步扩展至20000小时过程中,模型在下游任务的成功率获得持续提升,且性能曲线仍未显示饱和迹象。

评测表现优异

在全新的GM-100具身智能基准测试中,LingBot-VLA面临100项真机任务的挑战。这些任务涉及串糖葫芦、拉软包拉链、叠衣服等长序列任务和精细操作。

模型被部署在来自三大平台的25台机器人上进行测试,实现了真正的跨本体验证。相比Pi0.5,LingBot-VLA的平均成功率提高4.28%,部分成功率提高7.76%。

特别值得注意的是,在Agibot G1平台上,仅使用80条示范数据进行后训练,LingBot-VLA的表现就超越了使用130条数据训练的Pi0.5模型。

架构创新设计

LingBot-VLA采用Mixture-of-Transformers架构,将强大的视觉语言模型作为理解世界的’大脑’,配上专门的’动作专家’生成机器人动作。

视觉、语言和动作数据通过独立处理通路,每一层通过共享注意力机制交互,既保证视觉语义知识指导动作生成,又避免模态信息干扰。

在动作生成上,模型采用Flow Matching方法建模连续平滑的动作轨迹,提升复杂操作的控制稳定性。

空间感知能力

针对机器人操作至关重要的空间感知,LingBot-VLA采用基于视觉蒸馏的深度信息融合方法。

模型并未直接将深度图作为输入,而是通过可学习的查询机制,使视觉语言主干提取的特征与专用深度模型生成的空间表征对齐。

这种设计让模型在无需深度图输入的情况下,就能具备对三维几何关系的隐式理解,在抓取、放置等任务中精度大幅提升。

训练效率领先

LingBot-VLA的训练框架展现出显著优势。在相同数据集和标准化架构下,其训练吞吐量均高于主流开源框架。

通过改进的FSDP策略、FlexAttention和算子融合等技术,训练吞吐量达到每秒261个样本,相比主流开源代码库有1.5至2.8倍加速。

随着GPU规模从8卡扩展至256卡,训练效率仍能紧密跟随理论线性扩展上限,展现卓越的大规模分布式训练可扩展性。

全链路开源

蚂蚁灵波选择全链路开源策略,发布了模型权重、代码、后训练工具链,确保开发者不仅能获取模型,还能进行优化调优。

这种开放态度为行业提供了持续迭代的土壤,让更多从业者可以在LingBot-VLA基础上继续前进。

开源模式也扩大了验证面,让具身智能的迭代速度更接近AGI需要的’规模化试错’要求。

LingBot-VLA的意义不仅在于性能超越,更在于为’通过扩展真实数据实现更强泛化’提供了扎实实证。尽管当前模型在GM-100上的平均成功率未超过20%,离真正的跨本体泛化还有距离,但它已为行业指明了方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐