张大妈

LingBot-VLA 具身大模型全面开源

源自公众号:魔搭ModelScope社区

02-04 19:48

具身智能模型的落地成本高昂,泛化能力是关键挑战。LingBot-VLA 的开源,带来了一个在真实评测中性能领先、跨平台迁移能力强的解决方案,有望降低行业门槛,推动技术规模化应用。

LingBot-VLA 具身大模型全面开源智能速览

  • 在GM-100真实评测中,平均成功率领先Pi0.5,跨本体泛化性能突出。

  • 验证了VLA模型在真实数据下的Scaling Law,性能随数据量增长持续提升。

  • 采用可学习查询对齐机制,高效融合深度信息,提升操作鲁棒性。

  • 后训练效率是主流框架的1.5~2.8倍,显著降低数据与算力成本。

  • 模型、代码、数据集与评测基准全部开源,旨在加速技术迭代与应用。

LingBot-VLA 具身大模型全面开源精华内容

LingBot-VLA 的强大性能并非偶然,其背后是大规模真实数据预训练与前沿技术创新的坚实支撑。

性能评测领先

在上海交通大学的具身评测基准GM-100中,LingBot-VLA在三种真实机器人平台上的跨本体泛化平均成功率达到了15.7%(不含深度信息),优于Pi0.5的13.0%。当引入深度信息后,成功率进一步提升至17.3%,展现了模型强大的准确性与泛化能力。

在高强度环境干扰的RoboTwin 2.0仿真基准评测中,LingBot-VLA凭借其可学习查询对齐机制,操作成功率比Pi0.5提升了9.92%,实现了从仿真到真机落地的全方位性能领跑。

数据规模定律

为解决具身智能模型落地成本高、泛化性差的难题,团队首次系统研究了VLA模型在真实机器人任务上的Scaling Law。实验发现,随着预训练数据规模从3000小时增长至20000小时,模型在下游任务的成功率持续显著提升,且在20000小时数据量时性能仍呈上升趋势。

基于此发现,团队构建了覆盖9种主流双臂机器人构型的20000小时真实世界训练数据,为模型强大的通用操控能力奠定了基础。

深度信息融合

为了提升机器人在复杂环境中的操控鲁棒性,LingBot-VLA采用了一种基于查询向量的深度蒸馏方法。该方法引入与三视角操作图像对应的可学习queries,经过视觉语言模型处理后,与LingBot-Depth输出的深度嵌入向量进行对齐。

这种设计在维持训练与推理效率的同时,显式地将深度信息有效集成到模型中,显著增强了机器人的空间感知能力与操作成功率。

开源与高效实用

LingBot-VLA不仅提供模型权重,还开源了包含数据处理、高效微调及自动化评估的全套代码库,以及GM-100基准测试。此举旨在降低行业研发的算力与时间门槛,助力开发者快速适配自有场景。

在效率方面,其后训练工具链在8卡GPU下实现了单卡每秒261个样本的吞吐量,训练效率达到主流框架的1.5至2.8倍。目前,该模型已与星海图、松灵、乐聚等机器人厂商完成适配,验证了其跨本体迁移的实用性。

LingBot-VLA的开源,通过提供高性能、高效率且易于适配的具身大模型,有效降低了技术落地的门槛。这不仅是技术的进步,更是推动整个行业走向可复制、可规模化发展的关键一步。当模型能力不再受限于高昂的定制成本,具身智能的未来应用将有哪些可能?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐