张大妈

1月30日,蚂蚁灵波科技开源重磅炸弹:LingBot-VA,全球首个自回归视频-动作世界模型。 不再是死记硬背几万条动作数据,而是像人类一样"先思后行":先在大脑里推演"下一步世界会变成什么样",再输出动作。这就是世界模型走进物理世界的里程碑。#蚂蚁灵波 #具身智能 #pi0.5 #世界模型 #物理ai

源自抖音:Robot_Qu

02-11 13:51

蚂蚁灵波科技开源全球首个自回归视频-动作世界模型LingBot-VA,它让机器人像人一样先在大脑推演世界变化再行动,而非死记硬背数据。这项技术融合了视频生成与机器人控制,在多项高难度任务中显著提升成功率,标志着世界模型向物理世界落地迈出了关键一步。

1月30日,蚂蚁灵波科技开源重磅炸弹:LingBot-VA,全球首个自回归视频-动作世界模型。
不再是死记硬背几万条动作数据,而是像人类一样智能速览

  • LingBot-VA是全球首个自回归视频-动作世界模型,让机器人实现“先思后行”。

  • 真机评测中,其任务成功率相较业界标杆PI0.5平均提升20%。

  • 仅需30-50条演示数据即可适配制作早餐、叠衣物等六大高难度任务。

  • 仿真评测中,在RoboTwin2.0与Libero基准上刷新了成功率记录,最高达98.5%。

  • 采用MoT架构与闭环推演机制,确保动作生成不偏离物理现实。

1月30日,蚂蚁灵波科技开源重磅炸弹:LingBot-VA,全球首个自回归视频-动作世界模型。
不再是死记硬背几万条动作数据,而是像人类一样精华内容

LingBot-VA的核心突破在于它统一了视觉预测和动作推理,让机器人在行动前就能“预见”未来,从而做出更精准的决策,这种能力在复杂的物理交互中显得至关重要。

技术框架突破

LingBot-VA首次提出了自回归视频-动作世界建模框架,将大规模视频生成模型与机器人控制深度融合。模型的核心是Mixer of Transformers架构,通过独特的闭环推演机制,在每一步生成时都会纳入真实世界的实时反馈,确保持续生成的画面与动作序列不偏离物理现实,从而让机器人能够“边推演,边行动”。

实测性能卓越

在真机评测中,LingBot-VA展现了强大的泛化能力。面对制作早餐、拾取螺丝、插入试管、拆快递、叠衣物和叠裤子这三大类六项高难度挑战,仅需30-50条真机演示数据即可完成适配,任务成功率相较业界强基线PI0.5平均提升20%。

在仿真评测中,LingBot-VA在高难度双臂协作基准RoboTwin2.0上首次将成功率提升至超过90%,在长时序终身学习基准Libero上更是达到了98.5%的平均成功率,均刷新了行业记录。

端侧部署优化

为突破大规模视频世界模型在机器人端侧落地的计算瓶颈,LingBot-VA设计了一套高效的推理管线。该管线将动作预测与电机执行并行化处理,同时引入基于记忆缓存的持久化机制与噪声历史增强策略。这些优化使得模型在保持大模型理解深度的同时,大幅降低了推理延迟,具备了真机低延迟控制的响应速度。

构建开源生态

LingBot-VA的开源是蚂蚁灵波科技具身智能战略的一环。它与此前开源的LingBot-World模拟环境、LingBot-VLA智能基座以及LingBot-Depth空间感知模型,共同构成了一套完整的具身智能全栈技术方案。蚂蚁灵波表示将持续通过开源开放,与行业共建具身智能基础能力,加速技术落地与产业应用。

LingBot-VA的开源不仅是技术上的里程碑,也为具身智能的探索提供了新范式。它展示了世界模型在物理世界应用的巨大潜力,期待这一技术能催生出更多创新应用,推动机器人从工具向智能伙伴的演进。未来的机器人会是什么样的?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐