张大妈

蚂蚁vla力作:lingbot-va

源自小红薯:Purshow

02-13 13:42

一项名为LingBot-VA的视频-动作世界模型被提出,它通过自回归框架将视频与动作统一,实现了’想象到行动’的跨越。该模型在仿真和真实任务中均展现出顶尖的性能与泛化能力,为具身智能的发展提供了新的技术路径,解决了长程任务执行中的关键难题。

蚂蚁vla力作:lingbot-va智能速览

  • 基于Flow Matching的自回归框架,统一了视频与动作的生成。

  • 采用Mixture-of-Transformers架构,共享注意力并保持模态独立。

  • 通过异步推理技术,实现了计算与执行的并行,大幅降低延迟。

  • 在RoboTwin仿真环境中首次突破90%的任务成功率。

  • 真机测试在长程任务上表现出色,远超基线模型pi05。

蚂蚁vla力作:lingbot-va精华内容

LingBot-VA的核心创新在于构建了一个能够理解和生成动作的视频世界模型,它如何通过精巧的设计实现实时控制与长程记忆,是理解其技术突破的关键。

统一生成框架

模型的核心是一个基于Flow Matching的自回归框架,它将视频和动作两种模态的数据统一到同一个潜在的向量空间中。

通过交替生成视频Token和动作Token,模型能够预测接下来的视频画面以及需要执行的动作,真正实现了从“想象”到“执行”的连贯推理。

为处理两种模态的特性,模型采用了Mixture-of-Transformers(MoT)设计。该架构让不同模态的Transformer共享注意力机制,同时保持各模态的独立处理能力,确保了信息融合的效率和准确性。

异步推理加速

针对大模型普遍存在的推理延迟问题,LingBot-VA设计了Asynchronous Inference(异步推理)机制。

该技术将模型的计算过程与机器人的实际执行过程分离开来。当模型在计算下一个动作序列时,机器人可以同时执行当前已计算出的动作,实现了计算与执行的并行处理。

这种设计极大地降低了端到端的延迟,使得机器人在与现实世界交互时能够做出更快的响应,这是实现在复杂动态环境中流畅控制的关键。

性能突破验证

LingBot-VA的性能在多项测试中得到了验证。在标准的RoboTwin仿真环境中,该模型首次达到了超过90%的任务成功率,这是一个显著的里程碑。

在更具挑战性的真实机器人测试中,LingBot-VA展现了强大的长程记忆和泛化能力。例如在“做早餐”这样的长程任务中,它能够连贯地完成多个步骤,同时在“叠衣服”等处理可变形物体的任务上也表现出色。

与基线模型pi05相比,LingBot-VA在长程高精度任务上的表现优势非常明显,提升幅度巨大。

LingBot-VA通过统一架构和异步推理,为具身智能的实时控制与长程规划提供了有效解决方案,其出色的泛化能力预示着更广阔的应用前景。这或许意味着,我们离让机器人像人一样理解和完成复杂任务又近了一步。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐