Lingbot-VA模型提出了一种新范式,它将视频预测与动作生成融为一体,直接同步输出。这种方法相比先预测画面再推导动作的旧路径,以及用语言对齐的VLA模型,展现出显著优势,为具身智能发展提供了新思路。
智能速览
Lingbot-VA将视频预测与动作生成同步输出,实现一体化。
模型采用闭环rollout机制,每一步都基于真实画面反馈。
视觉对齐动作的VA模型性能,已超越语言对齐的VLA模型。
通过KV-cache和异步流水线技术,实现了边计算边动作的并行处理。
精华内容
要理解Lingbot-VA的突破,关键在于其独特的融合生成机制与工作流程。
一体化生成
Lingbot-VA的核心创新在于其“一体化”生成逻辑。传统方法如Mimic,是先独立预测未来的视频帧,再从生成的视频中逆向推导出机器人应有的动作,这是一个两步走的分离过程。Lingbot-VA则跳过了这个中间步骤,在观察到当前画面后,模型直接并同时输出对未来画面的预测和对当前时刻应执行动作的判断,两者被“拧”在一起输出,极大地提升了效率与连贯性。
实时反馈
该模型的工作流程是一个动态的闭环系统。它并非一次性生成长达数秒的完整动作序列,而是采用分段式生成。机器人执行一小段动作后,会立即观测真实世界的新画面,并将这个真实的反馈信息作为下一步预测和动作生成的依据。
这种每一步都基于真实环境状态进行调整的“闭环rollout”模式,确保了动作的精准性和对环境变化的强适应性。
技术优化
为了实现高速运行,Lingbot-VA在工程上采用了KV-cache与异步流水线技术。这意味着当模型正在进行下一步计算的复杂运算时,机器人已经可以开始执行当前步骤的动作,形成了计算与执行的并行流水线,显著降低了延迟。
最终,凭借这种视觉端到端的对齐方式,Lingbot-VA为代表的视觉-动作(VA)模型,在性能上全面超越了依赖语言作为中间桥梁的传统视觉-语言-动作(VLA)模型。
Lingbot-VA的同步生成范式,为具身智能的实时交互提供了更高效的解决方案。这是否预示着纯视觉端到端模型将成为主流?值得期待。