张大妈

生成式世界模型

源自小红薯:具身智能观察猿

02-04 18:57

具身智能领域长期面临视觉预测与动作规划的脱节问题。AstraNav-World模型提出了一种统一方案,通过将二者深度耦合在单一概率框架中,实现了更为高效和一致的环境交互,为机器人的自主导航提供了全新思路。

生成式世界模型智能速览

  • AstraNav-World提出统一生成式世界模型框架。

  • 其核心是将视觉预测与动作规划深度耦合。

  • 模型包含VLM规划器、视频生成器和动作政策头三大组件。

  • VLM规划器负责全局高层推理与语义理解。

  • 视频生成器基于规划生成物理一致的未来视觉帧。

  • 动作政策头将规划转化为轻量化、确定性的动作指令。

生成式世界模型精华内容

该模型的精妙之处在于其组件间的协同工作,下面将深入解析其核心架构与训练策略。

全局推理大脑

AstraNav-World的首个核心组件是VLM规划器,它扮演着全局推理中枢的角色。该模块接收自然语言指令(例如“前往客厅沙发旁”)和历史视觉观测序列作为输入,进行统一的语义与空间上下文理解。其输出是包含目标导向语义特征和空间上下文特征的视觉-语言嵌入,为后续的视觉生成和动作规划提供高层指导。此规划器基于Qwen-2.5-VL-3B模型构建,经过大规模数据和导航任务预训练,确保了通用性与专业性的平衡。

未来视觉生成

第二个核心组件是VLM条件视频生成器,其任务是根据VLM规划器的全局指导,生成与任务相关且物理规律一致的未来视觉帧。该生成器基于Wan2.2-TI2V-5B扩散模型架构,内部集成了时空变分自编码器(ST-VAE)和扩散Transformer(DiTs)。ST-VAE负责将高分辨率视频压缩为紧凑的潜在表示,实现高达16倍的空间压缩和4倍的时间压缩。在处理多视角输入时,模型通过3D-RoPE重排技术将不同视角的图像沿宽度轴拼接,有效保持了时空对齐,确保了生成视频的连贯性。

动作决策输出

最后,动作政策头负责将高级语义规划转化为具体的机器人动作序列。该模块采用确定性动作生成策略,结构上是一个轻量级的基于查询的Transformer,包含5个可学习查询向量和4层编码器。这种设计确保了决策的高效性,能够快速输出精确的行动指令。其训练目标是通过多目标加权损失函数来优化,从而平衡导航任务的多种要求,如路径效率、避障安全性等,是连接虚拟规划与现实行动的关键桥梁。

AstraNav-World模型通过其统一框架和组件化设计,有效解决了具身智能中预测与规划脱节的难题,展现了生成式模型在复杂任务中的巨大潜力。这种技术路径的成熟,或将加速更智能、更自主的机器人进入现实应用。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐