张大妈

智元机器人发布新VLA架构ACoT-VLA,性能超越π0

源自新浪微博:星河频率

01-21 20:31

智元机器人团队提出的全新ACoT-VLA架构,为机器人精准执行动作提供了新思路。该架构通过引入动作思维链,并结合显式与隐式动作推理器,显著提升了机器人在复杂任务中的表现,为具身智能的发展带来了实质性突破。

智元机器人发布新VLA架构ACoT-VLA,性能超越π0智能速览

  • 智元机器人提出新型ACoT-VLA架构。

  • 该架构将动作思维链与VLA模型相结合。

  • 通过显式与隐式推理器提升动作精准度。

  • 在LIBERO等数据集上准确率超过98%。

  • 整体性能表现优于π0和π0.5模型。

智元机器人发布新VLA架构ACoT-VLA,性能超越π0精华内容

ACoT-VLA架构的核心创新,在于其独特的双路动作推理机制。这一设计让机器人不仅在“看”和“听”,更在“思考”如何行动,从而实现了从感知到执行的精准转化。

架构创新

该架构的最大亮点是引入了动作思维链(Action Chain-of-Thought)。它不再是简单地从输入直接映射到输出,而是在中间增加了一个显式的推理步骤。这种设计模拟了人类在执行复杂动作前进行规划和思考的过程,使得机器人的决策过程更具逻辑性和可解释性,为精准动作执行奠定了理论基础。

双路推理

ACoT-VLA包含两个核心组件:显式动作推理器(EAR)和隐式动作推理器(IAR)。EAR负责提出一个粗略的动作轨迹作为参考,如同一个宏观的规划;而IAR则从多模态数据中提取潜在的动作先验,进行微调。两者相互补充,一个主攻宏观规划,一个负责微观优化,共同构成了完整的动作认知过程。

性能实测

在严格的基准测试中,ACoT-VLA展现了卓越的性能。在LIBERO数据集上,其准确率高达98.5%,在更具挑战性的LIBERO-Plus上也达到了84.1%。即便是在综合性的VLABench数据集中,该模型也取得了47.4%的准确率。这些数据均超越了同期的π0和π0.5模型,证明了其在真实世界和仿真环境中的优越性与泛化能力。

智元机器人的ACoT-VLA架构,通过巧妙融合思维链与VLA模型,有效解决了机器人动作执行的精准度难题。这项技术突破不仅为具身智能研究开辟了新路径,也为未来更智能、更可靠的机器人进入日常生活和工作场景铺平了道路,其应用前景值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐