张大妈

视觉运动策略中需要本体感受状态吗?

源自知乎:黄浴

01-23 20:45

机器人视觉运动策略的空间泛化能力一直是个难题。传统方法依赖视觉与本体感受状态的结合,却常因过拟合而无法适应新环境。一项新研究提出颠覆性的“无状态策略”,通过移除状态输入,仅依靠视觉观察来预测动作,显著提升了机器人在现实世界中的泛化能力与实用性。

视觉运动策略中需要本体感受状态吗?智能速览

  • 传统视觉运动策略依赖本体感受状态,易导致过拟合和空间泛化差。

  • 研究提出“无状态策略”,移除状态输入,仅凭视觉信息预测动作。

  • 该策略结合相对末端执行器动作空间和双广角摄像头实现。

  • 实测显示,无状态策略空间泛化成功率最高可达85%,远超传统方法。

  • 新方法在数据效率和跨机器人形态适应性上也展现出优势。

视觉运动策略中需要本体感受状态吗?精华内容

当机器人被剥离“本体感觉”,仅靠双眼去理解和操作世界时,会发生什么?一项新研究给出了惊人答案,并可能重塑我们对机器人操控的认知。

泛化难题的现状

基于模仿学习的视觉运动策略是当前机器人操控的主流,它将机器人摄像头捕捉的视觉与自身的本体感受状态(如关节角度)相结合,以实现精确控制。然而,这种做法存在一个核心缺陷:本体感受状态为策略提供了一条“捷径”。策略无需深入理解视觉信息,只需记住在特定状态下应执行的动作即可。这导致策略对训练轨迹产生严重过拟合,当任务空间布局发生微小变化(如物体位置偏移或桌面高度调整),其性能便会急剧下降,泛化能力十分有限。

为提升泛化能力,学界尝试了多种方法,如收集海量多样化数据、在模拟中训练或引入复杂算法。但这些方案要么成本高昂,要么效果受限于模拟与现实的差距,均未能提供简单而高效的解决方案。

无状态策略核心

该研究的核心思想是彻底移除本体感受状态输入,迫使策略完全依赖视觉进行推理和决策。为了实现这一点,策略构建在两个关键技术之上。首先是采用“相对末端执行器(EEF)动作空间”。策略不预测机械臂的绝对位置,而是预测相对于当前位置的位移量(Δp_t)。这意味着,只要视觉输入相同,无论机器人身处何地,其输出的动作位移都相同,从而天然具备空间不变性,从根本上支持了泛化能力。这与依赖当前关节位姿的“相对关节角度动作空间”形成鲜明对比,后者在不同空间布局下会产生错误的物理位移。

视觉信息的革新

既然完全依赖视觉,就必须确保策略能接收到“完整的任务观察”。传统的单摄像头或窄视野摄像头无法提供足够的环境信息。为此,研究团队设计了创新的视觉系统:在机械臂末端执行器的顶部和底部各安装一个广角摄像头,提供高达120°×120°的视野。这种双广角腕式摄像头组合能够全面覆盖工作区域,甚至包括传统视野盲区的机械臂下方,确保策略掌握任务相关的所有视觉信息。研究还发现,移除高架摄像头能进一步增强泛化能力,证明了末端视角的重要性。

实测性能飞跃

研究团队在拾取放置、高难度衬衫折叠以及复杂的全身操控等多个现实世界任务中对无状态策略进行了严格测试。训练数据均在固定的空间布局下收集,以证明泛化能力源于策略本身。结果令人振奋:在高度泛化测试中(如改变桌面高度),无状态策略的平均成功率从传统方法的0%跃升至85%;在水平泛化测试中(移动物体位置),成功率从6%大幅提升至64%。这一跨越多种机器人形态的显著性能提升,证明了其在数据效率和跨形态适应性方面的巨大优势,极大地增强了其在真实部署中的实用价值。

这项研究不仅为解决机器人空间泛化难题提供了一种更简单、更经济的思路,更挑战了“本体感受状态不可或缺”的传统认知。它证明了通过精巧的动作空间设计和充分的视觉信息,机器人完全可以仅凭视觉实现强大的泛化能力。这项发现是否会引领下一代更灵活、适应性更强的机器人,让我们拭目以待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐