张大妈

机器人只靠眼睛就能摆物体

源自小红薯:高山流水

03-04 10:52

纽约大学的研究成果EgoPush框架,展示了机器人在仅有第一人称视觉的情况下,精准完成多物体重排任务的能力。该研究突破了传统SLAM和端到端强化学习的局限,为解决长时序空间推理难题提供了新思路,其创新的训练方法和令人信服的实验结果,对移动机器人领域的发展具有重要参考价值。

机器人只靠眼睛就能摆物体智能速览

  • EgoPush框架让机器人仅靠单目视觉即可完成物体重排。

  • 核心创新在于两阶段蒸馏与限制教师视野的设计。

  • 通过分阶段奖励机制,有效解决了长时序信用分配问题。

  • 仿真成功率100%,真实世界零样本迁移成功率高达80%。

  • 研究证实,任务核心挑战在于长时序空间推理而非感知。

机器人只靠眼睛就能摆物体精华内容

让一个仅靠眼睛的机器人将散乱的方块摆成特定形状,看似简单,实则是对机器人空间推理能力的极限考验。EgoPush框架如何巧妙地破解这一难题?

视觉重排的困境

让机器人仅凭面前的摄像头,将散落的方块推成十字形,是一个极具挑战性的任务。机器人面临视野狭窄(仅69度)、物体互相遮挡、场景缺乏参照物等难题。在这种物体不断移动的动态场景下,传统的SLAM技术会因地图构建失败而崩溃,而端到端的强化学习又因为样本效率极低,几乎无法学会完成任务。

两阶段蒸馏策略

EgoPush框架的核心是一种两阶段蒸馏方法。第一阶段,研究人员训练一个使用3D关键点的强化学习教师模型,但关键在于,故意限制其只能观察到摄像头视野内的信息。第二阶段,将教师模型学到的行为策略,蒸馏给一个只使用深度图作为输入的视觉学生模型。在这个过程中,物体被抽象为“当前目标、锚点、障碍物”三组,系统只编码它们之间的相对关系,无需依赖绝对坐标。

视野约束的魔力

EgoPush最精妙的设计,是对教师模型视野的约束。传统做法会给教师模型提供全局信息,这导致它学会了倒退着推物体等“作弊”技巧。然而,学生模型的摄像头朝前,根本看不到后方,导致知识蒸馏后成功率直接归零。EgoPush通过给教师模型加上虚拟FOV限制,逼它学会主动转头确认目标再行动。消融实验证明,使用全局教师蒸馏后成功率为0%,而加了视野约束后,成功率飙升至70.7%。

破解长时序任务

将4个物体依次推到目标位置,是一个超长时序的任务,如何分配信用是个大问题。EgoPush巧妙地将整个任务拆分成多个阶段性的子问题,每个阶段独立计时,完成任务后获得的奖励会乘以剩余时间的比例。这种设计极大加速了学习过程。实验显示,仅依赖最终终端奖励的方法成功率只有16%,而采用完整设计的EgoPush不仅成功率达到98.6%,训练量还仅需前者的一半。

仿真与现实的跨越

EgoPush的实验结果令人瞩目。在简化的仿真任务中,它达到了100%的成功率和100%的到达率。相比之下,所有端到端强化学习基线的成功率均低于1%,即使为它们提供完美的语义分割也无济于事。经典规划方法SIM的成功率也只有19%。这证明了问题核心在于空间推理而非感知。在真实世界中,搭载RealSense相机的TurtleBot3在3米乘3米的场地内,实现了5个彩色方块的十字编队,零样本迁移成功率高达80%,整个过程在2分钟内完成。

EgoPush的成功不仅是技术上的突破,更揭示了机器人自主操作中长时序空间推理的核心地位。这项研究为未来的家庭服务机器人、仓储物流机器人提供了宝贵的思路,或许在不久的将来,我们就能看到它们真正地融入并服务我们的日常生活。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐