具身智能的核心挑战之一,是如何让人形机器人在复杂环境中长时间自主交互。北大团队提出的LESSMIMIC方案,通过创新的距离场表示,摆脱了对特定物体几何和参考运动的依赖,实现了单一策略下的多技能泛化与组合,为机器人走向非结构化真实世界铺平了道路。
智能速览
传统人形机器人交互方法依赖特定参考,难以泛化。
LESSMIMIC利用距离场提取几何线索,无需运动参考。
该方案可通过蒸馏实现纯视觉部署,无需动捕设备。
单一策略在尺度变化物体上成功率超80%,支持多达40个连续任务。
该方法为机器人实现通用交互和故障恢复提供了新思路。
精华内容
人形机器人如何像人一样,不依赖特定指令就能与环境长久互动?LESSMIMIC方案给出了答案,它通过一种统一的几何表示,解锁了机器人的通用交互能力。
破除局限
当前人形机器人的交互策略多依赖于预设的参考运动或特定任务的奖励机制,这导致其与特定物体的几何结构被“强行绑定”。当面对形状、大小迥异的新物体时,这种策略便会失效,无法在统一的框架下实现多技能的泛化。要实现真正的具身智能,就必须打破这种强耦合关系。
几何线索
LESSMIMIC的核心创新在于引入了距离场(DF)作为统一的交互表示。它能从环境中提取出关键的几何线索,如物体表面距离、梯度以及速度分解信息。这些线索被用于条件化一个单一的全身控制策略,从而摆脱了对运动参考数据的依赖。交互的隐变量则通过变分自编码器(VAE)进行编码,再结合对抗交互先验(AIP)进行强化学习后训练,显著提升了策略的稳定性和泛化能力。
泛化实测
为了让方案更具实用性,研究团队采用了一种DAgger式的蒸馏方法,将基于距离场的隐变量与第一人称视觉的深度特征对齐。这意味着LESSMIMIC可以在没有动捕设备的条件下,无缝部署到真实机器人上。实验数据显示,在拾取、坐立等任务中,面对尺度在0.4倍到1.6倍之间变化的物体,单一LESSMIMIC策略的成功率稳定在80%至100%,而基线方法性能则急剧下降。此外,它还能在5个任务实例的轨迹组合上达到62.1%的成功率,并支持多达40个连续的复杂组合任务。
LESSMIMIC通过将交互建立在局部几何之上,而非依赖演示数据,为人形机器人在非结构化环境中的发展指明了方向。它不仅提升了机器人的技能泛化和组合能力,也为未来的故障恢复和自主探索奠定了基础。随着技术成熟,人形机器人走进千家万户还有多远?