如何让机器人像人一样灵巧地操作物体,是具身智能领域的核心难题。DexWM模型为此提供了一种创新方案,它通过融合人类第一视角操作数据与机器人数据,并采用精细的3D手部关键点作为动作表征,显著缩小了人与机器人在操作能力上的差距。
智能速览
核心思路是“人类数据预训练+机器人数据微调+手部关键点表征”。
模型融合了829小时人类灵巧操作视频与100小时机器人数据。
采用42个3D手部关键点的变化来精准刻画动作,远超传统指令。
基于条件扩散Transformer的架构,可直接高效预测未来环境状态。
任务规划采用模型预测控制,优化目标是状态和手部距离最小化。
精华内容
DexWM的突破在于它如何系统性地弥合人类与机器人在“具身”上的鸿沟。其核心是一套精巧的数据策略与动作表征方法,让模型能够真正理解并模仿人类的精细操作。
数据融合之道
DexWM的训练策略巧妙地结合了三类数据。首先,利用包含829小时第一视角视频的EgoDex数据集进行预训练,让模型学习人类如何完成任务。接着,引入100小时的DROID机器人数据,通过“虚拟手部关键点”技术将夹爪动作映射为手部动作,实现领域迁移。最后,在RoboCasa仿真环境中生成4小时的探索性数据,用于微调,以弥合物理形态差异。
精准动作表征
传统方法常用文本或导航指令作为动作,粒度太粗。DexWM的创新在于采用基于MANO模型的3D手部关键点变化作为核心动作表征,每只手21个关键点,双手共42个点,能极其精细地描述手与环境的交互。同时,它还补充了相机的平移与旋转信息(欧拉角),完整捕捉主体运动对观测的影响。
高效模型架构
模型的预测器基于条件扩散Transformer(CDiT),输入历史状态与动作序列后,能直接回归出未来的环境状态,无需迭代去噪,大幅提升了推理效率。环境的状态表征则采用冻结的DINOv2图像编码器,将图像划分为16×28个patch,每个patch提取1024维特征,在保留丰富语义信息的同时,也兼顾了计算效率。
实用任务规划
为了将模型的预测转化为机器人的实际动作,DexWM采用了模型预测控制(MPC)框架。该框架使用交叉熵方法(CEM)来优化未来的动作序列。优化的目标是双重的:既要最小化预测环境状态与目标状态的latent距离,也要最小化机器人末端(虚拟手部关键点)与目标之间的距离,从而生成精确的关节控制指令。
DexWM通过将研究焦点放在“手”这一关键交互媒介上,为具身智能的精细操作任务提供了系统化且行之有效的解决方案。这套方法不仅展现了世界模型在机器人控制领域的巨大潜力,也为未来开发更通用的家庭或工业机器人指明了清晰的技术路径。这种思路能否进一步扩展到更复杂的全身协调任务中?