具身智能领域迎来新突破,上科大推出的UniHM框架解决了灵巧手操控数据稀缺的难题。该技术无需昂贵的真机数据,仅从人类操作视频学习,即可在语言指令下控制不同形态的灵巧手完成复杂任务,展现了极强的泛化能力和实用性。
智能速览
ICLR 2026接收,上科大YesAI Lab研发
无需真机数据,仅靠HOI视频训练
共享VQ-VAE码本实现跨手型泛化
物理引导精炼,提升动作执行成功率
真实世界任务表现超越多项强基线
精华内容
UniHM通过构建统一的离散动作空间,打通了从视频到机器人动作的转化路径,其核心技术架构极具创新性。
跨形态统一码本
传统方法难以应对不同形态的灵巧手,UniHM引入了共享VQ-VAE码本,将MANO模型及多种机器人手映射到同一离散动作空间。
这种设计使得动作Token可复用、可迁移,新手型只需通过蒸馏对齐即可接入训练,极大提升了模型在不同手型间的泛化能力,无需针对每种手型重新采集数据。
视觉语言生成
在动作生成阶段,框架采用了感知与生成解耦的架构。CLIPort模块负责从RGB-D图像和指令中估计目标轨迹,PointSAM负责分割目标物体点云。
随后,专门的DexHand VLM根据这些信息生成Token序列并解码为关节轨迹。训练过程中采用了渐进式掩码策略,有效降低了exposure bias,提高了生成序列的准确性。
物理动态精炼
为确保生成的动作在物理世界中可行,UniHM设计了一个物理引导的动态精炼模块。该模块将接触约束、生成先验和时间平滑先验转化为能量项。
通过逐帧Gauss-Newton或Levenberg-Marquardt优化算法,系统有效减少了动作穿模现象,稳定了接触状态,并使速度与加速度变化更加顺滑,确保了动作的可执行性。
实测数据表现
在DexYCB与OakInk数据集的测试中,UniHM在seen和unseen设置下的MPJPE、FID等多项关键指标均超过了多种强基线模型。
真实世界实验显示,该框架在抓取、取放、拉推、开合等任务上的成功率显著提升。即便面对未见过的物体,仅通过微调感知模块,模型也能保持较好的操作成功率,降低了数据门槛。
UniHM证明了仅利用视频数据即可实现高质量的机器人操控,为具身智能的发展提供了新思路。未来,随着该技术的进一步优化,灵巧手能否在更复杂的非结构化环境中展现更强的适应能力?