张大妈

无需真机数据,UniHM实现跨本体灵巧手操控统一

源自抖音:石野-YesAI

02-13 10:26

具身智能领域迎来新突破,上科大推出的UniHM框架解决了灵巧手操控数据稀缺的难题。该技术无需昂贵的真机数据,仅从人类操作视频学习,即可在语言指令下控制不同形态的灵巧手完成复杂任务,展现了极强的泛化能力和实用性。

无需真机数据,UniHM实现跨本体灵巧手操控统一智能速览

  • ICLR 2026接收,上科大YesAI Lab研发

  • 无需真机数据,仅靠HOI视频训练

  • 共享VQ-VAE码本实现跨手型泛化

  • 物理引导精炼,提升动作执行成功率

  • 真实世界任务表现超越多项强基线

无需真机数据,UniHM实现跨本体灵巧手操控统一精华内容

UniHM通过构建统一的离散动作空间,打通了从视频到机器人动作的转化路径,其核心技术架构极具创新性。

跨形态统一码本

传统方法难以应对不同形态的灵巧手,UniHM引入了共享VQ-VAE码本,将MANO模型及多种机器人手映射到同一离散动作空间。

这种设计使得动作Token可复用、可迁移,新手型只需通过蒸馏对齐即可接入训练,极大提升了模型在不同手型间的泛化能力,无需针对每种手型重新采集数据。

视觉语言生成

在动作生成阶段,框架采用了感知与生成解耦的架构。CLIPort模块负责从RGB-D图像和指令中估计目标轨迹,PointSAM负责分割目标物体点云。

随后,专门的DexHand VLM根据这些信息生成Token序列并解码为关节轨迹。训练过程中采用了渐进式掩码策略,有效降低了exposure bias,提高了生成序列的准确性。

物理动态精炼

为确保生成的动作在物理世界中可行,UniHM设计了一个物理引导的动态精炼模块。该模块将接触约束、生成先验和时间平滑先验转化为能量项。

通过逐帧Gauss-Newton或Levenberg-Marquardt优化算法,系统有效减少了动作穿模现象,稳定了接触状态,并使速度与加速度变化更加顺滑,确保了动作的可执行性。

实测数据表现

在DexYCB与OakInk数据集的测试中,UniHM在seen和unseen设置下的MPJPE、FID等多项关键指标均超过了多种强基线模型。

真实世界实验显示,该框架在抓取、取放、拉推、开合等任务上的成功率显著提升。即便面对未见过的物体,仅通过微调感知模块,模型也能保持较好的操作成功率,降低了数据门槛。

UniHM证明了仅利用视频数据即可实现高质量的机器人操控,为具身智能的发展提供了新思路。未来,随着该技术的进一步优化,灵巧手能否在更复杂的非结构化环境中展现更强的适应能力?

精选参考来源

仅从视频学习的跨本体灵巧手操控统一框架 不依赖真机数据、仅从 HOI 视频学习,即可在自由语言指令下统一生成跨形态灵巧手操作的框架UniHM!该工作已被ICLR 2026接收。 上科大YesAI Lab的工作:UniHM: Unified Dexterous Hand Manipulation with Vision Language Model,把统一动作离散码本 + 视觉语言动作模型 + 物理引导动态精炼串成一条完整流水线:从 RGB-D + 指令 直接到 可执行的灵巧手关节轨迹,还能跨不同手型泛化到新形态与新物体。 📌 论文标题:UNIHM: Unified Dexterous Hand Manipulation with Vision Language Model 📌 论文链接:openreview.net/forum?id=cVX3VqO8BO 🔬 核心技术亮点 • 统一灵巧手Tokenizer(跨形态共享码本):用共享 VQ-VAE 码本把不同手(MANO/多种机器人手)映射到同一离散动作空间,token 可复用、可迁移;新手型通过蒸馏对齐再接入训练(提升跨手泛化)。 • VLM 驱动的序列级操作生成:采用“感知-生成解耦”架构: CLIPort 从 RGB-D + 指令估计目标轨迹,PointSAM 分割目标物体点云,再由 DexHand VLM 生成 token 序列并解码为关节轨迹(训练中用 progressive masking 降低 exposure bias)。 • 物理引导动态精炼(生成后再变得可执行):把接触约束 + 生成先验 + 时间平滑先验写成能量项,逐帧 Gauss–Newton/LM 优化,减少穿模、稳定接触、速度/加速度更顺滑。 🚀 实测表现 • 指标更强:在 DexYCB 与 OakInk 的 seen/unseen 设置下,MPJPE/FID 等多项指标超过多种强基线。 • 真机更能打:真实世界任务(抓取、Pick&Place、拉推、开合)成功率显著提升,且对未见对象也保持较好成功率。 • 不靠昂贵遥操作数据:仅用人类 HOI 视频数据训练主模型,降低数据门槛,还能通过只微调感知模块应对场景分布变化。 #灵巧手 #具身智能 #机器人 #多模态人工智能 #上海科技大学
内容由AI生成

精选参考来源

仅从视频学习的跨本体灵巧手操控统一框架 不依赖真机数据、仅从 HOI 视频学习,即可在自由语言指令下统一生成跨形态灵巧手操作的框架UniHM!该工作已被ICLR 2026接收。 上科大YesAI Lab的工作:UniHM: Unified Dexterous Hand Manipulation with Vision Language Model,把统一动作离散码本 + 视觉语言动作模型 + 物理引导动态精炼串成一条完整流水线:从 RGB-D + 指令 直接到 可执行的灵巧手关节轨迹,还能跨不同手型泛化到新形态与新物体。 📌 论文标题:UNIHM: Unified Dexterous Hand Manipulation with Vision Language Model 📌 论文链接:openreview.net/forum?id=cVX3VqO8BO 🔬 核心技术亮点 • 统一灵巧手Tokenizer(跨形态共享码本):用共享 VQ-VAE 码本把不同手(MANO/多种机器人手)映射到同一离散动作空间,token 可复用、可迁移;新手型通过蒸馏对齐再接入训练(提升跨手泛化)。 • VLM 驱动的序列级操作生成:采用“感知-生成解耦”架构: CLIPort 从 RGB-D + 指令估计目标轨迹,PointSAM 分割目标物体点云,再由 DexHand VLM 生成 token 序列并解码为关节轨迹(训练中用 progressive masking 降低 exposure bias)。 • 物理引导动态精炼(生成后再变得可执行):把接触约束 + 生成先验 + 时间平滑先验写成能量项,逐帧 Gauss–Newton/LM 优化,减少穿模、稳定接触、速度/加速度更顺滑。 🚀 实测表现 • 指标更强:在 DexYCB 与 OakInk 的 seen/unseen 设置下,MPJPE/FID 等多项指标超过多种强基线。 • 真机更能打:真实世界任务(抓取、Pick&Place、拉推、开合)成功率显著提升,且对未见对象也保持较好成功率。 • 不靠昂贵遥操作数据:仅用人类 HOI 视频数据训练主模型,降低数据门槛,还能通过只微调感知模块应对场景分布变化。 #灵巧手 #具身智能 #机器人 #多模态人工智能 #上海科技大学

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐