张大妈

浙大 | 视触觉多模态学习赋予机械手灵巧度

源自小红薯:小简爱科研

03-01 16:04

如何让机械手拥有人类般的操作灵活性?一项研究通过视触觉多模态学习的两阶段框架,有效解决了机器人手在精细操作中的挑战。该方案不仅在训练任务中表现优异,更在未见任务上展现出强大的泛化能力,为具身智能的发展提供了新思路。

浙大 | 视触觉多模态学习赋予机械手灵巧度智能速览

  • 提出视触觉预训练与在线多任务学习的两阶段框架。

  • 硬件采用Shadow Hand与低成本触觉传感器,总成本约250美元。

  • 训练任务平均成功率约85%,未见任务泛化成功率达70%至90%。

  • 系统在光照变化下的表现显著优于纯视觉模型。

  • 未来计划引入多模态触觉与元学习,以实现零样本操作。

浙大 | 视触觉多模态学习赋予机械手灵巧度精华内容

这项研究的核心在于模仿人类学习过程,将视觉与触觉信息深度融合,从而实现了跨越性的技术突破。

两阶段学习框架

该框架首先通过视触觉预训练,利用人类佩戴触觉手套的视频数据进行自监督学习,引入类IPL神经元结构的集成标记来融合多模态信息,并通过掩码恢复任务增强模态间的互补性。

随后,系统进入在线多任务策略学习阶段,融合预训练表征与任务标识符,构建统一策略。通过实时采集策略状态并查询专家策略进行监督,有效缓解了传统模仿学习中的观察漂移问题,提升了训练稳定性。

实验系统验证

实验硬件平台采用Shadow Hand灵巧手,配合单目RGB摄像头与总成本仅约250美元的低成本压阻触觉传感器。

训练任务涵盖了瓶盖拧转、杠杆滑动、桌面重定向等5类复杂操作。为了评估泛化能力,研究人员还设计了削铅笔、拧螺丝等3类未见任务进行测试,并考察了系统在不同传感器与光照条件下的表现。

性能数据亮点

实验数据显示,该系统在训练任务上的平均成功率约为85%。更值得关注的是,在未见过的任务上,其泛化成功率达到了70%至90%的高水平。

此外,该系统在不同类型的触觉传感器上表现出一致性,并且在光照变化的条件下,其鲁棒性显著优于仅依赖视觉的模型,证明了视触觉融合的有效性。

未来技术路径

当前研究主要采用二值化的触觉信号,未来计划引入力矢量、纹理、温度等多模态触觉表征,以提升对软体或易变形物体的操作能力。

同时,研究将从Shadow Hand扩展至更多构型的机械手,探索表征迁移机制。长远目标是结合大模型或元学习,实现对新物体、新任务的零样本快速操作。

这项研究以低成本硬件实现了高泛化能力的灵巧操作,为具身智能领域带来了实质性的突破。视触觉融合与在线学习范式,不仅展示了当前技术的高度,也为未来机器人在复杂真实环境中的应用指明了方向。当机械手能像人一样学习与适应,我们的生产和生活方式将被如何改写?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐