如何让机械手拥有人类般的操作灵活性?一项研究通过视触觉多模态学习的两阶段框架,有效解决了机器人手在精细操作中的挑战。该方案不仅在训练任务中表现优异,更在未见任务上展现出强大的泛化能力,为具身智能的发展提供了新思路。
智能速览
提出视触觉预训练与在线多任务学习的两阶段框架。
硬件采用Shadow Hand与低成本触觉传感器,总成本约250美元。
训练任务平均成功率约85%,未见任务泛化成功率达70%至90%。
系统在光照变化下的表现显著优于纯视觉模型。
未来计划引入多模态触觉与元学习,以实现零样本操作。
精华内容
这项研究的核心在于模仿人类学习过程,将视觉与触觉信息深度融合,从而实现了跨越性的技术突破。
两阶段学习框架
该框架首先通过视触觉预训练,利用人类佩戴触觉手套的视频数据进行自监督学习,引入类IPL神经元结构的集成标记来融合多模态信息,并通过掩码恢复任务增强模态间的互补性。
随后,系统进入在线多任务策略学习阶段,融合预训练表征与任务标识符,构建统一策略。通过实时采集策略状态并查询专家策略进行监督,有效缓解了传统模仿学习中的观察漂移问题,提升了训练稳定性。
实验系统验证
实验硬件平台采用Shadow Hand灵巧手,配合单目RGB摄像头与总成本仅约250美元的低成本压阻触觉传感器。
训练任务涵盖了瓶盖拧转、杠杆滑动、桌面重定向等5类复杂操作。为了评估泛化能力,研究人员还设计了削铅笔、拧螺丝等3类未见任务进行测试,并考察了系统在不同传感器与光照条件下的表现。
性能数据亮点
实验数据显示,该系统在训练任务上的平均成功率约为85%。更值得关注的是,在未见过的任务上,其泛化成功率达到了70%至90%的高水平。
此外,该系统在不同类型的触觉传感器上表现出一致性,并且在光照变化的条件下,其鲁棒性显著优于仅依赖视觉的模型,证明了视触觉融合的有效性。
未来技术路径
当前研究主要采用二值化的触觉信号,未来计划引入力矢量、纹理、温度等多模态触觉表征,以提升对软体或易变形物体的操作能力。
同时,研究将从Shadow Hand扩展至更多构型的机械手,探索表征迁移机制。长远目标是结合大模型或元学习,实现对新物体、新任务的零样本快速操作。
这项研究以低成本硬件实现了高泛化能力的灵巧操作,为具身智能领域带来了实质性的突破。视触觉融合与在线学习范式,不仅展示了当前技术的高度,也为未来机器人在复杂真实环境中的应用指明了方向。当机械手能像人一样学习与适应,我们的生产和生活方式将被如何改写?