为解决机器人操作数据稀缺的难题,CLAP框架提出了一种创新方案。它利用海量的互联网人类视频,通过对比学习技术,将视觉信息与机器人可执行的物理动作空间对齐,为高效学习机器人操作技能提供了全新的、可扩展的范式。
智能速览
CLAP框架通过对比学习对齐人类视频视觉与机器人动作空间。
利用Act-VAE与VD-VAE模型,有效量化动作并过滤视觉噪音。
采用CLAP-NTP和CLAP-RF双模型,分别处理指令跟随和精密操作。
引入知识匹配正则化,防止模型在微调时遗忘预训练知识。
精华内容
如何让机器人像人一样学习?CLAP框架通过连接人类视频与机器人动作,开辟了一条数据高效的新路径。
核心思想
CLAP框架的精髓在于利用对比学习,将人类视频中提取的视觉过渡与机器人轨迹的物理动作空间进行精准对齐。
这种方法能有效过滤背景干扰、物体形变等无关视觉噪音,确保学习到的表示更纯粹地编码了操作技能本身,从而显著提升机器人执行任务的准确性与泛化能力。
动作量化
为实现视觉与动作的对齐,CLAP采用了Act-VAE和VD-VAE两种模型。Act-VAE负责将连续的机器人轨迹映射到离散的代码本中,实现了动作空间的高效压缩。
同时,VD-VAE通过对比学习从视频推断动作的视觉动态,强化了视觉特征与物理控制动作之间的强关联,让模型理解“看到”与“做到”的联系。
双模型架构
CLAP框架包含CLAP-NTP和CLAP-RF两种互补的模型。CLAP-NTP是一个自回归模型,擅长处理高层次指令跟随和对象泛化任务,具备强大的推理规划能力。
而CLAP-RF则基于Rectified Flow,专注于实现高速、精确的控制策略,在折叠衣物、包装礼物等需要精细操作的任务中表现尤为出色。
防止遗忘
在模型微调阶段,CLAP引入了知识匹配(KM)正则化策略。该策略通过固定部分预训练知识,有效防止了模型在学习新任务时出现灾难性遗忘问题。
这使得CLAP在掌握新技能的同时,能够保留从大规模数据中学到的通用视觉和语言知识,维持了模型的综合性能。
CLAP框架为解决机器人数据瓶颈提供了有效思路,其利用海量人类视频进行学习的方法极具前景。未来,这种学习范式能否进一步降低机器人训练成本,让高级操作技能的普及成为可能?