面对机器人执行复杂长时程任务的挑战,HALO模型提出了一种创新的解决方案。它通过模仿人类‘思考-想象-执行’的认知过程,构建了具身多模态思维链,显著提升了机器人在复杂场景下的任务表现与泛化能力,为具身智能发展开辟了新路径。
智能速览
HALO的核心是模仿人类‘思考-想象-执行’的认知推理过程。
模型采用混合专家设计,通过三个独立模块协同处理语言、视觉和动作。
研究团队构建了自动化流程,将机器人轨迹合成为多模态思维链数据。
训练分为预打基础和微调增强两个阶段,确保了通用与专用的结合。
精华内容
HALO模型的创新不仅在于其架构设计,更在于其实现具身推理的独特方式。下面将深入解读其技术内核。
解耦式专家架构
HALO采用混合专家Transformer架构,将能力解耦至三个专门模块。多模态理解专家负责处理语言指令与视觉观察,并进行任务规划;视觉生成专家依据推理结果预测子目标图像,提供精细引导;动作预测专家则基于前两者生成连续动作。
三个模块拥有独立参数,通过共享自注意力机制交互,既发挥各自优势又实现协同。模型通过特殊控制令牌切换专家模式,注意力机制也采用精细化掩码策略以保证信息交互的有效性与安全性。
自动化数据合成
为训练多模态思维链,研究者构建了一套自动化数据合成流程。该流程首先将连续的底层动作序列转化为高层级动作基元描述,再利用大型视觉语言模型作为标注器,根据任务指令生成连贯的任务叙述和第一人称视角的推理过程。
最后,系统会自动为每个子任务选择最后一帧图像作为视觉子目标。这一流程成功地将原始机器人轨迹,自动增强为包含文本推理和视觉子目标的多模态思维链训练数据。
两阶段训练策略
模型训练分为两个阶段。第一阶段是广泛预训练,在混合了视觉问答、第一人称视频和大规模机器人操作数据集上进行,为模型注入多模态理解、视觉生成和基础动作模仿能力。
第二阶段是多模态思维链增强微调,使用合成的思维链数据对模型进行联合优化,使其完整执行‘文本推理→子目标图像生成→动作预测’流程。同时,为避免灾难性遗忘,微调时仍混合部分通用数据,确保了模型能力的平衡。
HALO模型通过将人类的认知推理过程具象化,为解决机器人长时程复杂任务提供了新范式。其架构设计与数据构建方法具有很强的启发性,未来能否在更多真实场景中验证其潜力,值得关注。