Green-VLA是一项旨在打造通用ist机器人的新技术,它通过独特的分阶段训练策略和精细的数据管理,解决了机器人模型在多样化任务和本体上泛化的难题。其价值在于提供了一套从数据处理到模型执行、再到自我纠错的完整技术框架,为构建更强大、更普适的机器人智能体提供了新思路。
智能速览
Green-VLA采用分阶段训练,先用互联网视频再用机器人数据,逐步提升模型能力。
通过数据增广、清洗和动态加权,有效提升了训练数据的质量和利用效率。
模型架构结合了VLM任务拆解和VLA动作执行,实现了复杂任务的自主规划。
创新性地设计了统一动作编码和多频率训练,使模型能适应不同机器人与控制需求。
引入状态纠正和JPM引导机制,显著提升了模型在真实环境中的动作精准度和鲁棒性。
精华内容
构建一个能处理万千任务的通用机器人,关键在于如何高效地利用海量异构数据,并让模型在执行中保持精准与稳健。Green-VLA正是围绕这一核心挑战,提出了一套系统性的解决方案。
分阶段训练策略
Green-VLA的训练分为多个阶段,循序渐进地提升模型能力。L1阶段利用2400万互联网视频样本,为模型提供丰富的视觉和动作先验知识。随后的R0阶段则引入1.84亿机器人交互数据,包含人形和桌面机器人操作,并继续沿用L1数据,实现了从宏观观察到具体操作的过渡。
团队对自采的Green Humanoid数据进行了创新性增广,包括图像与状态的左右镜像翻转,以及对物理可逆任务进行时序逆序处理,有效扩充了数据集。更重要的是,数据清洗和筛选流程会评估视觉和本体状态的多样性、图像清晰度及状态抖动程度,并据此为不同数据集分配动态权重,确保模型在训练后期更侧重于高质量数据。
双层模型架构
该模型采用双层架构,顶层是一个未经训练的GigaVision/GigaChat VLM,负责理解语音或文字指令,判断任务是否涉及机器人运动。若涉及,则将复杂任务拆解为一系列语言描述的子任务。
底层则是一个约40亿参数的VLA模型,主干采用PaliGemma。它接收RGB图像、本体状态、语言指令和控制方式,通过flow-matching action expert输出统一的动作编码。在执行过程中,模型会实时预测子任务的完成进度(p_complete),当该值超过0.98时,会交由顶层的VLM进行视觉确认,通过后再进入下一个子任务,形成了一个高效的“规划-执行-确认”闭环。
统一动作空间
为解决不同数据集和机器人间的动作差异,Green-VLA构建了一个64维的统一状态空间。每个数据集的动作都会通过一个可学习的映射函数转换到这个统一空间,并用特定的mask来标识有效维度,从而让单一模型能学习多种控制模式。
此外,模型还能适应不同控制频率。它通过统计腕部相机光流幅度来评估动作速度,并使用可采样的速度因子对策略进行加速或减速。慢速控制更精细,适合抓取等操作;快速控制则能提升整体执行效率。这种设计赋予了模型在不同场景下动态调整行为节奏的能力。
鲁棒性与强化学习
为确保在真实世界中的稳定运行,Green-VLA引入了状态纠正机制。模型会实时检测当前本体状态是否超出训练数据的分布(即OOD),若超出,则会将状态投射回训练数据中出现过的最接近状态,防止因意外扰动导致策略失效。
在强化学习方面,研究结合了两种方法。一种是先通过保守的IQL学习Q函数,再将表现好的轨迹用于SFT微调;另一种是固定VLA模型,让flow matching的初始噪声由一个额外的策略网络生成。这些方法共同增强了策略学习的稳定性和最终表现。
Green-VLA通过对数据、模型和训练方法的系统性创新,展示了构建更通用、更可靠机器人智能体的可行路径。它不仅强调了高质量数据和分阶段学习的重要性,也为解决机器人技术中的泛化和鲁棒性难题提供了具体方案。未来,这类方法能否进一步降低对特定机器人数据的依赖,值得期待。