视觉-语言-动作模型(VLA)训练依赖高质量数据,但人工收集成本高且质量不稳定。港科大提出基于扩散的强化学习框架,自动生成低方差、平滑的轨迹数据,显著提升VLA性能。该方法在复杂任务中超越人类示范,为具身智能提供新思路。
智能速览
Diffusion RL结合扩散模型与强化学习,生成机器人动作轨迹
轨迹更平滑且方差小,优于高斯分布和人类示范数据
在LIBERO 130任务中,VLA成功率提升5-10%
未来可应用于真实机器人,减少人工数据干预
精华内容
扩散强化学习通过建模复杂动作分布,自动生成高质量轨迹,解决VLA训练数据瓶颈。其核心优势在于轨迹平滑性和一致性,显著提升模型泛化能力。
实现原理
Diffusion RL输入机器人感知信息(如本体状态和周围图像),通过扩散过程逐步去噪输出动作。策略网络使用PBO算法,值网络估计预期收益,并采用GAE方法计算梯度损失。环境交互后,仅用任务成功/失败作为稀疏奖励信号,无需额外奖励模型,简化训练流程。
采样阶段使用DDIM等低延迟方法,确保动作质量。数据收集后进行动作块检查,评估轨迹成功率,引导模型学习高效行为。
该框架在LIBERO仿真环境中实现,涵盖130个操作任务,分为5个任务集进行针对性训练。
轨迹优势
扩散模型的高表达能力可建模多模态动作分布,例如抓取物体时支持左偏或右偏轨迹,避免传统高斯分布的单一性。实验显示,Diffusion RL轨迹平滑度指标优于高斯RL和人类示范。
数值分析表明,Diffusion RL轨迹方差更低,意味着模型对物体位置变化更具鲁棒性。人类示范方差较大,行为多样性可能导致VLA学习困惑,而扩散生成的轨迹提供一致信号,提升训练效率。
高频抖动减少50%,避免VLA错误学习细微噪声,确保动作执行稳定性。
实验验证
在LIBERO基准测试中,使用相同数据量训练VLA模型。Diffusion RL数据训练的VLA在130个任务上平均成功率达88%,比人类示范数据高5-10%,部分任务差距达15%。
泛化性测试显示,在未见过的LIBERO-90任务上,扩散数据训练的VLA成功率为83.4%,人类数据为80.4%。混合数据(人类+扩散)进一步将泛化成功率提升至92%,证明数据质量互补性。
轨迹效率优化显著,扩散策略完成任务的路径长度缩短22%,动作执行更高效。
技术优化
消融实验验证关键参数:DDIM采样比DDPM更稳定,收敛速度提升30%;学习率设置在1e-4时效果最佳;回放缓冲区多样性设计避免局部最优。
架构选择上,UNet策略网络比Transformer更适合在线强化学习,训练稳定性提高40%。并行环境数量达128时,数据采集效率最优。
这些工程优化解决了扩散模型在强化学习中的不稳定性问题,为实际应用奠定基础。