当前位置:
AIGC文章详情

张大妈

WorldRFT:基于潜世界模型的自主驾驶强化学习微调规划方法

源自知乎:黄浴

03-04 17:51

针对潜世界模型在自动驾驶规划中表现次优的问题,WorldRFT框架通过分层规划和强化学习微调,实现了感知与规划的对齐,大幅提升了驾驶安全性,纯视觉方案性能已媲美激光雷达。

WorldRFT:基于潜世界模型的自主驾驶强化学习微调规划方法智能速览

  • WorldRFT提出面向规划的潜世界模型框架,解决感知与规划耦合问题

  • 集成视觉-几何基础模型,通过分层规划分解指导表示优化

  • 引入组相对策略优化与碰撞-觉察奖励,系统提升安全策略性能

  • 在nuScenes数据集上碰撞率降低83%,仅用相机输入即可媲美激光雷达方案

WorldRFT:基于潜世界模型的自主驾驶强化学习微调规划方法精华内容

聚焦自动驾驶的安全性瓶颈,WorldRFT提出了一种基于规划的潜世界模型框架,旨在通过技术创新解决感知与规划耦合带来的规划次优难题。

潜世界模型架构

WorldRFT构建了完整的“场景理解→规划决策→安全优化”流程。空间-觉察编码器模块利用几何基础模型VGGT,从环视图像中构建富含3D空间信息的潜世界表示,无需显式3D输入即可实现有效空间理解。

通过轻量级融合模块集成ResNet和VGGT特征,生成统一的潜空间视觉表示,为后续规划提供精准的环境感知基础。

分层规划细化

框架将端到端规划分解为目标区域定位、空间路径规划和时间轨迹预测三个并行子任务。目标区域不再预测确定性点,而是使用拉普拉斯分布建模为概率区域,自然捕捉场景复杂性。

统一的查询交互框架让各子任务专用查询进行自注意计算,实现规划意图的相互感知,并通过局部-觉察迭代优化整合局部场景信息,对初始结果进行迭代改进。

强化学习微调

引入组相对策略优化(GRPO)算法,应用碰撞-觉察奖励来微调驾驶策略。通过将轨迹扩展为概率分布进行探索,根据自车与周围智体的距离计算奖励,负距离产生惩罚以避免碰撞。

采用高斯分布对轨迹进行建模,以样本组内的相对奖励估计优势函数,从而在保持规划精度的同时,系统性地提高安全性。

性能实测表现

WorldRFT在开放环路nuScenes和闭环NavSim基准测试中均取得最先进性能。在nuScenes数据集上,该方法将碰撞率从0.30%显著降低至0.05%,降幅达83%。

在NavSim数据集上,仅使用相机传感器输入,就达到了与基于LiDAR的SOTA方法DiffusionDrive相当的性能(87.8 vs 88.1 PDMS),验证了纯视觉方案的强大潜力。

WorldRFT通过创新的框架设计,证明了潜世界模型在自动驾驶规划中的巨大潜力。它不仅显著降低了碰撞率,还展示了纯视觉方案超越传统感知的可能性,为未来的自动驾驶技术发展提供了重要的研究方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章