张大妈

自动驾驶的“选择困难症”被治好了?DiffusionDriveV2 论文详细解读!

源自UP主:集智书童

03-04 11:16

端到端自动驾驶常面临轨迹生成多样性与质量难以两全的困境。这篇内容深入解读 DiffusionDriveV2 论文,展示其如何通过引入强化学习约束,有效解决模式坍塌与低质量轨迹问题,在多个基准测试中刷新 SOTA 记录,为自动驾驶策略优化提供了新思路。

自动驾驶的“选择困难症”被治好了?DiffusionDriveV2 论文详细解读!智能速览

  • 端到端自动驾驶存在“模式坍塌”难题,模仿学习导致负模态缺乏监督

  • DiffusionDriveV2 引入强化学习约束截断扩散,提升轨迹质量下界

  • 提出尺度自适应乘性噪声,解决探索轨迹近远端尺度不一致问题

  • 创新设计锚内与锚间 GRPO,兼顾驾驶意图多样性与全局安全性

  • NAVSIM 数据集 PDMS 达 91.2,以轻量级 ResNet-34 骨干网击败竞品

自动驾驶的“选择困难症”被治好了?DiffusionDriveV2 论文详细解读!精华内容

针对传统扩散模型在自动驾驶轨迹生成中的局限性,DiffusionDriveV2 提出了一套融合强化学习的创新解决方案。

解决模式坍塌难题

原生扩散模型容易产生“模式坍塌”,即模型倾向于生成单一、保守的轨迹,无法应对复杂场景。前作 DiffusionDrive 虽引入锚点高斯混合模型促进多样性,但完全依赖模仿学习进行训练。由于模仿学习仅监督正样本模态,导致占绝大多数的负模态轨迹完全得不到约束,从而生成了大量低质量甚至碰撞的轨迹,构成了自动驾驶中多样性与高质量难以两全的困境。

引入强化学习与乘性噪声

DiffusionDriveV2 将去噪过程视为马尔可夫决策过程,利用强化学习的探索-约束范式对所有模态施加约束,不仅惩罚不安全行为,还鼓励探索更优策略。为防止过拟合,模型保留了模仿学习损失与强化学习损失进行加权组合。此外,针对传统加性噪声破坏轨迹平滑性的问题,提出尺度自适应乘性噪声,仅添加纵向和横向缩放因子,使探索轨迹更符合物理规律,实验证实该方案 PDMS 提升 0.5 分。

创新设计锚内与锚间GRPO

为避免不同驾驶意图间的错误比较导致模式坍塌,提出了锚内 GRPO,优势估计仅在同一个锚点内部进行,显著提升各意图下的轨迹质量。同时引入锚间截断 GRPO 提供全局视角,将负优势截断为零,仅对碰撞轨迹施加强惩罚。这种设计既保持了多样性,又引入了绝对安全约束,使训练更加稳定。消融实验表明,这两个组件分别贡献了 2.9 分和 1.2 分的 PDMS 提升。

轻量级架构刷新SOTA记录

DiffusionDriveV2 在 NAVSIM v1 数据集上取得 91.2 的 PDMS 分数,比前代高出 3.1 分,创下新纪录;在 NAVSIM v2 基准上也保持最优。值得注意的是,该方法仅使用轻量级的 ResNet-34 骨干网络,性能却超越了使用更大、更复杂骨干网络的 GoFlow 和 Hydra-MDP 等先进方法,证明了其架构设计的高效性。可视化结果显示,其生成的轨迹在多样性与一致性间实现了最优平衡。

DiffusionDriveV2 通过强化学习框架成功解决了轨迹生成中多样性与高质量的矛盾,以轻量模型实现 SOTA 性能。尽管目前训练分阶段进行,且依赖预训练权重,但这为结合学习与优化的自动驾驶研究提供了宝贵思路。未来端到端联合优化或将成为新的突破方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章