端到端自动驾驶常面临轨迹生成多样性与质量难以两全的困境。这篇内容深入解读 DiffusionDriveV2 论文,展示其如何通过引入强化学习约束,有效解决模式坍塌与低质量轨迹问题,在多个基准测试中刷新 SOTA 记录,为自动驾驶策略优化提供了新思路。
智能速览
端到端自动驾驶存在“模式坍塌”难题,模仿学习导致负模态缺乏监督
DiffusionDriveV2 引入强化学习约束截断扩散,提升轨迹质量下界
提出尺度自适应乘性噪声,解决探索轨迹近远端尺度不一致问题
创新设计锚内与锚间 GRPO,兼顾驾驶意图多样性与全局安全性
NAVSIM 数据集 PDMS 达 91.2,以轻量级 ResNet-34 骨干网击败竞品
精华内容
针对传统扩散模型在自动驾驶轨迹生成中的局限性,DiffusionDriveV2 提出了一套融合强化学习的创新解决方案。
解决模式坍塌难题
原生扩散模型容易产生“模式坍塌”,即模型倾向于生成单一、保守的轨迹,无法应对复杂场景。前作 DiffusionDrive 虽引入锚点高斯混合模型促进多样性,但完全依赖模仿学习进行训练。由于模仿学习仅监督正样本模态,导致占绝大多数的负模态轨迹完全得不到约束,从而生成了大量低质量甚至碰撞的轨迹,构成了自动驾驶中多样性与高质量难以两全的困境。
引入强化学习与乘性噪声
DiffusionDriveV2 将去噪过程视为马尔可夫决策过程,利用强化学习的探索-约束范式对所有模态施加约束,不仅惩罚不安全行为,还鼓励探索更优策略。为防止过拟合,模型保留了模仿学习损失与强化学习损失进行加权组合。此外,针对传统加性噪声破坏轨迹平滑性的问题,提出尺度自适应乘性噪声,仅添加纵向和横向缩放因子,使探索轨迹更符合物理规律,实验证实该方案 PDMS 提升 0.5 分。
创新设计锚内与锚间GRPO
为避免不同驾驶意图间的错误比较导致模式坍塌,提出了锚内 GRPO,优势估计仅在同一个锚点内部进行,显著提升各意图下的轨迹质量。同时引入锚间截断 GRPO 提供全局视角,将负优势截断为零,仅对碰撞轨迹施加强惩罚。这种设计既保持了多样性,又引入了绝对安全约束,使训练更加稳定。消融实验表明,这两个组件分别贡献了 2.9 分和 1.2 分的 PDMS 提升。
轻量级架构刷新SOTA记录
DiffusionDriveV2 在 NAVSIM v1 数据集上取得 91.2 的 PDMS 分数,比前代高出 3.1 分,创下新纪录;在 NAVSIM v2 基准上也保持最优。值得注意的是,该方法仅使用轻量级的 ResNet-34 骨干网络,性能却超越了使用更大、更复杂骨干网络的 GoFlow 和 Hydra-MDP 等先进方法,证明了其架构设计的高效性。可视化结果显示,其生成的轨迹在多样性与一致性间实现了最优平衡。
DiffusionDriveV2 通过强化学习框架成功解决了轨迹生成中多样性与高质量的矛盾,以轻量模型实现 SOTA 性能。尽管目前训练分阶段进行,且依赖预训练权重,但这为结合学习与优化的自动驾驶研究提供了宝贵思路。未来端到端联合优化或将成为新的突破方向。