当前位置:
AIGC文章详情

张大妈

小鹏Drive-JEPA:世界模型端到端框架

源自小红薯:自动驾驶之心autodrivingheart

02-08 14:21

端到端自动驾驶虽采用自监督视频预训练,但性能提升有限。小鹏汽车提出的Drive-JEPA框架,通过融合视频联合嵌入预测架构与多模态轨迹蒸馏技术,有效解决了驾驶场景的固有模糊性。这一创新方案在NAVSIM基准测试中刷新了纪录,为高阶自动驾驶的实现提供了新的技术路径。

小鹏Drive-JEPA:世界模型端到端框架智能速览

  • 传统视频预训练对自动驾驶规划提升有限。

  • Drive-JEPA框架结合了V-JEPA与多模态轨迹蒸馏。

  • 它通过预训练视觉编码器生成对齐轨迹规划的表示。

  • 引入proposal-centric规划器,利用仿真器生成多样化轨迹。

  • 在NAVSIM基准测试中创下了新的SOTA记录。

小鹏Drive-JEPA:世界模型端到端框架精华内容

Drive-JEPA的核心突破在于如何从单一的人类驾驶轨迹中学习到多样化的安全行为。它通过两个关键步骤实现了这一目标。

适配V-JEPA模型

为解决传统视频预训练在驾驶任务中效果不佳的问题,研究首先将视频联合嵌入预测架构(V-JEPA)进行了任务适配。该架构通过在大规模驾驶视频数据上预训练视觉Transformer(ViT)编码器,使其能够生成具有预测性的视觉表示。关键在于,这些生成的表示并非通用的视频特征,而是专门与下游的轨迹规划任务进行了对齐,从而为后续的决策打下了坚实的基础。

多模态轨迹规划

驾驶场景的复杂性在于其固有的模糊性,一个场景通常只有单一的人类驾驶轨迹可供学习,这限制了模型应对多模态行为的能力。Drive-JEPA为此引入了proposal-centric规划器,它不仅学习真实的人类轨迹,更重要的是,它通过蒸馏仿真器生成的大量多样化轨迹进行学习。这种方法极大地拓宽了模型的行为库,使其能够理解和应对更复杂的交通状况。

安全与性能表现

为了确保驾驶的稳定与安全,该框架还采用了一种动量感知选择机制。该机制能够从多种可能的驾驶行为中,筛选出最符合动力学约束和安全规范的轨迹。在实际的NAVSIM基准测试中,这套完整的Drive-JEPA框架表现卓越,在v1和v2版本上分别取得了93.3 PDMS和87.8 EPDMS的分数,显著超越了此前所有方法,刷新了端到端自动驾驶的SOTA记录。

小鹏Drive-JEPA的提出,不仅是技术指标上的突破,更是对端到端自动驾驶方法论的一次重要探索。它将世界模型的预测能力与多模态行为学习相结合,为解决自动驾驶中的长尾问题提供了新思路。未来,这种融合仿真与现实数据的学习范式,或将加速更安全、更智能的自动驾驶系统落地。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章