当前位置:
AIGC文章详情

张大妈

小鹏新路线:VLA与世界模型如何融合?

源自新浪微博:电动知士

02-01 19:02

针对外界“小鹏放弃VLA”的传言,其第二代自动驾驶技术架构给出了明确答案。该内容深入剖析了VLA与世界模型并非对立,而是深度融合的共生关系,并揭示“拆掉语言的拐杖”这一核心进化,展现了小鹏在自动驾驶技术路径上的深度思考与独特实践。

小鹏新路线:VLA与世界模型如何融合?智能速览

  • 小鹏澄清技术路线,VLA与世界模型是融合而非替代关系。

  • 世界模型作为VLA系统的核心模块,增强了应对极端场景的能力。

  • 新架构通过引入物理世界“思考”过程,解决了第一代模型的黑盒问题。

  • 第二代VLA致力于“拆掉语言的拐杖”,实现更直接的物理世界推理。

小鹏新路线:VLA与世界模型如何融合?精华内容

面对外界关于技术路线的猜测,小鹏的自动驾驶架构图给出了答案。VLA与世界模型并非二选一,而是一种更深层次的融合,这背后是技术逻辑的演进。

架构统一关系

小鹏的第二代技术架构清晰地表明,VLA与世界模型是同一个系统的不同侧面描述。其核心技术架构图明确标注为“XPENG 第二代 VLA”,说明VLA依然是整个自动驾驶系统的基本框架和实现形态。而世界模型,则是这个第二代VLA系统内部的一个关键模块或核心能力,负责处理VLA模型输出的“隐式令牌”并驱动世界模拟。

世界模型的价值

引入世界模型的核心价值在于,为系统增加了一个基于物理世界理解的“思考”过程,解决了第一代端到端模型泛化能力不足和难以解释黑盒决策的问题。举个例子,当系统感知到一个滚向马路的皮球时,世界模型能立刻推演出“后面可能跟着一个捡球的孩子”,从而提前减速。这种预判能力使其在处理复杂或极端场景时,表现得更像经验丰富的人类司机。

拆掉语言的拐杖

这是小鹏二代VLA的另一大进化。传统方法依赖“语言/语义中介”,即将视觉信息“翻译”成语言(如“前方有车变道”),再基于语言推理决策。但这种方式会丢失速度、加速度、距离等大量连续的物理信息,决策基于的是“翻译结果”而非真实世界。小鹏强调要减少对语言的依赖,让决策直接建立在连续的视觉/物理表征上,不再先“写成文章”再用文章做决策。

更高级的VLA路线

综合来看,小鹏选择的是一条以内嵌世界模型为核心的、更高级的VLA技术路线。这条路既保留了VLA作为端到端框架的优势,又通过世界模型弥补了其在物理推演和可解释性上的短板,同时通过“拆掉语言的拐杖”提升了信息保真度。这是一种旨在让自动驾驶系统更智能、更接近人类驾驶直觉的探索。

精选参考来源

前段时间,流传着一种观点:“小鹏放弃了VLA,转向了世界模型”。那今天这几张PPT,其实就反驳了这种观点,并且清晰地阐明了这两者是融合而非对立的关系。“是VLA,也是世界模型”,明确表示了VLA和世界模型是并存的、统一的。在小鹏的第二代技术架构中,两者是同一个系统的不同侧面描述。在技术架构图中,我们可以看到整个系统的核心被标注为“XPENG 第二代 VLA”。这表明 VLA 依然是整个自动驾驶系统的基础框架和实现形式。而“世界模型”,则是这个第二代VLA系统内部的一个关键模块或一种核心能力。VLA模型通过处理输入的视频、语言等信息,输出了用于驱动世界模拟的“Latent Tokens”(隐式令牌)。通过引入世界模型,这个从V/L到A的过程变得不再那么“黑盒”和直接。中间增加了一个基于物理世界理解的“思考”过程。这恰恰是解决了第一代端到端模型可能存在的泛化能力不足、难以解释和应对极端场景(Corner Case)等问题。举个例子:当感知看到一个滚向马路的皮球时,世界模型不仅认识到“这是个球”,还会立刻进行推演:“一个球通常意味着后面会跟着一个跑出来捡球的孩子”,从而提前做出减速的预判。这使得系统能够处理更复杂的、或者Corner Case场景,表现得更像一个经验丰富的人类司机。而“拆掉语言的拐杖”则是小鹏二代VLA的另一个关键进化。过去很多方法依赖“语言/语义中介”(例如先用语言或符号层推断语义,再映射到动作)。例如,在许多多模态大模型中,视频或图片会先被“语义化”成语言:“前方 30 米有一辆白色 SUV 变道”“左侧有行人靠近”“道路变窄,请保持车距”这种方式本质上是把视觉转成语言(符号、文本等),再基于语言进行推理,最后生成控制指令。此时,语言就是“拐杖”,因为模型对世界的理解必须依赖它。但问题是:物理世界并不是语言能(完全)描述出来的!用语言表达物理世界会丢掉大量信息:速度、加速度、距离、相对运动、路面细节、轨迹趋势、天气、光照变化、行人动作的先兆……世界的连续性被离散语言破坏,决策也会变成对“翻译结果”的推理,而不是真实世界的推理。小鹏在这里强调减少对语言的依赖,把决策建立在直接的视觉/物理上,是希望用感知到的连续世界表征直接驱动动作,而不是先“翻译”成语言再做推理。也就是说:不再先“写成文章”再用文章做决策。这就是“拆掉语言的拐杖”。可以这样理解:小鹏正在走的,是一条以内嵌了世界模型为核心的、更高级的VLA路线。#新能源大牛说##小鹏汽车#
内容由AI生成

精选参考来源

前段时间,流传着一种观点:“小鹏放弃了VLA,转向了世界模型”。那今天这几张PPT,其实就反驳了这种观点,并且清晰地阐明了这两者是融合而非对立的关系。“是VLA,也是世界模型”,明确表示了VLA和世界模型是并存的、统一的。在小鹏的第二代技术架构中,两者是同一个系统的不同侧面描述。在技术架构图中,我们可以看到整个系统的核心被标注为“XPENG 第二代 VLA”。这表明 VLA 依然是整个自动驾驶系统的基础框架和实现形式。而“世界模型”,则是这个第二代VLA系统内部的一个关键模块或一种核心能力。VLA模型通过处理输入的视频、语言等信息,输出了用于驱动世界模拟的“Latent Tokens”(隐式令牌)。通过引入世界模型,这个从V/L到A的过程变得不再那么“黑盒”和直接。中间增加了一个基于物理世界理解的“思考”过程。这恰恰是解决了第一代端到端模型可能存在的泛化能力不足、难以解释和应对极端场景(Corner Case)等问题。举个例子:当感知看到一个滚向马路的皮球时,世界模型不仅认识到“这是个球”,还会立刻进行推演:“一个球通常意味着后面会跟着一个跑出来捡球的孩子”,从而提前做出减速的预判。这使得系统能够处理更复杂的、或者Corner Case场景,表现得更像一个经验丰富的人类司机。而“拆掉语言的拐杖”则是小鹏二代VLA的另一个关键进化。过去很多方法依赖“语言/语义中介”(例如先用语言或符号层推断语义,再映射到动作)。例如,在许多多模态大模型中,视频或图片会先被“语义化”成语言:“前方 30 米有一辆白色 SUV 变道”“左侧有行人靠近”“道路变窄,请保持车距”这种方式本质上是把视觉转成语言(符号、文本等),再基于语言进行推理,最后生成控制指令。此时,语言就是“拐杖”,因为模型对世界的理解必须依赖它。但问题是:物理世界并不是语言能(完全)描述出来的!用语言表达物理世界会丢掉大量信息:速度、加速度、距离、相对运动、路面细节、轨迹趋势、天气、光照变化、行人动作的先兆……世界的连续性被离散语言破坏,决策也会变成对“翻译结果”的推理,而不是真实世界的推理。小鹏在这里强调减少对语言的依赖,把决策建立在直接的视觉/物理上,是希望用感知到的连续世界表征直接驱动动作,而不是先“翻译”成语言再做推理。也就是说:不再先“写成文章”再用文章做决策。这就是“拆掉语言的拐杖”。可以这样理解:小鹏正在走的,是一条以内嵌了世界模型为核心的、更高级的VLA路线。#新能源大牛说##小鹏汽车#

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章