针对外界“小鹏放弃VLA”的传言,其第二代自动驾驶技术架构给出了明确答案。该内容深入剖析了VLA与世界模型并非对立,而是深度融合的共生关系,并揭示“拆掉语言的拐杖”这一核心进化,展现了小鹏在自动驾驶技术路径上的深度思考与独特实践。
智能速览
小鹏澄清技术路线,VLA与世界模型是融合而非替代关系。
世界模型作为VLA系统的核心模块,增强了应对极端场景的能力。
新架构通过引入物理世界“思考”过程,解决了第一代模型的黑盒问题。
第二代VLA致力于“拆掉语言的拐杖”,实现更直接的物理世界推理。
精华内容
面对外界关于技术路线的猜测,小鹏的自动驾驶架构图给出了答案。VLA与世界模型并非二选一,而是一种更深层次的融合,这背后是技术逻辑的演进。
架构统一关系
小鹏的第二代技术架构清晰地表明,VLA与世界模型是同一个系统的不同侧面描述。其核心技术架构图明确标注为“XPENG 第二代 VLA”,说明VLA依然是整个自动驾驶系统的基本框架和实现形态。而世界模型,则是这个第二代VLA系统内部的一个关键模块或核心能力,负责处理VLA模型输出的“隐式令牌”并驱动世界模拟。
世界模型的价值
引入世界模型的核心价值在于,为系统增加了一个基于物理世界理解的“思考”过程,解决了第一代端到端模型泛化能力不足和难以解释黑盒决策的问题。举个例子,当系统感知到一个滚向马路的皮球时,世界模型能立刻推演出“后面可能跟着一个捡球的孩子”,从而提前减速。这种预判能力使其在处理复杂或极端场景时,表现得更像经验丰富的人类司机。
拆掉语言的拐杖
这是小鹏二代VLA的另一大进化。传统方法依赖“语言/语义中介”,即将视觉信息“翻译”成语言(如“前方有车变道”),再基于语言推理决策。但这种方式会丢失速度、加速度、距离等大量连续的物理信息,决策基于的是“翻译结果”而非真实世界。小鹏强调要减少对语言的依赖,让决策直接建立在连续的视觉/物理表征上,不再先“写成文章”再用文章做决策。
更高级的VLA路线
综合来看,小鹏选择的是一条以内嵌世界模型为核心的、更高级的VLA技术路线。这条路既保留了VLA作为端到端框架的优势,又通过世界模型弥补了其在物理推演和可解释性上的短板,同时通过“拆掉语言的拐杖”提升了信息保真度。这是一种旨在让自动驾驶系统更智能、更接近人类驾驶直觉的探索。