近期,理想汽车自动驾驶研发高级副总裁郎咸朋公开表示,理想汽车最新推送的VLA强化版司机大模型在行业内处于领先地位。这一论断不仅是对其技术成果的自信展示,也揭示了智能驾驶领域正迈向一个以大模型为核心的新竞争阶段。

所谓VLA,即“视觉-语言-行动”模型,是当前智能驾驶领域的前沿技术方向。与传统依赖大量人工规则或单纯模仿驾驶行为的“端到端”模型不同,VLA的核心在于引入了“语言”作为中间层。简单来说,它试图让车辆的辅助驾驶系统像人类一样,通过“观察”(视觉感知)、“思考”(语言推理)和“行动”(决策控制)来应对复杂的道路环境。这种模式赋予了系统更强的逻辑推理和泛化能力,使其在面对从未见过的长尾场景时,不再是单纯地“死记硬背”数据,而是能够进行类人分析和决策。
根据理想汽车高管的阐述,公司之所以坚定地选择VLA路线,是基于一种战略判断:在既有技术路线上,已难以实现对领先者的颠覆性超越,必须开辟新的战场。在理想看来,VLA正是这样一个能够带来代际提升的新技术。郎咸朋认为,通过VLA大模型,理想的辅助驾驶系统在绕行避障的拟人化、驾乘体验的舒适平顺以及泊车等场景的智能化方面实现了显著突破,其目标是让辅助驾驶从“机器辅助”转变为用户的“AI伙伴”。
从用户的实际体验来看,理想汽车通过OTA升级推送的VLA功能,确实带来了可感知的变化。例如,在最新的OTA 8.2版本中,VLA司机大模型通过深度学习驾驶员的方向盘和电门操作数据,使得辅助驾驶过程中的加减速和转向更为平顺丝滑,更像一位经验丰富的“老司机”。此外,诸如辅助驾驶直达充电车位、自动处理园区多出口等功能的落地,也体现了VLA在拓展实用场景方面的潜力。

然而,VLA并非是全行业公认的唯一答案,其技术路线本身也引发了广泛的争议。华为等公司主张的“世界模型”(World Action, WA)是另一条备受关注的技术路径。WA的支持者认为,语言作为中间环节可能会丢失部分关键的物理世界信息,是一种“取巧”的方案;而WA通过构建对物理世界的直接理解和模拟,虽然难度更高,但可能是通向完全自动驾驶的更根本的解决方案。同时,博世等行业供应商也从工程落地的角度提出质疑,认为当前无论是芯片算力、多模态数据对齐还是大模型的“幻觉”问题,都为VLA的成熟应用带来了挑战,可能还需要数年时间才能真正落地。
面对争议,郎咸朋回应称,竞争对手的质疑恰恰说明了VLA路线的正确性和前瞻性。他认为,理想汽车在基座模型研发、海量数据处理以及通过强化学习等手段解决模型“幻觉”问题上已有深厚积累。他相信,随着VLA能力的进一步释放,用户将能看到一个真正“活了”的智能驾驶系统。
放眼整个行业,VLA已然成为一股不可忽视的潮流。除了理想,小鹏、长城魏牌等国内车企也纷纷宣布在旗下车型上搭载或规划VLA技术。这背后反映出,随着智能驾驶进入下半场,竞争的焦点正从功能的有无,转向体验的优劣和技术的代际。但VLA的高门槛也显而易见,其对云端训练算力、高质量的多模态数据以及算法工程化能力都提出了极高的要求,这正在成为一道新的分水岭,可能将加剧头部玩家与中小车企之间的差距。

理想高管宣称VLA行业领先,背后是其在智能驾驶领域的一次重要战略选择。这场围绕VLA与WA等不同技术路线的论战,实质上是行业在探索通往更高阶自动驾驶道路上的不同尝试。最终哪条路径能够胜出,或许不完全取决于技术论述的优劣,而在于谁能率先为用户提供更安全、更可靠、更舒适的真实世界体验。这场关乎未来的竞争,才刚刚开始。