小鹏汽车披露了其第二代视觉语言动作模型(VLA 2.0)的研发细节,展现了其在物理AI领域的巨大投入与决心。通过重金投入算力与数据,小鹏不仅实现了技术架构的突破,更推动了整个智能驾驶行业的发展进程,为未来的自动驾驶提供了新的解决方案。

智能速览
小鹏为训练VLA投入3万卡算力,花费超20亿。
VLA 2.0模型拥有720亿参数,基于1亿视频数据训练。
自研芯片针对性优化,使AI推理能力提升12倍。
第二代VLA将开源,大众汽车成为其首发客户。
小鹏自家车型将于2026年一季度正式推送该系统。
精华内容
这项技术的突破并非一蹴而就,其背后是巨大的资源投入和架构革新。从训练数据到硬件自研,每一步都旨在解决自动驾驶的核心难题。
打破架构瓶颈
传统的视觉语言动作模型(VLA)普遍存在一个核心瓶颈:信息需要经过“视觉到语言”再到“动作”的两次转换。这个中间的语言转译环节不仅效率低下,还会带来较高的信息损耗,这限制了模型在更大参数规模和更大数据体量上的训练潜力,成为提升智能驾驶能力的天花板之一。小鹏的第二代VLA正是为了绕开这一障碍而生,直接实现了视觉到动作的映射,为大规模训练铺平了道路。
算力与数据的豪赌
为了攻克这一难题,小鹏展现了惊人的投入力度。其利用了阿里云提供的3万张云端算力卡,总计投入超过20亿元人民币进行模型训练。系统被投喂了高达1亿个视频片段进行学习,构建了一个拥有720亿参数的基座大模型。研发过程极为高效,实现了每五天一次的全链路迭代,这种高强度的投入最终在今年第二季度迎来了智能涌现的突破性时刻。

自研芯片与落地计划
硬件层面的协同进化同样关键。小鹏的自研芯片通过针对性优化算子,实现了推理能力12倍的显著提升,为复杂模型的本地化部署铺平了道路。商业化进程上,小鹏做出了一个重要决定:将第二代VLA开源,大众汽车将成为其首发客户。对于小鹏自有车型,系统将在今年11-12月开启小规模用户体验,并于2026年第一季度向Ultra用户正式推送。

小鹏VLA 2.0的发布,不仅是其自身技术实力的展现,更通过开源策略为行业树立了新标杆。这种从底层架构到硬件生态的全面革新,预示着物理AI时代的加速到来。未来的智能驾驶,会因为这样的投入而更快到来吗?