2026年初智能驾驶技术路线明朗:VLA已量产上车,世界模型仍处训练阶段

源自30位全网作者

02-05 10:29

内容由AI生成

精选参考来源

1. 特斯拉技术分享:明年2季度汽车工业,将迎来没有方向盘的时代#特斯拉 #自动驾驶 #汽车 #Cybercab #端到端

2. 当智能醒于物理世界,英伟达副总裁: 下一个十年属于物理AI!|新智元十周年峰会

3. #互联网技术[超话]##个重磅信号!#黄仁勋 #AI #人工智能#机器人 #自动驾驶 #CES2026 #英伟达#新年演讲# 黄仁勋在2026年CES展会上的新年首场演讲,以"物理AI"为核心主题,宣告人工智能正式迈入从理解数字世界到改造物理世界的新阶段。以下是演讲的核心内容整理: 一、时代定调:双重平台转移开启AI新纪元 黄仁勋指出,计算机行业正经历十年一遇的"平台重置",同时发生两大平台转移:一是应用程序全面构建于AI之上,软件开发从"编程"转向"训练",运行载体从CPU迁移至GPU;二是软件的开发与运行逻辑彻底革新,AI应用不再是预编译的固定程序,而是能理解上下文、实时生成内容的智能系统。这一变革正驱动全球价值约十万亿美元的计算机基础设施进行现代化改造。 二、物理AI的ChatGPT时刻已至 物理AI成为演讲的核心焦点。黄仁勋认为,AI的演进可以分为四步:感知AI、生成AI、代理AI、物理AI。当模型能够理解重力、摩擦、惯性、动量守恒等物理定律,AI才能真正走出屏幕,进入物理世界执行任务。 支撑物理AI战略的三大技术支柱已全面成型: Newton物理引擎:实现低于0.01秒的实时物理计算响应 Cosmos基础模型平台:以1000亿参数达成1毫秒级推理延迟,支持多模态物理世界理解 GPU+LPU混合架构:算力效率提升100倍,成本降低90% 三、Rubin计算架构全面量产 英伟达推出新一代Vera Rubin计算架构(简称Rubin架构),该平台已进入全面量产阶段。Rubin架构通过CPU与GPU协同设计,AI训练性能较前代Blackwell提升3.5倍,推理性能提升5倍,token生成成本最高降低10倍。该架构包含六款全新芯片:Vera CPU、Rubin GPU、NVLink 6 Switch、ConnectX-9 SuperNIC、BlueField-4 DPU和Spectrum-X以太网交换机。 四、自动驾驶与机器人突破 自动驾驶领域:英伟达发布全球首个开源端到端AI系统Alpamayo,这是业界首个具备思考推理能力的自动驾驶AI模型。2025款梅赛德斯-奔驰CLA将首发搭载该技术,计划2026年第一季度在美国上路,随后推广至欧洲和亚洲市场。 机器人领域:黄仁勋宣布"机器人领域的ChatGPT时刻已经到来"。英伟达发布了专为人形机器人设计的Isaac GR00T N1.6视觉语言行动模型等开源工具,同时推出Cosmos Reason 2推理型视觉语言模型。特斯拉Optimus人形机器人已通过Omniverse数字孪生平台完成90%以上的训练,自主运行比例达85%,2026年第一季度将实现5万台量产,成本降至2万美元以下。 五、开源生态战略加速 黄仁勋强调,开源模型与前沿闭源模型的差距已缩短至约6个月,且仍在持续缩小。英伟达不仅开源模型,还开源用于训练这些模型的数据,以建立真正的"系统信任"。现场展示的多款开源模型包括三家中国开源模型:Kimi K2、Qwen和DeepSeek V3.2。黄仁勋特别提到,DeepSeek R1的出现意外推动了整个行业的变革进程。 六、全栈AI体系构建 英伟达的角色已从芯片供应商转变为"全栈AI体系"的构建者。通过"三台计算机"的架构——训练(DGX超级计算机)、仿真(Omniverse与RTX)、推理(AGX系列边缘设备),英伟达构建了从云端训练到现实部署的完整闭环系统。同时,通过开源模型、数据及NeMo开发库,英伟达正推动技术民主化,让更多开发者和企业能够参与到物理AI的创新浪潮中。 黄仁勋在演讲结尾强调,物理AI的落地将重塑全球千万家工厂与数十万个仓库的运作逻辑,开启AI与实体经济深度融合的新时代。 http://t.cn/AXb9Z9MM

4. 请问到底什么是端到端自动驾驶?

5. VLA和World Model世界模型,哪种自动驾驶路线会胜出?

6. VLA可能过时了?L3自动驾驶延期,车企技术开始自我淘汰

7. 请你尽快找这辆车开。#蓝山加V生活有味 #魏牌蓝山 #蓝山VLA大模型上车首秀

8. 理想自动驾驶总负责人郎咸朋聊VLA,提出一个观点:VLA最适合自动驾驶,世界模型并不适合,只适合在云端做仿真测试和训练。以下是原文摘取:“从今年9月VLA正式发布,到12月6日OTA 8.1的推送,经过两个月多的“实践出真知”后,我有两点心得:第一,VLA就是自动驾驶最好的模型方案,第二,具身智能最终拼的是整体的系统能力。先说VLA。1)理想的 VLA 本质上就是生成式模型。我们是在用 GPT 的方式做自动驾驶,只不过生成的 Token 不是文本,而是轨迹和控制信号。从目前用户使用的反馈看,在某些场景下理想的VLA已经具备了对物理世界的认知涌现。具体表现是用户会越来越多的发现之前端到端没有的拟人行为。2)世界模型更适合做“考场”而不是“考生”。世界模型的高算力需求(训练和推理都是)决定了它更适合在云端做数据生成和极度逼真的仿真测试和强化训练,这也是理想目前正在做的,通过几E flops的推理算力做仿真测试。这个算力水平,即使再强的车端芯片也无法做到。3)空谈架构不如看疗效。 在自动驾驶领域,脱离了海量真实数据谈模型架构都是空中楼阁,我们之所以坚持 VLA,是因为我们拥有数百万辆车构建的数据闭环,这让我们能在当前算力下,把驾驶水平做到接近人类。”

9. #小鹏智驾负责人称涌现不是偶然#小鹏自动驾驶负责人刘先明表示,小鹏第二代VLA开启物理世界模型新范式,实现视觉信号直连动作指令的端到端输出,突破传统VLA"视觉-语言-动作"架构。在2025科技日发布的这一突破,经3万卡算力、20亿+训练投入后迎来质变,使智能驾驶涌现更强道路理解能力,成为继端到端、标准VLA后的最大飞跃。

10. 为什么“世界模型”是智能驾驶的更优方案?任少卿的核心思路解析:在智能驾驶技术路线的争论中,任少卿及其带领的蔚来智驾团队,将“世界模型”视为突破行业瓶颈、通向终极目标的关键。其核心逻辑围绕现有方案的局限性、世界模型的不可替代价值,以及与AGI(通用人工智能)的衔接展开,具体可拆解为三大核心观点:❶现有主流方案存在“能力天花板”(无法应对真实世界复杂性)任少卿认为,当前行业聚焦的“端到端”和“VLA(视觉-语言-动作)”模型,本质是阶段性产物,存在难以突破的短板:• 端到端模型:只能“填坑”,做不了“长远规划”:端到端虽能将感知、预测、决策等模块整合,但依赖“模仿学习”——像老师手把手教5秒内的操作,一旦场景拉长到30秒、1分钟(如匝道拥堵绕行、复杂路口预判),就会因缺乏长时序推理能力失效,只能处理“短平快”的即时反应,无法覆盖真实驾驶的连续动态场景。• VLA模型:语言带宽有限,承载不了物理世界细节:VLA虽在语言模型基础上叠加视觉和动作,但“根仍在语言”——语言是低带宽载体,一张交通照片里的“车辆间距、行人姿态、路面状况”,用文字描述需大量篇幅且易遗漏;动态场景中“车辆突然变道的意图、骑车人的细微转向”,更是语言难以精准传递的。这导致VLA无法完整捕捉真实世界的复杂信息,只能处理“语言能描述”的有限场景。❷世界模型补全“时空认知”短板(契合智能驾驶核心需求)智能驾驶的本质是“让机器像人一样理解物理世界”,而世界模型恰好解决了这一核心问题——它不依赖语言,直接以视频为核心建立“时空认知能力”,具体有两大关键价值:• 内建物理规律,让机器“懂世界规则”:世界模型会通过跨模态数据(视频、激光雷达、导航信息),自主学习重力、惯性、速度变化等物理规律。比如看到“前方车辆刹车灯亮起”,模型能预判“它会减速,我需要保持安全距离”,而非像传统模型那样依赖人工写死的“刹车灯亮=减速”规则,更贴近人类对世界的本能理解。• 建模长时序时空,让机器“能长远规划”:通过“自回归生成模型”,世界模型能自动学习物体在“三维空间+时间”中的运动逻辑。比如在高速上看到“2公里后有施工占道”,模型能提前规划“何时变道、保持多少车速”,而非到了跟前才临时反应;面对“小区内行人突然跑出”,也能结合“行人动线、本车速度”预判几秒后的碰撞风险,做出更从容的决策——这正是人类驾驶中“预判式操作”的核心,也是现有模型缺失的能力。❸世界模型是智能驾驶通向AGI的必经之路任少卿的底层逻辑是:智能驾驶不是孤立的“汽车功能”,而是AGI在物理世界的重要载体,而世界模型是二者的关键衔接:• 语言模型解决“概念认知”,世界模型解决“物理交互”:语言模型让AI懂“什么是汽车、什么是行人”(概念认知),但AGI需要“在物理世界中正确行动”(如“看到行人要减速”“过弯要控速”),这就需要世界模型的“时空认知”来落地——二者结合,才能让AI既“懂概念”又“会行动”,真正具备通用智能。• 车是“具身智能”的最佳场景,世界模型是其核心能力栈:任少卿认为“车本身就是具身智能”(除了没腿,能移动、能感知、能交互),而世界模型正是为“具身智能”量身打造的——它通过真实车辆的海量动态数据(摄像头、雷达记录的路况)持续学习,不断优化对物理世界的理解,这种“从真实场景中学习、再应用到真实场景”的能力,是其他AGI场景(如机器人)难以快速复制的,也让世界模型成为智能驾驶通向AGI的唯一可行路径。

11. 马斯克旗下 xAI 公司加入 「世界模型」 研发竞赛,该竞赛都有哪些亮点?

12. 我一直在思考,小鹏理想的VLA,和蔚来华为的世界模型,哪个才是自动驾驶的未来?今天我看小鹏科技日发布的第二代VLA找到了答案: 【VLA跟世界模型的融合】。VLA和世界模型,各有优劣势,而小鹏的做法是对的,把两者结合起来。可以预见一下,小鹏才是那个最终引领自动驾驶路线的企业。✔第一代的VLA,将【视觉感知—语言理解—行动执行】直接关联,把看—懂—做的联系起来。一代VLA依赖语言作为中介,将摄像头雷达看到的东西,转化成语言token(比如红灯,有行人),然后基于语言模型推理规则(比如遇到红灯就要停车,遇到行人横穿马路就刹车),然后输出动作。✔VLA擅长通过语言规则理解复杂场景,决策都是可以被解释的(比如刚才是有锥桶所以停车了),这里说一下,物理世界模型是无法解释所有决策的。✔但是第一代VLA会损失时间和空间上的精度,他没有办法预测物体下一步的运动轨迹是什么,比如前方掉落物体以后,物体的运动轨迹,VLA是不知道的,而世界物理模型可以预测这些。世界物理模型,其实就是自动驾驶大脑对这个真实世界的“建模”,模拟这个世界的运行方式。因为看到VLA这些不足,小鹏推出第二代VLA,其实就是小鹏把VLA和物理世界大模型做结合了。✔小鹏第二代VLA已经不依赖人类语言作为中间媒介了,模型直接学习物理世界的交互规律,通过模仿学习,直接掌握在物理世界中如何开车。✔小鹏汽车第二代VLA,把“L”省掉,直接由视觉输入,直接学习和模仿物理世界,不需要经历语言转译这一步。VLA: 看到红灯—遇到红灯就要停车—停车。二代VLA: 看到红灯—模型—停车✔二代VLA,省去了中间翻译的过程,真正意义上模仿的人类开车。物理模型具有自己思考的能力,不需要人工标注,还能够还原真实物理世界的运行规律。比如VLA可能无法知道前方汽车掉落一个物体落地后第二次反应,而二代VLA世界模型能够根据物体形状方位预测他落地后的轨迹,这是不是更像人了呢?而且小鹏VLA会同时用在汽车,Robot机器人,以及飞行汽车上,这也是小鹏独有的优势。✔小鹏的二代VLA就是自动驾驶的未来,和终局。把真实世界建模,高度模仿人类大脑,最终肯定让小鹏智驾领先行业。小鹏坚持AI已经十个年头,而且具有自研AI芯片的能力,是整个世界自动驾驶领域唯二把AI作为公司立身之本的企业,另一个就是特斯拉。#小鹏科技日#

13. 聊天机器人只是过客?谷歌押注“世界模型”,寄希望智能眼镜成为AI真正“杀手级”应用

14. 魏牌蓝山VLA辅助驾驶实测:看懂,听懂,然后开懂

15. VLA和世界模型,哪个是自动驾驶的未来?✔VLA一派主要有理想,之前小鹏也是VLA路线支持者,但是第二代VLA,小鹏其实转向世界模型了。✔世界模型一派,有华为,蔚来。蔚来NWM也上车很久了。✔地平线走的是VA路线,把中间的L转译过程省掉了。✔长城的答案是VLA+世界模型,典型的我都要。VLA,擅长通过语言规则理解复杂世界,将【视觉感知—语言理解—行动执行】直接关联,把看—懂—做的联系起来。VLA依赖语言作为中介,将摄像头雷达看到的东西,转化成语言token(比如红灯,有行人),然后基于语言模型推理规则(比如遇到红灯就要停车,遇到行人横穿马路就刹车),然后输出动作。而世界模型,其实很好理解,就是真实世界的物理还原。汽车工程运用中,其实(世界模型)更多,比如动力学控制,都是物理学模型。只不过世界模型,很高级,在云端训练真实世界。@吴会肖 长城的VLA+世界模型上车后,请求一个试驾。

16. 理想汽车 CTO 谢炎在 2025 云栖大会|开幕式圆桌会议做了分享,其中就包括大家关注的理想AI、VLA、芯片这三个领域内容:1. 理想汽车的AI战略与架构布局。谢炎表示,智能与新能源对未来车企的重要性是同等的,因此理想汽车超过 50% 的研发投入都放在人工智能领域,形成了差异化的战略路线。在架构设计上,理想将AI布局划分为三层:底层是高效的车端推理系统,涵盖芯片、操作系统、通信组件和上层服务的整合,目标是实现更高效率、更低成本和更强算力,支撑核心的自动驾驶任务;中层是VLA基座模型,既要让汽车具备理解三维世界的能力,又要具备人类常识和推理规划能力,理想同时与外部大模型团队开展合作;顶层则是具体应用,包括「AI驾驶员」,相当于每辆车标配的智能驾驶代理,以及「座舱管家」,能打通地图、音乐、外卖等互联网服务,满足用户出行与生活场景需求。通过三层垂直整合,理想强调技术从底到顶的联合设计,以追求极致的产品体验。⸻2. 为什么理想汽车坚持做VLA?在自动驾驶行业中,是否需要语言模型一直存在争议,但理想坚持推进VLA的原因主要有两点。第一,随着自动驾驶技术的演进,车辆必须应对越来越多corner case,这些低概率但复杂的情况无法仅靠大规模数据采集来解决,需要具备人类式推理能力的智能驾驶员。由于图像存在高噪声、不利于逻辑推理,而文字天然适合逻辑和抽象思维,因此语言模型成为关键。第二,从用户体验角度,智能驾驶必须让乘客感受到「像人一样思考」,否则即便安全也可能让人觉得不适。大语言模型通过学习人类海量文本,不仅能生成语言,也能形成接近人类的思维模式,使自动驾驶的行为更贴近人类直觉,提升信任感和舒适度。这些原因使理想坚定地将语言能力引入到自动驾驶核心架构中。⸻3. 为什么理想汽车要自研车端推理芯片?随着VLA和大规模AI模型引入车辆,Scaling Law「规模定律」开始发挥作用,模型的智能提升依赖于更大规模和更长推理链条,这使得车端算力需求呈指数级上升。现有芯片供应商难以满足这种演进需求,因此理想选择自研车端推理芯片,以保证长期自主可控的发展路径。同时,理想认为在推理计算上,可能存在比GPU更高效的架构,因此正在探索新的技术方案。自研芯片不仅能实现更高效的推理,还能帮助理想更好地进行软硬件一体化设计,优化功耗、成本和实时性能。谢炎也特别强调,车端与云端算力体系并不完全相同,云端可能采用另一套解决方案,而车端必须以极致优化为核心目标。因此,自研芯片是理想在智能化战略中不可或缺的探索与投入。#理想汽车##微博新知博主# #理想i6上市# 德卤爱开车的微博视频

17. 同一条路,蔚来世界模型 vs 理想 VLA

18. 理想汽车自动驾驶研发高级副总裁郎咸朋新发的微博,是关于最近理想在具身智能和VLA的技术论述,精准回应了行业争议。#理想高管回应王兴兴质疑#内容直言两点核心:一是VLA就是自动驾驶最好的模型方案,二是具身智能最终拼的是整体系统能力。这话绝非空谈,模型的关键从来不是单打独斗,而是与整个具身智能系统的适配性,在此之上,数据才是决定成败的核心变量。要知道具身机器人分汽车类和人形类两大形态,而理想的VLA司机大模型,不仅锚定当下全系汽车产品,更剑指未来的汽车类具身机器人。作为生成式模型,它已展现出对物理世界的认知涌现能力,而理想手握数百万辆车的数据闭环,正是坚持VLA路线的底气所在。要做好自动驾驶,就得把它当成完整的具身智能系统来打造。感知是眼睛、模型是大脑、芯片是心脏、本体是身体,唯有软硬全栈自研,才能把技术价值发挥到极致。当L4级自动驾驶落地,汽车机器人也就水到渠成。理想押注VLA,押的正是对物理世界的超强理解能力,这或许就是自动驾驶的最优解。

19. @晚点Auto 独家理想汽车自动驾驶高级算法专家詹锟将接手基座模型业务,整体负责理想的 VLA(视觉-语言-行动)基座模型研发,将相关技术研发团队充分整合,为自动驾驶、智能座舱,以及将来可能的机器人等业务提供技术支撑。理想进一步聚焦了以 VLA 为核心的 AI 战略方向 —— 即汽车将变成物理世界的具身智能产品,资源需进一步向具身智能集中。资源整合集中,推动技术迭代,是好事#懒博小课堂##自动驾驶##微博新知#

20. 昨天分享了小米端到端的研发故事(网页链接),今天继续写小米VLA的进展,以及陈龙博士如何看待VA与VLA之争。陈龙博士在2025年4月正式加入小米,此前在自动驾驶独角兽公司 Wayve 担任核心科研职务。我们最早了解的视觉语言自动驾驶,也是从Wayve的“Lingo”开始的。他也是影响Lingo落地论文《Driving with LLMs》的第一作者。对于VLA的本质,陈龙给出了自己的解释:语言(Language)与 视觉(Vision),并非简单的“转译”,而是深度的“增强”。视觉是基础输入,而语言模态的引入,能够对视觉信息进行更高维度的描述与逻辑推理。二者是相加的协同关系,而非转译和替代。陈龙认为,传统的端到端模型能够解决 90% 的常规驾驶问题,剩下的 10%长尾场景(Corner Cases),则是 VLA 的主战场。 VLA 的核心优势不仅在于可解释性,更在于它拥有“通识”。面对从未见过的场景,它能通过逻辑推理举一反三,像人类一样做出正确决策。在架构设计上,小米采用了 “VLA + 世界模型”的协同模式:世界模型是“模拟器”与“预测机”: 它负责预测未来,构建高拟真的虚拟环境;VLA 是“大脑”: 它是一个具备强认知能力的端到端模型。二者配合,既可以用世界模型生成的虚拟环境来训练 VLA 大脑,也可以将世界模型的预测能力融入 VLA,大幅提升决策的前瞻性。为了支撑这一路径,小米自研了具身基座模型。不同于套用开源模型,小米从 LLM的预训练阶段就开始介入。这样做是为了从源头筛选高质量数据,确保驾驶行为的安全与可信;同时融入机器人与驾驶的双重任务数据,特化增强 3D 空间感知能力。我个人理解,小米做基座模型并非平地起高楼,例如小米有自己的大语言模型MiMo,感兴趣的朋友,可以搜索一下。小米在辅助驾驶/自动驾驶的技术投入、资源投入是超规格的,你很难在主机厂看到辅助驾驶多条主线的并行与储备。无论如何,任何技术路线,只有实现落地和交付才有价值,小米也只有交付好用的版本,才能让外界信服。

21. 地狱难度城中村实测,长城VLA大模型辅助驾驶吹牛了吗?

22. 如果你想了解什么是规则控制、端到端、VLA、世界模型……这条视频可能讲的最简单清晰。之前我反复说蔚来“世界模型”在技术架构上领先整个行业?很多人不肯相信。所以我特意用25款蔚来ES6挑战相对常见的“6大高难度场景”进行测试验证,创新性和体验感都明显优于其它辅助驾驶方案。咋说呢?如果以后有人说蔚来辅助驾驶不行……直接把这条视频甩给他。这还只是世界模型的第一个版本,后续推送世界模型第二个版本,我还会为大家演示和分析。 番茄殿下的微博视频

23. 端到端,VLA,世界模型都是什么意思?

24. 体验理想OTA8.1,能看的视野更远,比如识别红绿灯更早,能挑战连续的复杂路障,也就是更像人开车了。体验背后是技术,机器如何理解物理世界?理想郎咸朋直言“VLA是自动驾驶最好的模型方案”#理想高管回应王兴兴质疑#VLA(视觉-语言-动作)模型打破了传统自动驾驶“感知-决策”割裂的桎梏,凭借多模态融合实现了语义级的复杂环境理解,这正是李想所强调的汽车机器人必备的物理世界感知能力。其优势体现在三方面:一是天然适配具身智能,能构建道路场景认知图谱,可理解施工牌“临时封闭”的因果逻辑,实现类人推理;二是动态决策更灵活,在L4级场景中,语言引导的动作生成模块让突发状况下决策延迟降低40%,鲁棒性突出;三是数据效率革新,借助预训练能力将场景理解样本需求缩减70%,加速高阶自动驾驶落地。对比其他选手,理想押注VLA打造认知内核,让车辆从“执行”转向“理解”,VLA的成长会更像是人的成长,离不开大量的语言输入和更快的迭代。VLA路线不仅满足L4功能需求,更定义了自动驾驶的未来范式。

25. 端到端与VLA模型排名,谁是第一?

26. 大模型 | VLA 初识及在自动驾驶场景中的应用

27. 大模型 | VLA 初识及在自动驾驶场景中的应用

28. 智驾 “双巨头” 掰头:世界模型 VS VLA,理想 华为 特斯拉各押宝什么

29. VLA和World Model世界模型,哪种自动驾驶路线会胜出?

30. 自动驾驶上常提的VLA与世界模型有什么区别?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐