小米汽车发布了个世界模型全新框架,重建+生成一起搞,这次车圈又热闹了?
小米汽车又搞了个大动作——发布了Xiaomi Auto World Model,一个专门给辅助驾驶用的"世界模型"全新框架。说白了,就是让车不仅能"看见"周围的世界,还能"想象"接下来会发生什么。听起来挺玄乎,但这次小米不是光画饼,拿了主流基准测试的SOTA,还说了已经在三个实际场景落地了。

要理解这个事儿,得先搞明白"世界模型"到底是个啥。打个比方,现在大多数辅助驾驶系统就像一个只会"照镜子"的司机——摄像头拍到什么就反应什么。但世界模型的思路不一样,它想让系统像一个有经验的老司机一样,不仅看眼前,还能在脑子里预判下一步甚至未来几秒的路况变化。2025年车圈的热词还是"端到端",到了2026年,风向明显转向了"世界模型",华为、蔚来、理想、小鹏都在这条赛道上布局。

小米这次做的最大的不一样,是它把行业里一直分开做的两件事——"三维重建"和"视频生成"——给绑到一块儿了。以前业内要么只做重建,用激光雷达和摄像头的数据还原一个精确的3D场景,但问题是它只能还原已经看到的东西;要么只做生成,靠AI模型"想象"未来画面,但缺点是没有3D结构支撑,时间一长画面就容易漂移、失真。小米的方案是把两个模块深度耦合,重建模块负责搭一个精确的3D骨架,生成模块在这个骨架上"补全"那些摄像头看不到的盲区和未来帧,两者互相约束、互相补位。

这套框架名叫"重建锚定几何、生成填补想象",拆开来看有两个核心模块。WorldRec负责三维重建,用了稀疏三维锚点的办法,不用像传统方法那样逐像素处理,速度快了不少,10秒视频10秒就能重建完成。WorldGen负责视频生成,训练完之后单帧生成只要0.19秒,比同类方法快了大约5.6倍,而且一口气能生成最长接近1分钟的视频——大多数同类模型顶多撑到十几帧。这些数据在Waymo和nuScenes这两个自动驾驶圈公认的测试集上都拿到了第一。
但技术数据再漂亮,最终还得落地才行。小米说这个框架已经在三个场景实际用了。第一个是合成数据生产,已经交付了超过10 万 clips 高质量合成数据,用来训练感知模型——这对于自动驾驶来说很关键,因为真实道路上的极端场景太少了,合成数据可以大幅补充"长尾场景",比如突然蹿出来的小动物、极端天气、诡异的事故场景等。第二个是闭环仿真测试,意思是在系统里复现真实事故,然后针对性地优化。第三个是智能座舱,也就是已经上线小米全系车型的"辅助驾驶学堂",能动态生成第一人称的驾驶教学视频,帮新手司机更快上手。

不过话说回来,从行业的角度看,世界模型这条路线本身也有争议。2026年3月的英伟达GTC大会上,VLA路线和世界模型路线的分歧就已经公开化了。VLA路线以特斯拉FSD、小鹏为代表,核心是用"视觉-语言-动作"大模型直接从感知到决策端到端输出;世界模型路线则以华为、蔚来为代表,更强调对物理世界的理解和模拟。有意思的是,清华大学的邓志东教授判断,未来的方向可能是"世界模型为底、VLA为表"的融合架构——两边别争了,最后可能还得走到一起。小米这次选择的是把重建和生成耦合的"中间路线",一定程度上也是这种融合思路的体现。
但技术归技术,现实是另一回事。网易的一篇分析文章直接点出了问题所在:小米这套世界模型目前还没有量产上车的案例,商业化落地时间可能比预期更长。更让人在意的是,2025年9月,小米SU7因为L2高速领航辅助驾驶在极端特殊场景下存在安全隐患,召回了将近11.7万辆车。从AEB无故触发骤停到高速NOA无故紧急变道,不少车主都反馈过各种智驾方面的问题。世界模型理论上能通过更好的场景理解来解决这些痛点,但从论文SOTA到量产车上的实际安全表现,中间还有相当长的路要走。
从消费者的角度来说,其实不需要太纠结各家技术路线谁对谁错。2026年的智驾竞争,关键已经不在"谁的架构更先进",而在于两道硬门槛:能不能把装机量推到百万台以上形成规模效应,以及能不能把成本压到消费者愿意买单的水平。蔚来NWM更新后智驾使用率环比飙升超过80%,说明用户真正在意的不是技术名词,而是"好不好用"和"敢不敢用"。小米的世界模型能带来什么样的实际体验提升,最终还是要看它在真实道路上的表现。

话说回来,小米这次把"重建"和"生成"绑在一起搞的做法,确实给行业提供了一个新的解题思路。但让一辆车真正理解物理世界、预判风险,这事儿恐怕不是一套框架就能搞定的。各家车企都在用自己的方式接近同一个目标,2026年的智驾竞赛还远没到终局。
那么问题来了:你觉得当下这些辅助驾驶系统,你敢在高速上放心用吗?欢迎在评论区聊聊你的实际体验。
作者提示含AI生成内容。
