Waymo、nuScenes全拿SOTA!小米这波"世界模型"到底在下一盘什么棋?
当所有人还在讨论小米卖了多少台车的时候,它已经在用AI重新定义"驾驶"这件事本身。
小米汽车又干了件让人意想不到的事。
不是新车,不是降价,而是一个叫 Xiaomi Auto World Model 的全新技术框架。5月26日,小米技术官微正式发布,核心信息只有一个:在Waymo、nuScenes两大全球顶级基准测试中全面SOTA。
但你先别急着划走——这不是一篇发论文的新闻,这是一件关乎未来你车里到底有没有"真智能驾驶"的事。

Xiaomi Auto World Model架构:WorldRec锚定几何,WorldGen填补想象 / 图源:PChome
一个被行业忽略的老问题
先说背景。自动驾驶的世界模型,说白了就是让AI能"想象"接下来的驾驶场景——前面路口左转之后会看到什么?暴雨天前车突然刹停怎么反应?
目前行业有两条路:
一条叫重建(WorldRec)——从多个摄像头画面中恢复精确的3D场景。好处是几何准确,坏处是只能还原已经看到的东西,没有想象力。
另一条叫生成(WorldGen)——用扩散模型直接预测未来画面。好处是能"脑补"未观测的角度和没发生过的场景,坏处是缺乏3D结构约束,时间一长画面就开始漂移失真。
两条路各走各的,谁也没法单独解决问题。 这就是行业卡了这么久的原因。
小米做了什么?两个字:耦合
Xiaomi Auto World Model的核心创新,是把重建模块和生成模块深度耦合在一起——不是简单串联,而是在结构上互相约束、互相增益。
WorldRec提供几何锚点,给生成"打地基",抑制长时序自回归中的误差累积和内容漂移;
WorldGen补全未观测区域,给重建"扩边界",填补摄像头拍不到的地方;
4D场景表征作为跨帧共享记忆,确保不同时刻、不同视角下场景内容全局一致。
效果?在Waymo和nuScenes两大全球最权威的基准测试上,全面SOTA。
说白了,别人还在"重建"和"生成"之间做单选题,小米直接把两张卷子一起交了,而且分数最高。

多视角重建+生成联合效果,4D场景表征确保全局一致性 / 图源:腾讯新闻
这不只是论文,已经落地了
很多技术发布止步于paper,但小米这次不一样——三大核心场景已经业务落地:
第一,合成数据生成。 已交付超过10万clips高质量合成数据,直接喂给感知模型训练。什么概念?真实路上很难遇到的危险场景——行人横穿、极端天气、事故现场——AI可以"凭空生成"出来让智驾系统学习。这不是凑数据量,这是补齐了现实世界永远采不到的那块短板。
第二,仿真测试。 闭环仿真环境,可以在虚拟世界中复现真实事故进行定向优化。以前测100万公里才能碰到的corner case,现在在仿真里反复跑、反复调,效率翻了几十倍。
第三,辅助驾驶学堂。 这是最有意思的落地——用世界模型动态生成第一人称驾驶教学视频。你面对复杂路况不知道怎么处理?系统直接给你"播放"一段正确的操作演示。目前已上线小米全车型的辅助驾驶学堂-实景模拟场景。

WorldGen极端场景生成:填补现实采不到的"长尾数据" / 图源:腾讯新闻
小米在下一盘什么棋?
当大多数造车新势力还在比谁的车更便宜、谁的屏幕更大、谁的零百更快的时候,小米已经在打一场基础设施级别的战争。
世界模型不是某个车型的卖点——它是整个智能驾驶体系的底座。谁掌握了更好的世界模型,谁的感知训练就更强,仿真效率就更高,迭代速度就更快。
这是一个飞轮效应:模型越强→合成数据质量越高→感知训练越好→实车表现越优→更多真实数据回流→模型更强。

"重建锚定几何、生成填补想象"——小米提出的世界模型新范式 / 图源:PChome
这也是为什么小米不只把World Model当技术储备,而是第一时间推进三大场景落地——它需要这个飞轮转起来。
当别人还在卖车的时候,小米已经开始卖"让车变聪明的能力"。 这才是SOTA背后真正值得关注的信号。
你觉得世界模型会改变智能驾驶的格局吗?小米这波操作你怎么看?评论区聊聊。
作者提示含AI生成内容。
