当前位置:
AIGC文章详情

张大妈

深扒了学术界和工业界的「空间智能」,更多的还停留在表层......

源自知乎:自动驾驶之心

01-18 17:16

自动驾驶正从“看清世界”迈向“理解三维空间运作”的新阶段,空间智能成为核心驱动力。本文深入剖析了这一概念,梳理了学术界与工业界在时空推理、物理交互等关键方向的技术突破,旨在为理解下一代自动驾驶技术演进提供清晰蓝图。

深扒了学术界和工业界的「空间智能」,更多的还停留在表层......智能速览

  • 空间智能的核心是理解物理世界的三维运作规律。

  • 世界模型与生成式技术正用于破解自动驾驶的长尾难题。

  • 工业界共识是从模块化架构向端到端VLA架构演进。

  • 可解释性与闭环控制是衡量空间智能成熟度的关键。

  • 自动驾驶与具身智能在空间推理层面正加速融合。

深扒了学术界和工业界的「空间智能」,更多的还停留在表层......精华内容

要真正理解空间智能的价值,需深入到具体的技术实现中。从世界模型的构建到端到端决策的闭环,每一项突破都在重塑自动驾驶的技术边界。

生成世界模型

学术界正通过生成式技术构建物理世界的“沙盒”,以模拟极端场景。GAIA-2利用潜在扩散模型(LDM),生成具备时空一致性的多视角驾驶视频,确保AI理解多摄像头间的几何关联,解决了生成内容的空间扭曲问题。其升级版GAIA-3将规模提升5倍,旨在捕获更细粒度的时空上下文。

ReSim则另辟蹊径,将真实世界的专家轨迹与模拟器生成的危险行为(如碰撞)进行异构融合。通过扩散Transformer架构,它实现了对罕见、高风险物理交互的高保真模拟,有效解决了AI对极端空间状态的认知缺失。

强化空间推理

为超越表层感知,研究正致力于强化AI的结构化几何推理能力。“空间智能网格(SIG)”方案通过将场景布局和物体关系编码为结构化图谱,替代了纯文本提示,强制多模态大模型进行真实的几何推理,而非依赖“语言捷径”。

OmniDrive则引入“反事实推理”,通过生成大规模3D问答数据集,弥补了语言逻辑与物理轨迹的鸿沟,让视觉语言模型能真正理解三维环境下的风险。SimLingo提出的“动作梦境”任务,则要求AI将语义指令精确转化为物理执行信号,解决了“言行不一”的难题,实现了驾驶行为与语言指令的高度对齐。

工业架构演进

2025年,工业界在架构设计上达成共识:从传统模块化架构转向端到端的VLA(视觉-语言-动作)架构。Waymo的EMMA模型将所有传感器输入和驾驶输出均表示为自然语言文本,利用大模型的世界知识进行复杂推理。

其提出的“快速思考与慢速思考”架构,由系统1(传感器编码器)负责快速反应,系统2(驾驶VLM)处理复杂语义决策,如在路面起火时选择绕行。国内元戎启行的DeepRoute IO 2.0则引入思维链推理,解决了端到端模型的“黑盒”问题,使系统能用语言解释其决策路径,显著提升了信任度。

跨域智能融合

空间智能的价值正跨越单一领域,推动自动驾驶与具身智能的深度融合。小米推出的MiMo-Embodied是全球首个开源跨具身大模型,它通过在自动驾驶和机器人任务上的联合训练,验证了两者空间推理能力的显著正向迁移效应。

实验证明,车辆对宏观交通流的理解可以增强机器人的导航能力,而机器人对微观物体交互的认知也能反哺车辆的决策。这一突破标志着“自动驾驶”正式被纳入“具身智能”的宏大技术版图,预示着通用人工智能的进一步实现。

空间智能正在为自动驾驶描绘一幅更宏伟的蓝图,它不仅是技术的堆砌,更是对物理世界更深层次的认知与交互。随着生成式世界模型与具身智能的深度融合,未来的出行将远超想象,真正的无人驾驶时代或许已不再遥远。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章