2024至2025年,中国智能驾驶行业经历了两次关键性技术拐点,性能实现跃升。这些突破背后,是一群低调的开发者与其卓越的学术成果。通过解读11篇重磅论文,可以清晰地看到国内智驾技术从感知精度到决策逻辑的完整进化脉络,理解这场技术革命的内在驱动力。

智能速览
中国智驾行业在2024年底和2025年出现两次关键性能拐点。
车端模型从两段式迭代为一段式,逼近特斯拉FSD V13能力。
云端模型融入多模态理解与因果推理,打开跨域应用大门。
BEVHeight++用高度信息替代深度,提升了纯视觉感知稳定性。
FastDriveVLA通过剪枝框架,将VLA模型计算负载降低75%以上。
具身交互智能架构被提出,为L5级自动驾驶指明了终极方向。
精华内容
这两次技术拐点并非凭空出现,背后是无数研发者对技术难题的精准攻坚。以下是推动行业进步的几项关键突破:
感知技术革新
清华大学的杨磊团队提出BEVHeight++框架,通过挖掘“海拔高度”这一更稳定的物理量替代传统深度预测,解决了纯视觉在坡道与颠簸路面抖动的问题,让纯视觉感知方案更接近昂贵激光雷达的精度与稳定性。
上海交通大学的明南团队则专注于路面“褶皱”,利用马尔可夫随机场建模,实现了对坑洼、碎石等小型障碍物的高精度分割,补全了非平整路工况下的关键感知拼图。
效率与数据革命
面对大模型巨大的算力开销,北京大学的曹家俊与小鹏汽车合作,开发出一种token剪枝框架,在不损失精度的前提下,将计算负载降低了75%以上,赋予VLA模型“排除杂念”的能力。
在数据处理端,清华大学的陈小雪与小米汽车研发的DGGT框架,将4D仿真场景的重建时间从数小时压缩至0.4秒,让海量路测数据得以实时转化为仿真训练素材。
中科院自动化所与引望智能的研究则解决了“监督赤字”问题,他们利用世界模型生成稠密的自监督信号,有效缓解了传统VLA模型因监督信号稀疏而导致的性能饱和瓶颈。
决策认知升维
如何让机器更像“老司机”?香港科技大学(广州)的鲁洪良团队引入了“拟人化认知编码”,让车辆通过风险分级与行为信念,预判自身动作对交通流的影响,实现更平顺的社会化交互。
清华大学AIR的蒋安庆与博世中国提出了DiffVLA框架,结合LLM的常识与扩散模型的生成能力,在复杂博弈中生成并筛选出最优轨迹,赋予系统“决策弹性”。
香港中文大学(深圳)的林宏彬与小鹏汽车合作,通过在潜空间中构建“思维链”,让模型在复杂工况下“三思而后行”,显著降低了闭环模拟中的碰撞率。
未来范式探索
北京工业大学的马楠教授与中国工程院院士李德毅共同提出了“具身交互智能”架构,旨在将自动驾驶从“感知-规划-控制”的机械链条,升级为具备“物理直觉”和“社会常识”的生命体,为L5级无人驾驶指明了终极方向。
此外,蔚来的任少卿在2015年发表的《Faster R-CNN》作为深度学习在目标检测领域的开山之作,至今仍是行业基石,获得了NeurIPS 2025时间检验奖,彰显了其跨越十年的深远影响力。
这些突破性的研究共同勾勒出中国智驾从感知到决策,再到认知的进化全景。当技术与人性开始交织,自动驾驶的终点或许不再是冰冷的机器,而是能与人类共建交通规则的智能伙伴。下一座高山之后,又将是怎样的新边疆?