端到端自动驾驶正在消灭激光雷达
自动驾驶技术从 RNN 时代到 Transformer 时代只用了几年,却带来了对传感器选择的大调整。最明显的变化,就是很多新方案开始弱化甚至去掉激光雷达。下面按时间顺序把来龙去脉说清楚,不用形容成谁打败谁,只讲原因。个人整理,可能有错漏之处。

在 2016 年前后,端到端自动驾驶大多建立在 CNN+RNN 结构上。卷积网络负责把摄像头画面变成一串紧凑的特征,后面的 LSTM 或 GRU 追踪这些特征随时间的变化。RNN 的状态天生是连贯的,能记住之前几秒发生的事情,例如前车的速度和方向。它计算量不大,推理延迟稳定,非常适合当年的车规级算力。但 RNN 不擅长处理空间关系,更别说三维空间。为了弥补这一点,研发人员把激光雷达放进系统:激光雷达直接给出距离和高度,不再依赖网络推断。于是,一部分算力用来跑 RNN,另一部分用来做点云滤波、聚类、目标检测,两者结合就能把时序和三维几何都覆盖到。

事情的拐点出现在 Transformer 被引入自动驾驶之后。与 RNN 不同,Transformer 的自注意力让网络一次就看见整段序列里所有的时间点和传感器通道。它可以同时比较远处的红灯、旁边的行人、前方的道路标线,然后再决定加速或转向。多摄像头同步帧会被切分成规则的图像块,拼成“序列”送进网络,Transformer 能自己决定把注意力放在哪里。结果是城市驾驶的各种要素被打包进一张全局视图里,决策逻辑也比过去更加统一。

这种结构与激光雷达并不合拍。点云里动辄几万个点,如果把它们都当作序列元素,注意力计算量会以平方级别膨胀,根本跑不动。如果先降采样再输入,精度又打了折扣。开发者尝试过稀疏注意力、体素分层等折中方案,但都要额外做手工设计,和端到端理念冲突。与此同时,多摄像头配合几何校正技术已经能在鸟瞰平面补足深度信息,而且摄像头模组的成本远低于激光雷达。算力往往是车上最稀缺的资源,摄像头+Transformer 能把资源集中在一次反向传播里完成学习;加入激光雷达就意味着还要额外维护另一条点云处理链路,硬件和软件的复杂度都会提高。

激光雷达并非一无是处。在光照极端的时段,摄像头会受到影响,它依旧提供稳定的距离量测。只是从系统整体收益来看,纯视觉+Transformer 已经在多数场景达到量产车要求,企业在成本和复杂度上更愿意往这条路线收敛。所以,我们看到越来越多量产方案取消激光雷达,把资源全部押在视觉网络和高效的算力芯片上,把冗余设计放在车规摄像头阵列、安全机制上。
我一直不看好现在的激光雷达方案智驾的发展,但是展望之后的十年,算法路线必然不会停在 Transformer 上。我们已经在探索几种可能把三维点云和序列计算结合起来的新体系。一个方向是图注意力网络,把每个激光点当作图中的节点,用局部邻接关系约束注意力范围,既不过度膨胀算力,也能保留真实的空间结构。另一个方向是空间-时间统一编码,把相机像素、雷达回波、激光点云都映射到同一坐标系里,让网络在同一个张量里直接学习相关性,而不是分三条分支再做后融合。也有人尝试把稀疏卷积和自注意力拼接在一起,先用稀疏卷积压缩点云,随后用注意力做跨模态对齐。

如果其中某条路线或者新出现的路线能在量产芯片上实现实时推理,端到端网络能够天然理解稀疏三维结构时,激光雷达不会再是系统里的额外负担,此时就会重新成为智驾方案中的常规选项。
因此,激光雷达的未来并不是简单的退出或回归,而取决于下一代架构能否让不同传感器之间的协同更加自然高效。只要新的算法证明自己在安全指标、成本、算力三方面都具备优势,车企会毫不犹豫地重新评估激光雷达的价值。这就是技术演进的常态:哪条路线能够用更少的资源换来更高的安全余量,行业就会向哪条路线聚拢。下一次聚拢的方向,可能恰好又把激光雷达带回到车顶。
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
