5. 李想在新一期视频里又说了一下为什么要自研芯片,以及车辆除了芯片以外,其他硬件层面变化对辅助驾驶能力的提升。
李想:我们会逐步从 2D ViT 发展到 3D ViT,过去传统的 2D ViT 是没有办法真正理解物理世界的,只有做了 3D ViT 才真正像人一样的去感知世界。
这个背后的原因是因为我们做了自己的芯片,因为我们原来使用其他供应商提供的芯片就会遇到一个挑战,比如在这个芯片上它的视频编码器是一个黑盒子,我们改不了。
比如说我们想做 3D ViT,那我就得,第一得先去改它的视频编码器,第二我要有足够的算力能够去运行 3D ViT,那这就是非常大的挑战。
但是我们的采用了全世界先进的车规级的 5 纳米的马赫 100 的芯片,它的算力是我们当前最好性能的芯片的三倍以上。
而且我们用的是数据流的一个架构,当我们需要做 3D ViT 的时候,我们其实只需要通过我们非常强大的编译团队在芯片上给到 3D ViT 足够的计算的这样的一个模块,因为它不是写死的,是通过编译器来定义的,那整个这个能力我们就可以实现。
其实身体也要发生变化,因为传统的汽车是通过 MCU 去控制一些机械结构,其实整个的响应速度就会慢很多。那我们如何能够做到比人还快的响应速度?
在这一代 L9 上我们推出了全线控系统,包括线控的转向、全电控机械制动,配合我们的线控转向特别设计的四轮转向,还有主动的悬架,就是每个悬架有四个电机进行控制,带来一个什么样的好处呢?就是它的整个响应时间极快,第二速度快了以后也会特别安全。
第三个还有一个特别大的一个好处,就是整个控制也不一样了。是我们可以通过模型直接输出来控制转向和刹车,避免了过去的时候还要进入到一个独立的 XCU 里边再去做计算,所以整个这样带来的时候它能够获得比人还要好的肢体的灵敏程度,所以我说这是具身智能的一个非常重要的一个表现。
------
上面这些内容其实李想在之前财报电话会议的时候就说过:
- 现在的 3D BEV、OCC 占用网络、2D ViT,有效的感知距离(而非理论上最大)只有 100 多米,如果升级成人眼工作原理相似的 3D ViT,有效距离可以扩大 2-3 倍;
- 一个 4B MoE 的模型运行帧率是有 10Hz,而执行系统是 60Hz,如果模型运行的帧率可以快 2-3 倍,现在辅助驾驶的一些舒适性的问题、反应迟钝的问题都可以有效的解决;
- 以上两点需要感知模型的研究和研发的重大突破和 M100 这样为具身智能定制设计的芯片和编译器团队高效率的配合,对传统的 GPU 架构和算力进行深度的改造和定制,以及专有的操作系统;
- 人类的刹车、转向的最快响应速度在 450 毫秒左右,目前自动驾驶从感知到执行的完整链路在 550 毫秒左右,线控体系可以把整个链路的响应速度提升到 350 毫秒。
上面说的很多问题其实和我之前发过的很多场景是完全拟合的,比如刹车点晚,博弈节奏问题。
-----
简单来说就是感知能力更强、计算能力更强、响应速度更快、执行延迟更低,带来更接近人类的感知能力和反应速度。
对理想新一代硬件的辅助驾驶体验预期已经拉高了,就等体验交付出来的结果了[并不简单][并不简单]
#全新一代理想L9# http://t.cn/AX5860Yk