理想安全的家,大架构大平台

2024-10-10 14:36:26 0点赞 0收藏 0评论

理想汽车智能驾驶研发副总裁郎咸朋博士也认为,从技术架构上,理想最新的方案和特斯拉没有太大差别,甚至更领先一点。因为理想有VLM模型,有系统2,特斯拉只是有系统1的端到端。

理想安全的家,大架构大平台

理想汽车的端到端模型是One Model一体化端到端,与市面上其他汽车企业的端到端有些许不同。

常规的端到端技术,是只用人工智能模型,机械自学习的方式,去替代智能驾驶过程中的感知、规划控制等模块,从视觉的“输入”端,到智能驾驶系统最后控制车辆自行驶“输出”端,都完全由模型来处理。一个纯“端到端”的技术在这个过程不再设置规则式代码,成为一个完全的黑盒。

理想安全的家,大架构大平台

但市面上的很多汽车企业的端到端,包括特斯拉、华为和小鹏等走得相对靠前的厂商,仍然会设置一定的底层负责安全冗余的算法。感知、规划控制可能会是相对独立的模块,接口仍然需要被人工定义,和连接。

One Model一体化的端到端意在把感知、规划控制模块放在一起,在理想的内部被称为系统1,更像是一个司机,快速地执行端到端的决策。

过去,端到端在智能驾驶领域的应用,经常会遇到上限高,但下限也低的问题。比如业界领军企业特斯拉在美国加州的测试非常的丝滑,表现得已经很像一个人类司机,但一旦进入到不太熟悉的地区,会出现难以解释的规控决策。

理想安全的家,大架构大平台

这是端到端的弊端之一。

理想的做法是引入系统2——VLM视觉语言模型,再往前迈一步。

按照理想的说法,VLM视觉语言模型是世界上第一个成功部署在车端芯片的大模型,具备应对复杂场景的逻辑思考及决策能力。

除了One Model端到端之外,系统2——VLM是作为辅助系统1进行规划决策的另外一套模型算法。基于VLM的系统2能够提供复杂环境的理解能力、读懂导航地图的能力以及交通规则的理解能力。

理想安全的家,大架构大平台

郎咸朋给这套组合一个更通俗的解释:系统1就像是司机,而系统2是一个驾校教练。系统1完全靠自己的视觉感知,执行操作,系统2需要长期积累知识给系统1提醒和告知。

理想汽车智能驾驶高级算法专家詹锟,他的团队率先提出了这个概念。仿照认知心理学家、诺贝尔奖得主丹尼尔·卡尼曼——其认为,人脑就带有这样的两个系统,第一个系统基于经验和直觉,第二个系统会综合学习积累的逻辑推理能力。

理想安全的家,大架构大平台

两个系统为整个理想的智能驾驶服务,这也让理想的智能驾驶方案完全不同于其他车企。

在美国市场,特斯拉FSD在算力上和数据上都是领先者。

理想安全的家,大架构大平台

但在中国市场,理想的策略似乎是在复刻一条“中国特斯拉智驾之路”,使得自己的身位更靠前一点。

郎咸朋称,“在中国的训练算力和训练数据上,我们认为至少从现在看我们是领先于特斯拉的,因为特斯拉不管是数据的合规性,还是受到中国的一些约束,以及训练算力的部署,在中国还需要搭建。

理想在数据测试流程上,也引入了一套世界模型的体系。

理想称,世界模型支撑了全新一代理想智能驾驶大范围、高速迭代,提供了自动化的AI能力评价体系,通过重建技术将用户遇到的问题场景变成“错题集”,通过生成技术将用户的真实驾驶场景举一反三为“模拟题”,两个技术确保了在模型评价时错题不再做错,同时兼具优秀的泛化能力。

基于理想One Model+VLM+世界模型的技术方案,这也让全新一代的理想智能驾驶产品迈入了“有监督的自动驾驶”新阶段。

理想是第一家将VLM部署到Orin-X芯片的企业,也是第一个迈出双系统架构的车企。在中国,理想已经拥有接近百万级的销量规模,这势必会提升有效数据的占比。理想汽车目前累积的训练里程已超过22亿公里,预计到2024年底将超过30亿公里,理想汽车当前训练算力达到5.39EFLOPS,预计到2024年底将超过8EFLOPS。

但业界对于端到端技术的应用和前景仍然是争吵不休——有人认为没有500亿做不了智驾,有人认为至少在未来几年内,基于规则的模型算法和单一模块功能的端到端仍然会并行,纯端到端仍然是扯淡。

一定程度上,理想用户体验团的测试效果验证了这条路目前的合理性。无论如何,理想汽车率先迈出了这一步。

理想汽车智能驾驶研发副总裁郎咸朋博士、理想汽车智能驾驶高级算法专家詹锟

以下是和理想汽车智能驾驶研发副总裁郎咸朋博士、理想汽车智能驾驶高级算法专家詹锟的交流速记,对话经过不修改原意的编辑:

提问:市面上大家都说自己是端到端,什么才是真正的端到端?

詹锟:端到端是一种研发的范式,顾名思义,它是指做一个任务,从最开始的输入端到最后的输出端,中间没有其他的过程,用一个模型完整从输入到输出,这是端到端的本质含义,只要满足这个含义的,我们都可以称之为端到端。

现在理想汽车是一体化One Model端到端,通过直接传感器输入,模型推理完毕后直接给到轨迹规划用来控车,这就是一体化端到端,中间没有其他步骤。还有一种端到端的方法,是在中间分两个模型,模型中间以一个信号做桥接,输入是一个感知的模型,把感知结果再输入归控模型,合在一起成为一个模块化的端到端,这或许也能称为一种端到端,但是我们认为这样的端到端并不是真正的端到端。理想汽车的端到端本身想解决中间信息的损失,如果中间加了人为的信息消化过程,可能效率不是那么高或能力上限受到约束,所以我们认为一体化的端到端是更本质的端到端。

提问:我们是不是受到特斯拉的启发,相比于传统的模块端到端有没有什么区别?

詹锟:特斯拉的确在2023年初就提到了端到端,也是马斯克在推特上说它体现了一个完整的从输入到输出直接控车的模型。大家看到这个消息后也很震惊,因为这个东西并不是他们刚提出来,在2016年的时候英伟达就有一个模型提到了端到端,也发表了一篇论文,但效果一般,只解决了特别简单的场景,以当时的算力和模型规模下,大家认为这条路是行不通的。

到2023年,在新的transformer的架构上增加了超大算力,特斯拉做出来之后,又可能出现一个新的范式的复苏。端到端不是特斯拉第一个提出来的,但在往更有成长的方向上推进。我们看到以后,内部也在思考,端到端相比于以前模块化的模型,更本质的方法是减少了各种信息的冗余。在无图上,我们接近于模块化的端到端,我们有感知大模型,其实就是一种模块化的端到端模型。即使这样,我们发现端到端的模型还是需要规则,还是有分模块的数据和分模块的策略任务。

我们这次在新的方案讨论和构思上,提出端到端一定要更彻底、更本质。理想汽车有非常丰富的数据,我们相信这些数据是能够支持我们做好的,这是我们的优势。所以我们选择了挑战更大、更困难的端到端一体化架构,它的上限很高,但缺点是训练比分模块的要难,包括数据配比和训练方法有很多的know-how需要去探索和挖掘,但我们还是毅然决然地选择了难而正确的道路。

提问:现在很多品牌提出自己是引领者,理想汽车也在说已经跻身智能驾驶第一梯队,怎样评价市面上这些企业的端到端的技术水平?

郎咸朋:从技术方面来看,对于普通消费者来说,他们并不关注是有图还是无图,端到端还是非端到端,大家最终关注的是产品和使用的体验,是产品价值。所以,我们不是要和谁比,而是希望能够为我们的用户提供更好的产品和服务。之前配合高精地图的高速NOA,高速NOA的体验达到了用户的使用需求。接下来,我们在做城市NOA的过程中尝试了很多种方式,其中一个很简单的思路是用有图的方式做城市NOA,但是发现并没有一个图商能够提供城市的高精地图,只能提供轻图。但我们认为轻图不行,因为一旦需要迭代图,就会出现时效性和是否能够真正使用的问题。我们不能够让用户感受到某个地方今天能用但明天就无法使用。

最后,我们决定就做无图。以前的无图方案还是感知、规划、分模块的方案,里面有大量的人工规则和实车测试,先不说预算投入方面,时间上就非常困难。当模型迭代出来,如果想将一年四季的各种情况都跑一遍,没有一两年时间是不可能实现的,而且用户也不可能等那么久。所以我们又迭代到端到端+VLM技术架构,我觉得这个技术方案,本质上是人工智能方案,它不是设计出来的,而是自己成长出来的。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松