端到端助力自驾算法“融会贯通”,大模型时代到来。
1、 端到端算法将驾驶行为“融会贯通”
端到端自动驾驶算法实现对驾驶行为的“融会贯通”。在传统模块化的自动驾 驶算法中,人类工程师依靠自己的经验将驾驶问题拆解和提炼为一些简单的过程, 通常情况下自动驾驶算法分为感知、预测、规划控制几个部分,以流水线式的架构 进行拼接,模块之间会以人为定义的信息表征方式进行信息传递,进而实现驾驶任 务。端到端算法则采用一个整体化的神经网络,在模型的一端输入感知信息,另一 端直接输出轨迹或者控制信号,将整个驾驶行为“融会贯通”。
2、 端到端算法优势显著但落地难度加大
2.1、 端到端的自动驾驶算法优势显著:
(1)信息无损传递,减少人为偏见,灵活度大幅提升且泛化性增强。模块化算法以人类定义的抽象结果作为中间产物,如感知模块将外部的汽车、 行人、道路等元素简化为检测框(Bounding box)或者占用栅格以及车道线等;而 预测和规划模块则根据上游感知提供的信息,将复杂的世界抽象为几类简单的场景, 分别输出轨迹点和驾驶路径和行为。这实际上会造成信息损失,当人为定义的抽象 的指标并不能很好的描述场景时,下游模块只能根据有限的信息做判断,造成错误 的结果,体验上来讲会造成模型对复杂场景的处理能力不足,泛化性差,决策僵硬。 端到端算法则可以将各个模块几乎所有信息传递给下游模块,并且由下游模块来决 定使用哪些上一环节的信息。例如当经过侧面有障碍物遮挡的小巷子时,如果人类 司机观察到障碍物后面有汽车发出的灯光,可能会提前减速。模块化的算法由于感 知端只检测障碍物、车道线等内容,可能会丢掉光照变化的信息,规控算法则无法 提前规避侧向来车;而对端到端算法来说,全部传感器感知到的数据都会被收集, 只要有足够的数据,模型会自己学习到灯光和驾驶员行为的关联进而拟人化的处理 相应的问题。
(2)面向整体驾驶目标进行全局优化。在模块化算法中,每个模块都以人类工程师定义的目标进行优化,各个部分分 而治之,可能出现局部最优但整体效果差的情况,如目标检测的指标是平均精度 (mAP),规控算法的检测指标要考虑碰撞率、任务完成率等。端到端自动驾驶则 对整个自动驾驶流程进行优化,神经网络的链式法则可以从输出端(控制)向输入 端(感知)贯通,输出结果可以将误差依次反向传播给所有模块,以最小化整体损 失函数为目标,更加准确地更新每个网络层中的参数,以使体验达到最优状态。 (好比考试的时候,答案中 ABCD 的占比是一样的,但如果不通篇看题目,会丢掉 这一重要的全局信息)在特斯拉 FSDV12 版本的视频中,有些时候会出现规控算法 不会完全按照感知呈现的结果执行驾驶行为,或许亦体现了全局优化的优势(规控 会根据自己的经验忽略掉一些感知出现的问题如误检等)。

(3)从“行为”学习“行为”,驾驶变得更加丝滑和拟人化。。这一优势也可以被视为用基于神经网络的算法取代基于规则为主算法带来的优 势。吴新宙在 GTC 大会上提到,在传统自动驾驶开发过程中,工程师希望定义一 些动作,通过建立状态机转换不同的动作来实现驾驶,而为了实现更好的驾驶效果, 会引入越来越多的动作让机器的行为尽量像人。但现实情况中,人类的行为难以通 过一些离散的动作量化,规则无法定义什么是好的驾驶,甚至有些场景下并无最优 决策,好比单纯用文字很难精确的描述一幅画的内容,何小鹏提到无限接近人的自动驾驶系统大概等效于 10 亿条规则,靠人类根本无法达到,因此传统算法产生的 驾驶决策死板单调,拟人性差。端到端或者说基于学习的规划让模型去学习人类行 为,会大幅提升算法的适应性和灵活度,据元戎启行在 GTC 大会上介绍道,元戎 的算法由于使用了端到端技术,不仅实现了舒适、高效,还会考虑后车需求,实现 了“礼貌”,如主动让出右转车道,地面有水会减速慢行等。
(4)数据驱动,发挥规模法则,性能突破上限。采用端到端的自动驾驶算法,可以采用无监督的算法训练方式,省去标注环节, 采用海量数据对模型进行训练,突破性能上限。而模块化算法则只能依靠工程师来 手动处理长尾场景,随着数据量的增大,效率逐步下降。
(5)精简计算任务,减少级联误差,降低延迟,计算简洁高效。模块化算法中,从传感器收集信息开始就不可避免的出现误差,每个模块产生 的误差如标定误差、定位精度误差、控制误差等会在模块间传递,最终会在下游累 积,导致控制模块收敛难度加大。同时,模块之间的数据传输和计算都需要花费时 间,导致整体算法延时较高,处理紧急场景能力弱。端到端算法则可避免上述情况 出现。此外马斯克亦表示,通过使用端到端自动驾驶算法,特斯拉采用 2000 行代 码代替了原本的 30 万行代码,整体算法框架变得简洁高效。
2.2、 端到端的自动驾驶算法亦存在可解释性差、落地难度大等问题
首先由于模型被构建为一个整体,无法像传统自动驾驶任务一样将中间结果进 行分析,因此可解释性较差。其次由于算法完全依靠数据驱动,对数据的质量、数 据分布等要求高,海量数据的获取或生成难度较大。此外仿真验证也是端到端算法 开发的难点,端到端算法更需要闭环评估,而在当前的技术条件下,缺乏良好的工具实现这一过程。最后对自动驾驶公司来说,算法的变化也意味着团队的调整,如 何保持团队稳定性和量产经验的复用亦存在难点。
3、 端到端算法形成三大落地形式
多模态基础模型和大语言模型齐头并进,端到端自动驾驶算法百家争鸣。目前 在自动驾驶端到端算法领域,大体形成几大方向:将不同功能的神经网络模块拼接 形成端到端的自动驾驶算法(显式);依靠多模态基础模型实现端到端自动驾驶算 法(隐式);以及依靠多模态大语言模型来实现自动驾驶。
3.1、 将多个神经网络拼接形成端到端算法(显式端到端):
显式的端到端自动驾驶即将原有的算法模块以神经网络进行替代并连接形成端 到端算法。该算法包含可见的算法模块,可以输出中间结果,当进行故障回溯时可 以一定程度上进行白盒化调整,训练时首先将每个模块分别训练,再将其拼接进行 联合微调和训练,在数据量有限的情况下更容易收敛,且对于算法团队来说可以最 大限度的继承此前模块化算法的开发能力,同时又具备端到端算法的优势,是目前 诸多量产玩家青睐的方案。获得 2023 年 CVPR 最佳论文奖的 UniAD 模型亦采用此 方法,可明显的观察到算法中仍包含感知、预测、占用预测、规划器等模块,并采 用向量将模块连接,形成灵活的端到端架构。
3.2、 多模态基础模型+自动驾驶(隐式端到端):
隐式的端到端算法构建整体化的基础模型,利用海量的传感器接收的外部环境 数据,忽略中间过程,直接监督最终控制信号进行训练。这类模型通常采用视觉或者。多模态的信息作为输入,模型直接输出控制或者轨迹信号。诸多玩家探索的自动 驾驶世界模型在这里也有应用,即将视频、甚至文字信息送入模型,此后模型可以 预测未来发生的事情以及所应该采取的行动,或者可以对所执行操作进行文字解释。 该方案理论上限更高,但训练难度高,收敛困难,对数据需求量大且可解释性差, 模型调整也较为困难,量产玩家如 Wayve 以及学术界做出诸多探索
Wayve 的端到端自动驾驶网络即采用单一的神经网络,直接输入感知数据,输 车辆的驾驶动作,中间没有抽象化的感知结果输出,因此车辆上也不包含通常自动 驾驶具备的“SR”(Situational Awareness,用来呈现自驾算法看到了什么)界面。
学术界百花齐放,世界模型成为玩家探索方向。近年世界模型受到市场关注, 通过将外部环境的信息进行编码,由模型基于这些输入的语料来预测未来世界可能 的状态,再通过不同的解码器解码出不同类型的信息,亦成为开发端到端自动驾驶 算法的一大方式。以极佳科技和清华大学联合推出的 DriveDreamer 为例,模型主要 采用注意力机制和 Diffusion 模型构建。可对驾驶场景实现全面的理解,集成了多模 态的输入数据如文本、视频、高精度地图、3D 检测框、驾驶行为等,可以实现可 控的驾驶视频生成和预测未来的驾驶行为。同时 DriveDreamer 还可以与驾驶场景互 动,根据输入的驾驶动作预测不同的未来驾驶视频。

3.3、 大语言模型+自动驾驶:
大语言模型采用海量的互联网数据进行自监督学习,可以对人类的问题给出优 质反馈。大语言模型凭借其强大的认知能力,越来越多的被应用于驾驶场景。经过 前期的预训练,模型已经吸收了驾驶相关的知识,并且广泛理解世界的“常识”, 通过好的提示词即可激发出其相关的能力。目前大语言模型可以被用于感知、预测、 规划、整个驾驶环节、以及驾驶行为解释上。尤其是大语言模型可以对话的特性, 让驾驶员可以对其做出的操作进行询问,增强模型的可解释性和驾驶的安全感。
目前工业界亦不乏大语言模型实践的先行者。端到端的坚定践行者 Wayve 公司, 在 2023 年推出了 LINGO-1,该模型在各类视觉和语言数据源上进行训练,可以对 感知、规划、推理等任务进行视觉问答,并可以对驾驶行为作出解释。升级版本的 LINGO-1 甚至可以对道路语义信息进行分割。
在学术界大语言模型用作自动驾驶的方案更如雨后春笋。GPT-Driver、 LanguageMPC、Drive like a Human、DriveLM、DriveGPT4 层出不穷。以港大和华 为诺亚实验室等发表的文章中的 DriveGPT4 为例,它是一个使用 LLM 的可解释的 端到端自动驾驶系统,通过将视频、语音提示、控制信号 Token 化之后送入大语言 模型,语言模型生成对人类问题的相应回答以及控制信号,再经过编码等步骤还原 成为文字和控制信息,即可对车辆实现控制。
当然,目前算法仍然存在一些问题如模型幻觉仍难以避免,当给定一个看不见 的场景,LLM 模型仍然会产生无意义或者错误的决策,此外 LLM 在训练的过程中 可能会包含有害的内容。此外大语言模型延迟较高,对计算资源要求较大,不易满 足端侧需求。最后大语言模型对 3D 场景理解度仍然不高,模型是否能够很好的适 用于驾驶场景仍然需要不断验证。