2025年汽车行业比较研究系列:AI智驾2.0,迈向智能涌现

  • 来源:平安证券
  • 发布时间:2025/11/25
  • 浏览次数:534
  • 举报
相关深度报告REPORTS

汽车行业比较研究系列:AI智驾2.0,迈向智能涌现.pdf

汽车行业比较研究系列:AI智驾2.0,迈向智能涌现。智能驾驶演进已从2024年的端到端范式确立,迈入到AI智驾2.0的规模化能力兑现期。基于模型能力提升及多样化的训练数据,智驾系统可能涌现出自主应对极端边缘场景的能力,从而推动智驾系统进一步打通商业闭环。技术迭代:特斯拉在智驾软件FSD、核心智驾硬件、Robotaxi业务、人形机器人上正进行多个重要迭代。得益于更高性能的下一代芯片,FSD智驾体验有望得到大幅优化。我国智能辅助驾驶行业从规则时代迈入数据驱动的AI时代以来,目前主流玩家已进入AI智驾2.0阶段:以理想汽车/元戎启行为代表的VLA(视觉-语言-动作)技术架构有望突破传统端到端模型局限...

一、 特斯拉智驾的软硬件层面新迭代

2025 年,特斯拉正式发布其“宏图计划”第四篇章,其 CEO 马斯克表示,FSD 和 Optimus(人形机器人)的规模化将是 特斯拉最为重要的事项。根据特斯拉发布的《秘密宏图第四篇章》,特斯拉已构建起一个高度体系化的可持续产品生态系统, 从交通运输到能源生产,从电池存储再到机器人技术。

特斯拉FSD V12转向端到端架构,带来智能驾驶的重大飞跃,特斯拉凭借其全球化的庞大车队和较早推广FSD软件的优势, 在总里程上继续保持领先优势,根据特斯拉 3Q25 业绩电话会,特斯拉 FSD (Full Self-Driving, 监督版)累积行驶里程超过 60 亿英里。同时依赖特斯拉不断更新的算法、硬件,以及 Robotaxi 等新商业模式的拓展,有望带来更高的智驾体验上限, 特斯拉智驾全球领先优势也进一步增强:

智驾算法更新——FSD V14 采用新软件架构,参数规模实现大幅提升,这将极大地提升系统的性能和决策能力。据 IT 之家 10 月 7 日消息,近期特斯拉FSD 已向北美用户推送FSD 14 首个版本,该版本整合了特斯拉 Robotaxi 自动驾驶 出租车项目中的技术成果及经验,据软件更新日志,该版本主要更新功能包括:新增到达选项,紧急车辆避让,视觉 导航整合,速度模式选择,系统容错及恢复能力,摄像头自动清洗,后续将改进行驶平顺性及停车精准度。

智驾核心硬件——下一代芯片 AI5 性能指标远超 AI4,这部分得益于软硬结合的设计方式,提供更好的性能/能耗比。 根据 IT之家信息,近期马斯克在 X平台表示,特斯拉AI5 芯片有望成为“针对参数规模约 2500 亿以下模型的最佳推 理芯片”。并指出该芯片“在芯片成本上远超同类产品,且能效比(性能/瓦特)表现最佳,AI6 芯片将把性能提升到更 高水平。”

商业模式——Robotaxi 业务进展:2025 年二季度特斯拉在奥斯汀为付费客户提供了首次无人驾驶的体验。根据特斯 3Q25 业绩电话会,特斯拉现有 Robotaxi 车队在无安全员状态下已累计行驶超 25 万英里,预计到 2025 年底奥斯汀州 地区实现无安全员运营。而根据 2025 年特斯拉股东大会披露,特斯拉专为无人驾驶设计的 Cybercab 将于 2026 年 4 月开始生产,该车无踏板、无方向盘,Cybercab 生产节拍目标将降至 5-10 秒/辆,年产能从 50 万辆上升至 200 万辆 甚至 500 万辆。

特斯拉人形机器人将于 2026年量产。根据特斯拉规划,其第三代人形机器人(Optimus V3)将于 2026 年一季度发布,量 产指引方面,特斯拉将搭建一条年化产能 100 万台的生产线,将在 2026 年年底前启动生产。马斯克曾在 2025 三季度业绩 电话会表示,擎天柱(Optimus)机器人面临的三大难题是——灵巧手、一个能感知并理解现实世界的 AI 大脑、以及规模化 生产。而在成本方面,马斯克预计当年产量达 100万台时,单台生产成本大约 2 万美元-2.5万美元,价格主要取决于机器人 的 AI 芯片成本。

二、 我国高阶智驾发展迈入第三阶段

高阶辅助驾驶系统大致围绕三个大的阶段在发展:

第一阶段:规则系统阶段。该阶段的系统主要依赖预设规则进行控制,在感知环节后通过大量手写代码实现决策与执 行。然而,由于现实道路场景复杂多样,基于规则的横向与纵向控制往往难以兼顾不同情境,易出现“顾此失彼”的 “跷跷板”效应——即优化某一场景的控制性能,可能引发其他场景下的控制异常。

第二阶段:混合系统阶段。该系统尝试结合数据驱动与规则方法,部分功能由学习生成的轨迹控制,其余仍由规则代 码处理。然而,规则与模型之间的逻辑冲突常导致系统行为不一致,表现为车辆在某些场景下出现犹豫或异常动作, 反映出混合架构在协调性方面的本质局限。

第三阶段:完全数据驱动的系统构建方式。目前,特斯拉在这一方向上实现了技术突破,构建出纯数据驱动的辅助驾 驶系统,展现出强劲的产品竞争力。尽管其全范围推送尚处于逐步推进中,但此前小范围测试所表现出的技术领先性 已获广泛认可。提升智驾系统性能及泛化性的关键在于系统基础能力建设、实现全链路数据驱动。

目前我国高阶智能辅助驾驶已迈入第三阶段。我国智驾发展阶段已从硬件堆料阶段(2021 年左右,比拼单车感知硬件及智 驾芯片算力),迈过人海战术的规则阶段(2023 年左右,比拼开城数量),进入到数据驱动的全新发展阶段(2024 年开始)。 特斯拉 FSD V12 引领端到端智驾,理想、小鹏、华为等本土智驾企业快速跟进,端到端模型把车辆传感器收集到的感知信 息,转换为行驶轨迹或操作指令,通过大量的数据训练做到全场景智能驾驶、并持续提升智驾流畅度和拟人度,端到端模型 上车标志着智能驾驶从规则时代迈入数据驱动的 AI 智驾时代。以理想汽车为例,2021 年理想汽车就开始自主研发辅助驾驶 系统,历经技术迭代,从早期的基于规则算法的轻图、无图方案,逐步发展到端到端+VLM(视觉语言模型)架构,并最终 推出 VLA(Vision-Language-Action)司机大模型。

基于真实数据的规模效应催生端到端 2.0阶段到来。端到端开启量产以来,主流智驾玩家技术架构均进行了进一步迭代,总 体趋势是训练端更强调强化学习,车端强调更高程度的模型化。我们把 2025 年的新一轮技术架构迭代称为端到端 2.0,相较于端到端 1.0,架构更统一,即使用一个神经网络完成从感知到控制的映射,进一步减少人工规则和模块接口。 本篇报告主要列举当前主流智驾玩家如华为智能汽车解决方案 ADS4.0、理想汽车/元戎启行、地平线机器人/Momenta 的智 驾方案的边际变化。

理想汽车和元戎启行的 VLA路线。二者在 2024 年推送智驾端到端后,于 2025 年发布了各自的新一代智驾模型架构, 理想汽车在 2025 年 9 月 10 号已开启VLA 司机大模型的全量推送。元戎启行则在 2025 年 8 月发布 VLA 智驾模型,宣 布已获 5 款车定点,首批量产车即将投入市场。

华为 ADS4.0的 WEWA架构。通过云端“世界引擎”与车端“世界行为模型”协同,实现了从ADS3.0 的模块化组合 到“AI 训练AI”的端到端一体化。华为路线与VLA 路线的本质差异在于,华为路线不依赖语言作为翻译和推理介质, 让多模态传感数据直接映射为控制动作,旨在构建对物理世界的直接认知模型,以实现更低延迟和更高可靠性。 地平线 HSD 与 Momenta 最新一版方案则强调一段式端到端+强化学习。本质是摒弃了传统模块化或“两段式”方案 的拼装模式,致力于构建一个从传感器输入直接映射到控制输出的统一模型,并通过强化学习使系统具备从交互中自 我进化的能力。

三、 技术架构:主流智驾玩家迭代方向

3.1 VLA 方向

在端到端模型的基础上引入大语言模型后,升级为多模态的视觉-语言-动作模型,即 VLA(Vision-Language-Action)模型。 VLA 融合视觉(Vision)、语言(Language)和动作(Action)三大模态,通过统一的多模态学习框架,将感知、推理与控 制一体化,直接根据视觉输入(如图像、视频)和语言指令生成可执行的物理世界动作(如机器人关节运动、车辆转向控制)。 VLA 模型将语言推理融入智能辅助驾驶,这意味着 AI 智驾迈入了全新阶段,对车辆所处物理空间的识别理解能力、长时序 推理能力提高,人机交互的体验更好。元戎启行周光认为:VLA 是智能驾驶进入大模型范式的一个起点。 由于融合了语言模型,VLA 模型具备强大的思维链能力,能摆脱传统端到端模型的黑盒难题,并将信息串联、分析,从而推 理出因果关系。此外,它天然集成海量知识库,泛化能力更强,能够更好地适应复杂多变的真实道路环境。VLA 作为新一代 AI 架构,它不仅能“看懂”图像、“读懂”语言,还能基于理解直接驱动决策与动作,被视为大模型从“会说”走向“会做” 的关键拐点。

VLA 训练过程:VLA 模型的研发需经历架构设计、数据探索和规模化、模型验证、部署上车及持续迭代等流程。在训练方 式上,VLA 采用多模态训练,融合视频、语言与行为数据,模拟人类驾驶认知的形成过程。即预训练(掌握交通规则与道路 基础知识)、后训练(进行场景化“上路练习”)、强化训练(通过经验积累不断提升决策能力)。

基座模型预训练:模型需要学习“看”和“说”。通过海量道路图像和语言数据(如交通规则、导航指令),训练模型 理解视觉场景与语言的关联。

动作微调:随后,加入驾驶行为数据,教模型如何“开车”。这一阶段通过模仿学习实现,模型观察人类司机的操作(如 转向、刹车),学习将视觉和语言输入转化为动作。这一阶段依赖大规模量产车数据,以确保数据多样性。

强化学习优化:最后,模型进入“实战训练”。通过仿真环境或人类反馈,模型学习更优策略,例如避免危险行为或适 应复杂交通流。这一阶段也包括对齐人类价值观(如安全驾驶习惯),确保AI 司机不仅能力强,而且具备“职业素养”。

VLA 带来哪些智驾体验的改善?

VLA 突破了传统端到端模型的局限,具备思维链推理能力,可进行因果推断,并以自然语言呈现决策逻辑,有效解决 “黑盒”问题,提升系统透明度和用户信任度。其集成的海量知识库增强了泛化能力,能够适应复杂多变的真实道路环境,并具备跨地域适应性,可根据不同驾驶风格调整策略。VLA 还支持长时序推理,能够妥善处理人车博弈等复杂 交互场景。

对用户而言,搭载VLA 的车辆将智能驾驶体验从执行命令的“工具”升级为具备沟通、思考和预判能力的“专属司机”。 用户可通过自然语言直接与系统交互,例如使用“找条人少的路”等富含语义的指令。VLA 的防御性驾驶能力可显著 提升行车安全,例如从公交车异常停车推断“车后可能有人”并提前减速。系统还可通过语言接口实时响应用户的个 性化调整需求,提供定制化智驾体验。

基于 GPT架构的 VLA 展现出强大的概念理解能力,能够灵活应对训练数据中未出现过的新场景。

VLA 当前瓶颈与未来空间如何?

我们认为VLA 是智能驾驶进入大模型范式的起点,随着时间的积累,数据规模的扩大,VLA 的潜力将逐步释放,但由于VLA 上车时间尚短,仍存在发展瓶颈和不足:

车端算力及存储带宽不足制约模型潜力释放。现在车端智能驾驶芯片尚未针对大模型进行优化,存储带宽有限。如果 将大语言模型部署在云端,数据回传至车端控车,会导致较大的时延,不能满足车辆的及时响应要求,车端部署模型 对车端算力提出了较高要求。随着模型参数规模扩大,VLA 模型对车端算力需求将大幅提升。

数据规模不足影响系统泛化性。数据规模不足导致模型泛化能力有限,尤其在极端天气、异形障碍物等长尾场景中表 现不稳定。强化学习依赖来自真实世界的数据。

价值观对齐。确保智驾系统的表现符合交通规则,避免系统为追求通行效率而发生加塞等不良驾驶行为。根据理想汽 车公众号披露,理想汽车在数据训练量达到 1000 万 CLIPS 后建立了超过 100 人的超级对齐团队。 VLA不仅可应用于智驾解决方案,更是走向“通用人工智能”的关键路径。VLA 的架构可复用于机器人、物流车等移动载体; VLA 可通过思维链进行长时序推理,能基于历史记忆(history memory)推演多步(如预判 15 秒后的盲区风险),进行全局 分析与决策;VLA 能实现记忆语音交互,赋予机器协作式沟通能力,让“AI 司机”成为现实。VLA 的价值不仅是让车学会“思 考”,更是为机器植入物理世界的认知基因,还将重构 AI 与物理世界的交互范式,为通用人工智能铺就现实路径。

3.2 华为 ADS4.0,面向 L3

华为智能辅助驾驶解决方案发展复盘:2023 年 4 月首发华为高阶智驾,2023 年 9 月发布不依赖高精地图的领航方案。2024 年 8 月发布 ADS 3.0,实现了车位到车位、端到端类人智驾,2025 年 4 月发布ADS 4.0。据华为乾崑智能汽车解决方案(视 频号、公众号)以及华为靳玉志在 2025 世界新能源汽车大会论坛披露,华为凭借 45EFLOPS 云端算力、超 100 万台车的 搭载量、超 50 亿公里的累计智驾里程保持领先优势。 华为 ADS 4.0采用 WEWA 架构,标志着华为 ADS 实现了从“数据驱动”向“场景驱动”。WEWA 架构的核心迭代在于实 现了“AI 训练 AI”的闭环,强调通过仿真(世界模型)来生成和解决长尾问题,模型不依赖大语言模型进行推理(与 VLA 显式引入语言推理形成鲜明对比),更注重对物理世界的隐式学习。WEWA 架构由云端世界引擎和车端世界行为模型两部分 组成,通过云端与车端的协同进化以系统性解决智能驾驶面临的“长尾难题”:

云端的 World Engine(世界引擎)为云端仿真与生成平台,除了凭借高搭载量继续积累真实路采数据外,更强化云端 难例生成,云端可生成在现实世界中难以遇到的复杂危险场景,为车端模型的训练提供高难度的“仿真题库”,极大加 速了对罕见但关键场景的覆盖和学习效率。

车端的World Action Model(世界行为模型)则相当于一个具备强大泛化能力和预见性的AI 司机,其基于云端World Engine 生成的海量场景数据进行深度训练,从而学习如何理解和应对各种复杂路况,能够更精准地预测风险、理解场 景意图,这使得 ADS 4.0 进一步提升了响应速度、具备更高的安全冗余,获得更优的通行效率。 在 2025汽车论坛上,华为车 BU李文广指出,实现 L4级自动驾驶需突破四大核心能力。一是“看得更清楚”,通过固态激 光雷达与分布式雷达消除感知盲区及恶劣天气影响;二是“想得更明白”,通过构建原生世界模型(非大语言模型)实现类人决策;三是“动作更到位”,通过整合底盘控制算法至智驾域控达成精准执行;四是“可靠性”,通过升级 L4 操作系统, 实现系统级功能冗余保障可靠性。

3.3 地平线机器人&Momenta 强调一段式端到端

地平线把最新版 HSD 所处阶段定位为高阶算法的第三阶段,认为传统的“两段式端到端”、“一段式端到端+规则后处理”等 混合式架构采用横纵向解耦,导致系统模块增多、整体响应延迟增加、信息传递损失等问题。而其最新版的 HSD 基于一段 式端到端架构和强化学习能力,推动辅助驾驶迎来拟人化体验拐点。HSD 在一段式端到端架构的基础上,实现了系统低延 时、全方位防御性驾驶、横纵向合一的车控。 近日地平线 HSD 举办量产首秀品鉴会,奇瑞星纪元星途 ET5(首搭地平线高阶智驾算法及智驾芯片征程 6P)及长安汽车深蓝 L06(搭载双 J6M)亮相。据地平线官方公众号,地平线 HSD 基于一段式端到端,实现从感知到控制的超低时延,面对 突发场景反应迅捷,提前识别潜在风险并进行防御性驾驶。系统还引入强化学习机制,强化场景理解与推理能力,可以更好 地自主应对极端场景,推动辅助驾驶从单纯模仿人类的“学徒”,向能够超越人类的“专家”转变,推动辅助驾驶的“智能 涌现”效应。 据地平线创始人余凯微博,地平线 HSD 的一段式端到端里,云端部署有语义模型,用 VLM+强化学习来训练,能应对可变 车道、待转区文字提示和潮汐车道。

根据地平线公众号披露,地平线 HSD 系统已与多家主流车企达成深度合作,预计将陆续搭载于 10 余款新车型。在征程系 列累计出货突破千万套的基础上,地平线已明确下一阶段战略目标:未来 3–5 年内,HSD 达成千万量产。 Momenta:作为第三方智驾算法公司,Momenta与主机厂合作较早,当前配套车型数量多,其最新版算法名为——基于强 化学习的一段式端到端飞轮大模型。基于强化学习,该模型可在模拟环境里探索新的驾驶行为,系统从自己的成功和失败中 吸取经验,自我快速的成长,可能让系统智驾表现大幅度超过人类表现。一段式端到端强调将感知与规划整合进一个大模型 中,模仿人类的长期记忆,同时保留 DLP(Deep Learning Planning)模型,类似短期记忆,能快速学习,以此保证高质量 的大模型训练数据+低成本的训练方法。 Momenta 累计合作量产车型已超 160 款。“一个飞轮,两条腿”是指依靠数据飞轮,通过数据驱动的方式来解决问题;同时, 坚持“两条腿”战略,即量产辅助驾驶(Mass Production)与自动驾驶(Scalable Robo)。量产辅助驾驶能够输出源源不 断的数据流,自动驾驶能够反馈给量产产品技术流,基于统一的传感器平台,“两条腿”相互协同,形成高效打通。 数据飞轮的三个关键因素是数据驱动、海量数据和闭环自动化。其中,闭环自动化工具链包括数据的采集、回流、分析、标 注、模型训练及验证环节,用来帮助数据和算法之间形成快速迭代的反馈闭环。在数据驱动的框架下,Momenta 在获取到 海量数据之后,就能以闭环自动化工具链筛选出海量黄金数据,驱动算法自动迭代升级,让“飞轮”越转越快。 Momenta 致力于实现可规模化的自动驾驶,通过不断优化打造 AD 自动驾驶算法体系,从 2.0 模块化方案逐步进化到 5.0 的 一段式端到端方案,不断提升辅助驾驶功能体验和城市复杂场景的能力边界,最终实现 L4 自动驾驶。

四、 商业模式:基于量产车的 Robotaxi 业务提速

我们判断,主流高阶智驾玩家(包括车企及供应商)基于消费级量产车业务进军 Robotaxi 业务的节奏将加快,主要原因如下:1)Robotaxi 业务可提供关键的长尾场景数据,为模型训练与优化提供“燃料”,提升系统在极端场景下的表现。2) 商业模式的协同效应日益凸显。通过复用量产车的硬件方案与算法架构,Robotaxi 业务的部署成本得以大幅降低,规模化 商业落地可行性提高。同时 Robotaxi 业务也可作为高阶智驾技术标杆,提升该智驾系统的知名度和影响力。更长远地看, Robotaxi 业务可视为“出行即服务”的战略卡位。 当前的无人车业务运营范围有限,硬件成本较高,导致商业闭环未形成,如文远知行、小马智行等公司依然处于亏损状态。 在美国,无人驾驶的商业化运营主要形成了两种技术路线:一是以 Waymo为代表的“跨越式路线”,二是以特斯拉为代表 的“渐进式路线”。 跨越式路线从 L3/L4 核心技术出发,以法规和系统驱动,注重构建符合全球标准的产品体系,强调系统架构的完备性、功能 安全与合规性,通过稳健的系统设计建立核心竞争力。然而,该路线依赖专属车队在限定区域运营,硬件成本高,地域扩张 缓慢,数据规模有限,商业化闭环尚未完全形成。 渐进式路线则从 L2 辅助驾驶起步,通过海量量产车在真实场景中持续迭代,逐步完善系统能力,最终实现从 L2 向 L4 级无 人驾驶的逐步逼近。该路线复用现有车辆的硬件与算法,依托规模优势获取多样化数据,具备快速扩展的潜力。一旦技术成 熟并获监管批准,已售出的车辆理论上可直接转化为无人驾驶运营网络。 总体来看,Waymo 路线强在系统规范与安全冗余,但面临成本与扩展性挑战;特斯拉路线则依托数据规模和迭代效率,更 具商业化弹性,但需持续验证其在全场景下的可靠性。

近期,基于量产车布局 Robotaxi 业务的节奏有所加快。主机厂方面,小鹏汽车在 2025 AI day 宣布 2026 年将推出三款 Robotaxi,其特点是不依赖高精地图、面向全球、纯视觉方案,无需改装,小鹏汽车基于同样的自研智驾芯片及智驾软件技 术架构来布局其不同的业务——量产智能车、Robotaxi、机器人业务。 第三方供应商方面,华为较早明确无人车商用时间表。据华为智能汽车解决方案BU CEO 靳玉志在 2025 世界新能源汽车大 会演讲:2026 年,在法规允许的前提下,力争实现高速 L3 规模商用及城区 L4 商用试点;2027 年,随着高速与城区 NCA 功能的普及,L3将实现规模化应用,城区 L4 进入商用阶段,Robotaxi 与干线物流逐步落地,全面开启载人与载物的无人化 新时代。

地平线机器人认为以特斯拉为代表的渐进式路线是实现 L4的更优路径,扎实的 L2基础能力是实现 L4的必经之路。从 L2++ 出发,通过海量数据迭代拓展 ODD(设计运行域)边界,叠加系统冗余逐步实现 L4 能力。 据地平线官方公众号,地平线与哈啰签署战略合作协议。双方将基于 Robotaxi 运营场景和需求,发挥各自技术优势,共同 打造极致低成本、高安全、高可靠、高可用的智能驾驶技术,实现 Robotaxi 的商业成功,此次合作标志着地平线智驾技术 基座全面赋能 L2 到 L4 全域场景。哈啰首款前装量产 Robotaxi 车型(Hello Robot1) 亮相,并计划 2026 年实现前装车型量 产,覆盖超 10 个城市、国际首城规模落地、达到万辆规模,2027 年部署超5 万辆正向定义面向全球的 Robotaxi 车型。 Momenta 坚持“两条腿”战略,智能辅助驾驶与自动驾驶 Robotaxi。智能辅助驾驶能够输出源源不断的数据流,自动驾 驶 Robotaxi 能够反馈给量产产品技术流,基于统一的传感器平台,两条腿相互协同,形成高效打通。 Momenta 认为:在少量车队运营时,Robotaxi 需达到与人类驾驶同等的安全水平可以赢得信任,但当车队规模扩展至 1 万 辆乃至 100 万辆时,安全门槛将攀升至人类驾驶的千倍、万倍标准,才可以继续让用户放心使用,Momenta 有信心将安全 提升至 Robotaxi 可规模化发展的标准。在技术布局上,Momenta 计划在 2025 年推出前装量产的 Robotaxi 方案,通过复用 量产传感器和计算单元来降低单车成本;同时该方案还可实现在各国不同城市道路环境中的快速适配。 元戎启行近期官宣以消费级量产车部署 Robotaxi 业务。据公司公众号,截至 2025 年 10 月 31 日,元戎启行已完成 15 万 台量产车智驾方案交付,宣布将于 2025 年底落地 Robotaxi 业务,达成以消费级量产车开展 Robotaxi 业务,元戎启行的 Robotaxi 与量产车共用一套技术框架,在复杂城市场景中搭载元戎启行辅助驾驶系统的量产车积累了大量优质数据,持续反 哺模型,推动 Robotaxi 产品迭代,实现数据驱动的商业闭环。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至