2025年智能驾驶行业深度报告:世界模型与VLA技术路线并行发展
- 来源:国元证券
- 发布时间:2025/10/23
- 浏览次数:383
- 举报
智能驾驶行业深度报告:世界模型与VLA技术路线并行发展.pdf
智能驾驶行业深度报告:世界模型与VLA技术路线并行发展。新能源车高增推动智能驾驶快速渗透。中国已成为全球汽车产业电动化、智能化发展方向上的积极倡导者与重要引领者。近年来,中国新能源汽车市场销量及渗透率均呈现出稳步上升态势,整体增长趋势明确。回顾2019–2025H1期间,尽管总销量受宏观环境及周期性因素影响略有波动,但新能源汽车销量总体保持持续增长,尤其在2023–2024年期间实现显著放量,市场增势明显。同时,新能源汽车渗透率一路攀升,从2019年的较低水平起步,先后突破10%、30%、50%等关键阶段性关口,反映出新能源车型在整体汽车市场中的占比不断提升,消费者对新...
“平权+端到端”,智能驾驶加速进化
智能驾驶行业发展回顾
新能源车高增推动智能驾驶快速渗透。中国已成为全球汽车产业电动化、智能化发展方向上的积极倡导者与重要引领者。近年来,中国新能源汽车市场销量及渗透率均 呈现出稳步上升态势,整体增长趋势明确。回顾 2019–2025H1 期间,尽管总销量受宏观环境及周期性因素影响略有波动,但新能源汽车销量总体保持持续增长,尤其 在 2023–2024 年期间实现显著放量,市场增势明显。同时,新能源汽车渗透率一路攀升,从 2019 年的较低水平起步,先后突破 10%、30%、50% 等关键阶段性关口, 反映出新能源车型在整体汽车市场中的占比不断提升,消费者对新能源产品的接受度与认知度持续增强,产业发展进入加速普及阶段。
智能驾驶配套普及形成正向发展循环。与此同时,中国新能源汽车L2级别智能驾驶功能渗透率也展现出快速提升的态势。从 2019 年的约 7% 起步,到 2025H1 已上升 至 65% 左右的水平,显示出智能驾驶技术在新能源车上的配套应用正快速普及。从逻辑上看,左图的销量与渗透率提升反映了新能源车本身的市场扩张趋势,而右图 的智能驾驶渗透率上升,则揭示了市场配套智能化技术的同步发展进程。随着新能源车保有量持续扩大,车企为了增强产品竞争力、差异化定位以及改善用户体验,越 来越多车型开始标配或选配智能驾驶功能。另一方面,消费者在购买新能源车型后接触智能驾驶的机会显著增加,对智能化功能的认知、使用意愿也同步增强,形成了 自下而上的市场反馈机制。
智驾沿着“端到端”、“智驾平权”加速
端到端:在特斯拉于 2024 年 3 月率先推出“端到端”智驾方案后,国内造车新势力迅速跟进,掀起技术架构革新浪潮。小鹏汽车在“520 AIDAY”发布会上宣布,其 国内首个“端到端”大模型已实现量产上车;同年 7 月,理想汽车进一步发布基于“端到端”模型、VLM 视觉语言模型与世界模型的全新自动驾驶技术架构,加速高 阶智驾技术的落地进程。端到端技术通过打通感知、决策与控制全链路,显著减少了传统分层算法带来的信息损耗与适配成本,实现更高效的场景泛化与模型自学习能 力。这一架构的快速普及,有效降低了车企在算法部署和数据闭环构建中的研发门槛,使城区 NOA 等高阶智驾功能的量产落地加速。受益于此,高阶智驾(L2+及以上) 功能搭载率从 2024 年 1–4 月的 11.8% 提升至 2025 年同期的 18.6%,市场渗透呈现出稳中加速的趋势。
智驾平权:步入 2025 年初,头部自主品牌集体加码智能驾驶技术布局。比亚迪、吉利、奇瑞、长安等四大自主车企相继推出重磅智能驾驶方案,在技术突破的同时, 也将智能驾驶价格门槛进一步拉低,加速“智驾平权”进程。例如,比亚迪秦 PLUS 智驾版(11.98 万元)已搭载高速 NOA 功能;吉利银河星耀 8EM(15 万元)实现 了“车位到车位”全场景智驾的标配功能。与造车新势力主要集中在中高端车型不同,自主车企通过规模化生产、供应链整合和自研芯片等路径,正在实现智能驾驶技 术的价格下探与普惠化落地。其中长期目标明确:在 10 万元级别车型上实现高速 NOA 的全面标配。随着这一战略推进,中高阶智驾(高速 NOA)搭载率从 2024 年 1–4 月的 11.8% 升至 2025 年同期的 18.6%,市场覆盖范围持续扩大,技术渗透进一步提速。
端到端智能驾驶复盘
端到端智能驾驶演进历程
第一阶段:感知“端到端”/“BEV+ transformer”(2021年由特斯拉提出):自动驾驶架构拆解为感知与预测决策规划两大模块。感知模块借助多传输器融合的BEV 技术达成模块级“端到端”,引入transformer与crossattention方案,显著提升检测精度与稳定性,而规划决策模块仍以传统Rule-based方法主导。
第二阶段:决策规划模型化/“占用网络”(2022年由特斯拉提出) :架构模块组成维持不变,感知端延续前代解决方案。预测决策规划模块迎来重大革新,将预测、 决策、规划功能整合至同一神经网络。尽管感知与决策规划均采用深度学习,但模块接口依人类理解定义,各模块仍独立训练。
第三阶段:模块化端到端/两段式端到端:(小鹏、华为、极氪当前应用方案)整体结构与上一阶段相似,网络结构细节与训练方案却大不相同。感知模块不再输出人 类可理解结果,转而输出特征向量,预测决策规划模块依此生成运动规划。两模块输出转变,训练时必须通过梯度传导,实现跨模块联合训练。
第四阶段:OneModel/一段式端到端: (特斯拉、理想、Momenta当前应用方案)此阶段打破感知、决策规划等功能界限,从原始信号输入到最终规划轨迹输出,全程 由单一深度学习模型完成。OneModel可基于强化学习、模仿学习实现,也可由世界模型衍生,实现高度集成与智能化。
端到端智能驾驶第一阶段
定义:BEV(Bird’s Eye View,鸟瞰图视角)是在自动驾驶跨摄像头和多模态融合背景下形成的一种关键视角表达方式。其核心思想是将传统基于 2D 图像与测距的 感知方式,转换为在鸟瞰视角下的 3D 感知框架,使环境信息的表达更加全面、直观和具备空间连续性。从实现路径来看,BEV 的核心在于以 2D 图像作为输入,输出 可用于决策的 3D 场景框架。在这一过程中,如何高效地融合来自不同传感器(摄像头、毫米波雷达、激光雷达等)的特征信息,实现最优表达与空间映射,是技术实 现的重点与难点所在。
Transformer 是另一项推动智能驾驶感知能力快速演进的核心技术。它是一种基于注意力机制的神经网络结构,由谷歌于 2017 年提出。与传统的 RNN、CNN 不同, Transformer 并不依赖串行数据处理,而是通过注意力机制挖掘序列中不同元素的关联关系,具备出色的特征提取与长依赖建模能力。这一特性使得 Transformer 能 够灵活适配不同长度与不同结构的输入信号,在多传感器融合和环境建模中展现出显著优势。
在智能驾驶技术架构中,感知端到端一直是最早应用端到端技术的模块之一,也是实现自动驾驶能力跃升的关键组成部分。在早期的智能驾驶系统中,端到端技术主要 集中于感知层,用于高效、实时地提取并融合环境信息。随着算法和算力的持续演进,决策规划等后端模块也开始逐步引入端到端方法,推动整体架构从分层式向一体 化方向演进。
端到端智能驾驶第二阶段
占用网络重塑环境感知,夯实智驾基础能力。占用网络(Occupancy Network)是自动驾驶“环境感知”环节的重要底层技术,其核心思想是通过对三维空间进行体素 级划分与占用预测,构建更高精度的全局环境表示。与传统感知方法相比,占用网络能够有效弥补在“遮挡处理”“形状精细建模”“全局环境认知”等方面的短板, 为后续的路径规划和行为决策提供更完整、更稳定的环境输入。随着算力持续提升与网络结构优化(如动态体素划分、稀疏卷积等),占用网络正逐步成为高性能智能 驾驶系统中的关键模块,尤其适用于结构复杂、目标密集的城市道路场景。
体素级空间建模提升环境刻画精度。从本质上看,Occupancy Network 算法是一种 3D 空间分割任务。它通过将待感知的三维空间划分为固定大小的体素网格,并利用 算法预测每个体素被目标类别占用的概率,实现对全场景的空间建模。这种方法不仅可以对已知的车辆、行人等目标进行精确刻画,还能识别数据集中未被标注的“泛 目标”(General Objects),如土堆、石块等,从而实现开放集目标检测,提升系统的环境理解力。同时,相较直接输出 3D 目标框的算法,占用网络能对空间中的 每个体素单元进行建模,因此对于不规则形状或边界模糊的目标,能够还原更丰富的几何细节和结构信息,增强整体环境表达能力。
占用网络增强三维表达,优于传统 BEV 方法。与 BEV 方法相比,占用网络的差异主要体现在目标表示方式上。BEV 采用二维平面投影,容易丢失高度信息与空间结构 特征;而占用网络基于三维体素化网格,将物体分解为大量小立方体单元,能够更准确地刻画形状特征。体素越小,环境分辨率越高,场景还原也越接近真实。占用预 测本身也可以与 BEV 结合——通过将体素化结果投影到鸟瞰图,实现保留空间信息的同时增强占用可视化,使感知结果更直观、可靠。
端到端智能驾驶第三及第四阶段
模块化端到端(OneModel)通过深度学习将传统“感知—规划—控制”流程统一映射到单一模型中,减少任务拆解带来的累积误差,并实现整体优化。目前, 特斯拉、Wayve、百度 Apollo、小鹏等企业均在加速布局相关技术路径,这一方向正成为高阶智能驾驶的重要演进路线。
技术原理方面,一段式端到端模型通常包含四大核心模块:(1)感知编码器:基于 CNN 或 ViT 提取摄像头、激光雷达、毫米波雷达等传感器的多尺度特征; (2)环境理解模块:通过时序建模(RNN、时序卷积、Temporal Attention)融合多帧信息,识别动态目标、道路结构与交通信号;(3)决策预测层:输出加 减速趋势、变道意图、转向方向等驾驶决策;(4)控制生成器:将决策结果转化为执行信号,实现车辆实时响应。
架构类型主要分为两类:可解释端到端(模块化):在端到端框架下保留中间感知或预测模块输出,兼顾可调试性与安全性,Wayve、小鹏等多采用此类架构; 黑盒端到端(One Model):直接输出轨迹/控制信号,代表如特斯拉 FSD,技术上限更高但可解释性和调试难度较大。
VLA技术路线
VLA技术路线演进历程
当前,VLA 模型的快速发展正成为智能驾驶与通用机器人领域范式变革的核心推动力。Vision-Language-Action(VLA)模型是将视觉(Vision)、语言 (Language)与动作(Action)三大模态深度耦合的端到端智能体系。其核心在于以统一的多模态表示与训练框架,将“看—懂—做”三环节打通:模型直接接 收图像/视频等感知输入与自然语言任务指令,经过联合表征与时空推理,输出可执行的物理世界控制量(如机器人关节轨迹、车辆转向与纵向控制命令)。相 较传统“感知—决策—控制”分段式管线,VLA以单一骨干网络承载跨模态特征对齐与意图理解,减少中间信息丢失与手工规则依赖,实现对目标、场景、语义 约束与行动策略的协同优化;在部署侧,可结合记忆与规划头实现闭环推理,提升对复杂、长尾场景的泛化稳健性与拟人化决策能力。VLA因而成为智能驾驶与 通用机器人迈向“大模型一体化”的关键枢纽,并为后续与世界模型、端云协同训练及轻量化蒸馏等路径的结合奠定基础。
VLA发展被分为四个阶段。2023年7月,谷歌DeepMind发布RT-2模型,将VLA(Vision-Language-Action)框架引入机器人与自动驾驶领域。通过融合大语言模型 与多模态数据训练,该模型实现了任务理解与执行能力的显著跃升,准确率提升近一倍,并具备对零样本任务的泛化能力,验证了视觉、语言与动作深度融合的 有效性,为VLA在智能驾驶等产业化应用奠定基础。VLA理念随即受到整车厂高度关注,成为智能驾驶技术路线演进的重要方向。近日,麦吉尔大学、清华大学、 小米和威斯康辛大学等团队联合发布综述《A Survey on Vision-Language-Action Models for Autonomous Driving》,将VLA发展分为四个阶段:Pre-VLA、 Modular VLA、End-to-end VLA与Augmented VLA,系统梳理了其技术特征与演进路径,为产业落地提供了清晰框架。
VLA技术路线核心特征与当下痛点
3D中间表征:实现感知—决策—控制的一体化桥梁。VLA模型在车端和云端的高效运行依赖于稳健的3D中间表征,这一特征本质上是连接感知层与决策层的抽象 表示。自动驾驶中的中间表征不仅涵盖常规的场景语义、道路结构、行人和障碍物等静态信息,还包含速度、运动方向等动态要素。通过对周边环境隐式与显 式信息的统一编码,3D中间表征能够为下游决策提供高维、结构化的空间语义基础,有效减少感知结果与控制指令之间的信息损耗。相比传统“2D感知+规则决 策”的模式,这种表征能更好地支持复杂驾驶场景下的时空推理与闭环控制,使模型具备更强的泛化和鲁棒性,也为多任务协同(如路径规划、避障与交通流 预测)提供了统一的语义载体。
长时序记忆:应对动态驾驶场景的核心机制。在自动驾驶场景中,车辆决策往往并非基于单帧信息,而是对长时序信息的持续理解与利用。由于大语言模型和 感知模块天然存在时序窗口受限的问题,若模型缺乏长时序记忆机制,容易在多步推理中产生信息遗失或语义漂移,导致驾驶行为混乱或目标识别失误。VLA框 架通过引入记忆机制,强化了对时间维度的连续建模能力,使其能够在多回合交互、复杂交通流变化和突发场景中维持稳定的决策输出。外部学术界和产业界 也普遍将“时序建模”视为智能驾驶迈向类人驾驶能力的关键要素之一,长时序记忆的增强不仅能提升准确率,更直接关系到整体安全性与可靠性。
世界模型技术路线
世界模型技术路线演进历程
世界模型的本质,是通过对真实世界的高维认知建模,赋予智能体理解、预测和规划能力。世界模型(World Model)是一类能够模拟和推演真实环境状态的生 成式AI框架,它不再仅仅停留在对传感信息的被动感知,而是通过对环境物理规律和因果关系的建模,实现对现实世界的“内在理解”与“主动推理”。在这一 框架下,感知、语言、运动等输入信息通过多模态融合后,被编码成紧凑的潜在表示,进入内部“虚拟大脑”中进行推演与预测。相较传统E2E和VLA路线,世界 模型的核心特征在于,它允许系统在不依赖实时外部信号的前提下,在内部“脑海”中完成对未来情境的演练与规划。这一机制类似于人类驾驶时的“预判”能 力,能够在感知输入受限的情况下仍具备情境理解与自主决策的能力,赋予了智能驾驶系统更强的鲁棒性与泛化性。
世界模型强调通过对环境因果规律的推理与内部模拟,重塑智能驾驶的决策链条。当前,特斯拉、蔚来、鸿蒙智行等车企正在逐步构建基于世界模型的智能驾驶 体系。特斯拉的FSD(Full Self-Driving)系统正从传统的端到端感知—控制框架,向强化“世界模拟器”的方向演进,通过对场景的连续建模、时序理解和动 作预测,减少对高精地图和手工规则的依赖;鸿蒙智行则通过软硬一体的“智能座舱+感知融合”策略,构建车辆对道路状态、交通流和驾驶意图的实时内部模 型,实现“人车路云”的协同预判;蔚来在其感知与预测系统中,也强调时序建模和多源信息融合,以在极端工况与长尾场景下保证决策稳定性。与VLA依赖语 言和图像的高维交互不同,世界模型路线更关注“真实环境的内在结构建模”,使得车辆具备更接近人类驾驶员的“心智模型”。
世界模型技术路线核心特征与当下痛点
数据成本革命:传统智能驾驶依赖真实道路采集,成本高昂且有效样本稀缺。以特斯拉为例,有效样本比例不足万分之一。而 NWM(Neural World Model)可 通过少量真实数据“种子”生成海量虚拟场景,将训练成本大幅降低。例如,极端天气下的 100 万公里测试,可通过仿真扩展到多样化场景,成本下降可达 90%,打破数据瓶颈。
安全标准升级:现有 AEB 测试标准(如 Euro NCAP)覆盖的危险场景有限,尤其夜间、强光与复杂天气测试存在缺口。利用 NWM 构建虚拟碰撞数据库,可将 场景扩展至 2000 余种,更全面覆盖长尾与极端情况,推动测试验证从“样本测试”走向“全场景验证”,提前暴露潜在安全风险。
时空一致性提升:DriveDreamer4D 等世界模型框架可实现高精度图像渲染与多模态时空对齐,使虚拟仿真更接近真实环境,显著提升算法稳定性和泛化能力, 为大规模工程落地奠定基础。
具备认知推理能力:与依赖统计规律的传统仿真不同,世界模型具备“感知—理解—生成”闭环能力,可在内部世界中预判未来动态,像人类驾驶员一样推演 决策。面对复杂交通场景,系统能自主生成最优驾驶轨迹,实现更智能、更安全的决策闭环。
报告节选:



-
标签
- 智能驾驶
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 腾讯研究院:2026丰饶之后:AI Coding 观察报告.pdf
- 4 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 5 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 6 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 7 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 8 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 9 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 10 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 易观分析-具身智能行业:2026年中国具身智能重点行业应用与场景价值分析报告.pdf
- 4 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 5 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 6 房地产行业专题报告:城市更新推动高质量发展.pdf
- 7 能源电子行业月报:功率器件交期持续拉长,行业景气度稳步提升.pdf
- 8 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 9 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 10 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 3 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 A股2026年6月策略:景气强化与震荡上行配置建议
- 9 2026年中期医药生物行业投资策略:AI新药加速推进
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年7月A股回调归因与底部布局策略分析
- 2 2026年上半年小红书六大热门行业消费趋势洞察
- 3 2026年7月黄金震荡格局与长期配置价值分析
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
- 8 2026年8月投资组合报告:从极致抱团到均衡修复
- 9 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 10 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
