智能驾驶VLA模型架构范式演进与厂商路线分化

  • 来源:东吴证券
  • 发布时间:2026/08/08
  • 浏览次数:25
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度22期,智能驾驶VLA模型的架构范式与厂商路线.pdf

智能驾驶技术正经历从模块化流水线向视觉语言动作模型(VLA)融合的深刻变革。VLA4AD范式通过将视觉感知、语言理解与动作决策整合进同一策略模型,并利用显式动作头弥合传统VLM的动作生成缺口,实现了语义理解与驾驶策略的紧密耦合。其核心架构包含视觉编码器、语言处理器与动作解码器,并经历了从被动解释器、规划协作者、统一动作生成器到推理中枢的四阶段演进,旨在解决鲁棒性、实时性及多模态对齐等挑战。厂商路线分化与技术特征头部厂商在VLA技术路线上呈现显著差异化。WaymoEMMA基于Gemina构建纯端到端架构,将多任务输出统一至语言空间,利用思维链提升规划性能;理想MindVLA采用3D高斯中间表征与...

智能驾驶技术范式的迭代升级

自动驾驶技术的演进历程呈现出从模块化向端到端、再向视觉语言动作模型(VLA)融合的趋势。早期主流的模块化流水线将感知、预测、规划与控制拆分为独立模块,虽便于独立优化,但存在误差级联传播与信息碎片化问题,难以有效处理长尾极端场景。为解决这一缺陷,端到端自动驾驶范式应运而生,通过将原始传感器输入直接映射为控制指令,消除了模块边界,实现了端到端优化,但在语义稳定性与可解释性方面仍显不足。

在此基础上,视觉语言模型(VLM)被引入自动驾驶领域,试图利用大模型的常识先验提升对罕见场景的泛化能力。然而,VLM主要侧重于场景解释,语言输出与控制决策耦合较弱,存在动作生成缺口,即能理解场景却难以直接生成可靠控制。VLA4AD范式的关键突破在于将视觉感知、语言理解与动作决策整合进同一策略模型,并通过显式动作头弥合动作生成缺口,使语义理解与驾驶策略紧密耦合,从而具备遵循自然语言指令、输出决策理由及利用互联网常识先验的能力。

VLA4AD核心架构与阶段演进

VLA4AD的核心架构通常由视觉编码器、语言处理器和动作解码器三部分构成。视觉编码器负责将摄像头、激光雷达等异构传感输入转化为隐层特征,并通过BEV、点云等方式增强三维空间理解;语言处理器引入预训练大模型,利用LoRA或RAG等技术注入驾驶知识;动作解码器则将融合后的多模态表征转化为轨迹或控制量。动作解码技术路线主要包括自回归分词器、扩散头以及分层控制器,分别适用于不同的生成需求与实时性要求。

从发展阶段来看,VLA4AD经历了从被动解释器到推理中枢的演变。预VLA阶段,多模态大模型仅作为被动解释器,不参与实际控制;模块化VLA阶段,语言作为中间表示引导路径规划,但仍受限于多阶段流水线的误差放大;统一端到端VLA阶段,构建了单一策略网络,实现多模态传感器流与语言指令到控制信号的直接映射;最新的推理增强VLA阶段,则进一步将长时域推理、记忆与交互整合进控制循环,要求模型在执行动作前进行逻辑推理并回顾历史状态,显著提升了复杂场景下的决策能力。

头部厂商VLA路线的差异化竞争

当前,头部厂商在VLA模型的技术路线上已出现明显分化。Waymo推出的EMMA模型基于Gemini构建纯端到端架构,将导航、状态、轨迹等统一至语言空间,通过任务特定提示生成多任务输出,并利用思维链推理提升规划性能。理想汽车则从E2E+VLM双系统升级至MindVLA统一架构,采用3D高斯作为中间表征,结合MoE混合专家架构与扩散动作解码器,实现了三维理解、语义推理与轨迹生成的统一,并支持车端实时运行。

元戎启行推出了40B参数的VLA基座模型,设置Driver、Analyst、Critic三角色,分别负责实时驾驶、因果推理与轨迹评估,通过评价结果反向驱动数据闭环,大幅压缩了数据处理周期。千里科技的CoWorld-VLA模型则创新性地构建了多专家世界模型Token,包括交通交互、道路几何、动态演化与自车轨迹四类专家Token,在隐空间构建面向规划的世界表征,通过多专家融合规划器生成连续自车轨迹,在基准测试中表现出显著优势。

小鹏第二代VLA:弱化语言层的视觉直达路径

与其他厂商保留显式语言层不同,小鹏第二代VLA选择弱化显式语言中间层,趋近于视觉—动作(VA)路线。其设计动机在于认为传统VLA中的语言转译环节存在信息损耗,且文字难以完整承载图像细节。因此,小鹏第二代VLA采用原生多模态Tokenizer,实现离散Token与连续表征的无损转化,并通过32倍超密视觉思维链直达动作输出,显著提升了推理效率并降低了预测误差。

在工程落地方面,小鹏针对图灵AI芯片进行了全链路优化,在Ultra车型上搭载数十亿级参数规模的模型,并利用海量真实驾驶视频进行训练,减少了对人工标注的依赖。该模型已面向大众汽车等外部客户定点,并在复杂小路场景下实现了接管里程的大幅提升与行车效率的改善。这种去显式语言层、强化视觉思维链的架构变体,代表了VLA技术另一条重要的演进方向,即通过隐式表征与高效推理实现更直接的物理世界交互。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至