智能驾驶表征演进:从物理世界到潜在状态

  • 来源:东吴证券
  • 发布时间:2026/08/08
  • 浏览次数:7
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度23期,智能驾驶的表征演进.pdf

全球智能驾驶技术正经历从感知到认知的深刻变革,其核心驱动力在于物理世界表征方式的演进。本报告深入剖析了物理AI与数字AI在表征获取上的根本差异,指出物理世界缺乏天然通用的Token化方案,必须通过重型编码网络构建三维可学习底座。表征演进的五大阶段报告将智能驾驶表征演进归纳为原始像素、BEV/VectorNet、Occupancy、多模态Token和潜在状态五个阶段。原始像素端到端虽简洁但缺乏结构约束;BEV与矢量化作为并行路线,分别通过统一三维空间和抽象数学对象解决了空间与关系建模问题;Occupancy网络通过判断空间占据而非识别类别,提升了对未知障碍物的处理能力;多模态Token尝试统一视...

物理AI与数字AI的表征差异

物理AI与数字AI的根本差异首先体现在表征获取方式上。文本天然离散且带有语义,数字AI输入具备较强的可Token化基础;而物理世界的输入由连续光子、点云、运动和空间关系构成,缺乏天然通用的物理世界Token化方案。因此,物理AI需要先构建三维物理空间的可学习表征,再进入规划、控制和行动环节。在文本侧,将输入转为Token通常是轻量且可学习的步骤,分词器训练成本低、词表规模可控。相比之下,物理AI输入没有天然离散语义单元,必须由网络学习如何切分与编码,其输入包括多相机连续像素、激光雷达点云等原始信号,无法像文本那样通过查表直接获得Token。

物理AI中的Token化器本质上是重型编码网络。文本分词通常只是把离散符号映射为Token,而车端BEV编码器、占用网络、VAE、3D编码器等承担了从连续物理输入到可学习表征的核心转换。离散化和嵌入不是预先给定的,而是由网络学习形成,这也是物理AI相较数字AI多出的一道关键工程门槛。

智能驾驶表征演进的五个阶段

以智能驾驶为例,表征演进可概括为原始像素、BEV/VectorNet、Occupancy、多模态Token和潜在状态五个阶段。原始像素端到端简洁但缺少结构约束,早期如ALVINN和英伟达PilotNet采用浅层网络将低分辨率图像直接映射到转向控制,虽能隐式学习特征,但形态不可控且难以检视。纯像素模仿的脆弱性推动业界转向显式、可检视的三维表征。

BEV加Transformer与矢量化VectorNet是同一层级的两条并行路线。特斯拉代表前者,把多摄像头信息统一到鸟瞰三维空间,利用Transformer自注意力机制学习向量空间中每个位置应从各图像的哪些区域取信息,降低对逐相机标定固定投影的依赖。Waymo代表后者,把道路和参与者抽象成数学对象,将地图与轨迹表示为矢量并以图和注意力建模交互,大幅降低计算量与参数量。这两种路线分别从空间侧与关系侧摆脱了原始像素的限制。

Occupancy占用网络从识别对象类别转向判断空间占据。它将三维表面表示为连续空间中的占据概率边界,摆脱固定体素分辨率与内存约束,对未知形状的一般障碍物同样有效。国内头部厂商如小鹏、华为、理想等在2023年前后相继把占用纳入量产感知栈,实现了对自由空间的稠密表达。

多模态Token连接视觉、语言和动作。特斯拉FSD v12用单一神经网络实现像素输入到控制输出,路径已接近视觉—语言—动作VLA的统一建模。Wayve的LINGO系列及中国厂商的多模态模型也在文本Token之外引入学习得到的视觉Token,尝试将多相机视频、地图、动作乃至语言统一为一条Token流。

潜在状态与世界模型的未来方向

潜在状态把世界压缩到可预测空间。GAIA-1把视频压缩为离散Token,再用自回归Transformer预测下一个Token;随后的GAIA-2与英伟达Cosmos把表征从离散Token进一步推进到连续潜在,以潜在扩散世界模型在动作、自车与文本条件下直接预测未来潜在状态。这说明物理AI中的Token化器本身就是一类重型可学习网络。

世界模型可能成为表征训练的关键手段。标签稀缺使物理世界嵌入难以完全依赖人工监督,GAIA、Cosmos、JEPA系等世界模型通过自监督预测未来状态、生成场景或学习潜在动力学,帮助模型在无标注或弱标注条件下形成更统一的物理表征。竞争壁垒正从单点感知精度,前移到如何将物理世界嵌入可预测潜在空间。多种表征长期并存,并非简单替换,BEV与矢量、占用、3D高斯、世界模型潜空间分别服务不同层次的感知、预测、仿真和规划需求。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至