AI大模型技术演进:从LLM到VLM再到VLA的产业映射

  • 来源:东吴证券
  • 发布时间:2026/08/03
  • 浏览次数:8
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度09期,从LLM到VLM再到VLA意味着什么?.pdf

AI大模型正从数字世界向物理世界延伸,LLM、VLM、VLA三类模型构成逐层扩展的技术脉络。东吴证券这份深度报告系统梳理了从语言基础模型到视觉-语言-动作模型的演进逻辑,揭示物理AI将成为增量更大的发展方向。研究目的与核心框架报告旨在厘清LLM、VLM、VLA的技术继承关系与本质差异,为汽车产业及具身智能投资提供分析框架。研究将三类模型置于同一技术脉络中考察:LLM以文本为输入输出,VLM在语言底座上接入视觉模态,VLA进一步将动作作为输出模态进入物理世界。核心机制与数据约束三者核心机制呈递进关系:LLM依托Transformer自注意力机制进行自回归预训练;VLM增加视觉编码器与模态对齐模块...

技术脉络:三类模型的继承与分化

LLM、VLM、VLA可理解为同一技术脉络上逐层扩展模态和输出能力的三类大模型。LLM以文本为输入输出,核心解决语言理解、生成和推理;VLM在语言底座上加入视觉理解,使图像和文字在同一语义空间交互;VLA进一步把动作作为输出模态,使模型能够驱动机器人或车辆在物理世界中行动。三者存在继承关系,但不能简单归结为同一种next-token机制。

从概念脉络看,LLM由Transformer、GPT等奠定,核心是以海量文本和自监督训练形成语言基础模型;VLM由CLIP、Flamingo等推动,通过图文对齐、视觉编码器和模态投影把视觉信息接入语言模型;VLA由Google DeepMind在RT-2中明确命名,核心是把视觉、语言与动作统一到策略模型中。

核心机制:数据难度与表征方式逐级抬升

从数据和表征看,三者难度逐级抬升。LLM训练依赖文本语料,VLM增加图文对和视觉编码,VLA则需要机器人示教、遥操作轨迹、动作反馈和真实环境数据。动作不是普通输入模态,而是会改变物理世界的控制输出;因此,VLA既可把动作离散化为token自回归生成,也可用扩散策略或流匹配生成连续动作轨迹。

VLA的动作建模可拆为三类机制。第一类是离散动作token,将机械臂或机器人动作离散化为序列,并用自回归方式逐步预测,RT-2和OpenVLA属于该路线。第二类是连续动作生成,通过扩散策略或流匹配直接生成连续动作轨迹,更适合高频、精细控制,π0采用流匹配实现约50Hz动作输出。第三类是双系统分工,由高层VLM负责场景理解和任务意图生成,低层动作模型负责实时控制,NVIDIA GR00T N1和智元GO-1体现了相关探索。

应用边界:从数字世界到物理世界的跨越

从应用边界看,LLM主要处理知识、代码、对话和软件任务;VLM把能力扩展到图像理解、图文问答、视觉检索和多模态交互;VLA则进入机器人、自动驾驶和具身执行,需要处理实时性、安全性和物理反馈。NVIDIA的慢思考VLM加快思考动作模型、π0的连续动作生成、RT-2的动作token化,均体现VLA内部路线仍在分化。

数字AI底座模型发展路径已逐渐清晰、价值在于确定性,但其难以实现物理世界的建模闭环;物理AI将成为物理世界的AI解决方案,从而在AI的当前发展阶段成为增量更大的方向,智能驾驶作为最先跑通闭环的代表场景,应重点关注。

产业映射:海外与国内厂商的分层布局

产业映射上,海外OpenAI、Google、Meta、Anthropic等主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人;国内DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等布局LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环。

国内格局可概括为三类:基座型,DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax、上海人工智能实验室/商汤,主攻LLM/VLM;具身型,智元、银河通用等,主攻VLA与机器人本体;跨界型,字节、阿里、腾讯等,以基座能力下沉具身或通过投资卡位。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至