汽车行业深度报告:AI系列深度09期,从LLM到VLM再到VLA意味着什么?.pdf

  • 上传者:S***
  • 时间:2026/08/03
  • 热度:26
  • 0人点赞
  • 举报

AI大模型正从数字世界向物理世界延伸,LLM、VLM、VLA三类模型构成逐层扩展的技术脉络。东吴证券这份深度报告系统梳理了从语言基础模型到视觉-语言-动作模型的演进逻辑,揭示物理AI将成为增量更大的发展方向。

研究目的与核心框架

报告旨在厘清LLM、VLM、VLA的技术继承关系与本质差异,为汽车产业及具身智能投资提供分析框架。研究将三类模型置于同一技术脉络中考察:LLM以文本为输入输出,VLM在语言底座上接入视觉模态,VLA进一步将动作作为输出模态进入物理世界。

核心机制与数据约束

三者核心机制呈递进关系:LLM依托Transformer自注意力机制进行自回归预训练;VLM增加视觉编码器与模态对齐模块,通过CLIP式图文对齐或Q-Former等结构将视觉特征映射至语言模型输入空间;VLA则需解决动作表征问题,形成离散动作token、连续动作生成、双系统分工三条技术路线。训练数据难度逐级抬升:LLM依赖文本语料,VLM增加图文对,VLA需要机器人示教轨迹和真实环境数据,后者采集成本远高于前两者,构成VLA的核心约束。

产业格局与竞争重心

海外厂商分层明显:OpenAI、Google、Meta、Anthropic主导LLM/VLM,Google、Physical Intelligence、NVIDIA、Figure等布局VLA和机器人。国内DeepSeek、阿里、字节、百度、腾讯、智谱、月之暗面、MiniMax等主攻LLM/VLM,智元、银河通用等聚焦VLA与机器人本体。报告判断后续竞争核心将从模型能力延伸到数据、硬件、动作控制与场景闭环,智能驾驶作为最先跑通闭环的代表场景应重点关注。

关键演进节点

技术演进时间线显示:2017年Transformer架构奠定LLM基础,2021年CLIP开启VLM时代,2023年RT-2首个命名VLA实现VLM向VLA的跨越,2024年π0与OpenVLA推动VLA扩散,2025年GR00T N1与Gemini Robotics进入人形机器人基础模型阶段。

1页 / 共11
汽车行业深度报告:AI系列深度09期,从LLM到VLM再到VLA意味着什么?.pdf第1页 汽车行业深度报告:AI系列深度09期,从LLM到VLM再到VLA意味着什么?.pdf第2页 汽车行业深度报告:AI系列深度09期,从LLM到VLM再到VLA意味着什么?.pdf第3页
  • 格式:pdf
  • 大小:0.6M
  • 页数:11
  • 价格: 3积分
下载 获取积分

免责声明:本文 / 资料由用户个人上传,平台仅提供信息存储服务,如有侵权请联系删除。

  • 相关标签
  • 相关专题
      热门下载
      • 本年热门
      • 本季热门
      • 本月热门
      分享至