视觉智能架构演进:从CNN到Transformer的融合与基础模型化

  • 来源:东吴证券
  • 发布时间:2026/08/08
  • 浏览次数:16
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度17期,视觉智能为何引入Transformer?.pdf

随着AI大模型技术的深入发展,视觉智能作为感知物理世界的核心环节,其底层架构正经历从卷积神经网络(CNN)向Transformer的深刻变革。本报告旨在厘清视觉Transformer化的本质、演进路径及其与语言智能发展的差异,为理解未来物理AI的发展趋势提供理论支撑。架构演进的内在逻辑报告指出,CNN之所以在AI1.0时代占据主导,源于其局部连接、权重共享和平移等变三项视觉归纳偏置与图像数据的高度契合。然而,这种强先验也导致了局部感受野受限、任务专用性强及全局建模不足等结构性局限。Transformer通过确立“图像patch即token”范式,实现了全局建模与长距离依赖的高效处理,并凭借弱归...

视觉归纳偏置与CNN的结构性局限

卷积神经网络(CNN)在人工智能发展的早期阶段确立了其作为视觉核心架构的地位,这主要归功于其架构内置的三项视觉归纳偏置:局部连接、权重共享和平移等变性。这些由架构直接注入的空间先验,使得CNN在数据规模有限的情况下仍能高效学习,从而奠定了其在AI 1.0时代的基础。然而,这种强先验也带来了显著的结构性约束。首先,卷积操作的局部性导致感受野受限,长距离依赖建模效率较低,需要堆叠多层或使用大卷积核才能覆盖全局,这在处理复杂场景时显得力不从心。其次,强空间先验在数据规模足够大时反而可能成为上限约束,限制了模型的假设空间。此外,CNN时代的视觉模型大多针对特定任务单独设计,缺乏统一的可迁移底座,且标签体系相对封闭,难以实现开放词表识别和零样本任务。

Transformer引入视觉的关键机制与优势

Transformer进入视觉任务的关键转折点在于ViT确立了“图像patch即token”的表示方式,将二维图像改写为一维序列,从而接入自注意力和大规模预训练范式。相较于CNN,Transformer具备显著的全局建模优势,任意两个位置可以在单层内直接建立联系,关联路径不随空间距离拉长。同时,Transformer的归纳偏置较弱,主要依靠数据学习关系,在大规模预训练条件下更能释放数据规模的价值。更重要的是,将图像表示为token序列后,视觉任务的输入形式与语言任务趋于一致,接口统一利于跨任务与跨模态对齐,且其结构均一、可扩展性强,天然适配扩大模型与数据规模的路线。

视觉Transformer演进的三大阶段

视觉Transformer的演进并非对CNN的一次性替代,而是一个渐进的融合与再平衡过程,主要划分为三个阶段。第一阶段是图像被token化,Non-local等注意力模块先补足CNN的全局建模能力,随后ViT和DETR进一步改写了图像的输入与检测输出范式。第二阶段是可扩展通用骨干的形成,Swin、PVT、CoAtNet等模型重新吸收了局部性、层级结构和多尺度先验,而ConvNeXt则证明了ViT的训练经验可反哺卷积网络,实现了双向借鉴。第三阶段是视觉基础模型的兴起,DINOv2/DINOv3推动了自监督通用特征的发展,CLIP实现了开放词表的图文对齐,SAM系列则推动了可提示分割技术的成熟。

视觉智能的现状与物理AI的未来展望

从落地应用来看,视觉智能目前仍主要作为“感知性”中间能力存在,其结果通常需要嵌入既有业务流程才能兑现价值,尚未独立形成类似语言模型的消费级交互入口。视觉的“互动性”更多是通过CLIP、GPT-4V等视觉语言模型接入语言中枢获得的。参照语言智能的四次跃迁,视觉已完成架构与规模两次跃迁,对齐仅以图文对齐形式部分实现且依附于语言,推理跃迁在视觉侧尚未展现。尽管数字AI底座模型的发展路径已逐渐清晰,但其难以实现物理世界的建模闭环。因此,物理AI将成为物理世界的AI解决方案,智能驾驶作为最先跑通闭环的代表场景,被视为当前发展阶段增量更大的方向。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至