生成式视觉演进:Transformer在图像生成中的渐进渗透路径

  • 来源:东吴证券
  • 发布时间:2026/08/08
  • 浏览次数:28
  • 举报
相关深度报告REPORTS

汽车行业深度报告:AI系列深度18期,生成智能如何引入Transformer?.pdf

全球生成式视觉技术正经历从对抗生成(GAN)向去噪生成(Diffusion)的范式更替,而Transformer架构则通过渐进式渗透成为工程化骨干。本报告复盘了2013年以来生成式视觉的发展历程,将其划分为VAE/GAN奠基、GAN主导高真实感生成、扩散复兴与理论统一、文生图爆发以及DiT与视频多模态扩展五个阶段。报告深入分析了GAN路线的结构性局限,包括训练不稳定、模式崩溃及语义控制弱等问题,指出这些局限为扩散模型的兴起留出空间。扩散模型通过将生成过程转化为稳定的监督去噪问题,并在潜空间中结合交叉注意力机制,有效解决了上述痛点,成为当前文生图的主流范式。在此基础上,报告详细拆解了Transf...

生成式视觉的范式迁移与本质

生成式视觉任务的核心目标并非对给定图像进行分类或检测,而是学习图像数据背后的分布规律,并在文本等条件约束下生成此前不存在的新内容。这一过程要求模型理解大量图像背后的结构、风格与语义分布,并据此进行新视觉内容的创作。自2013年以来,该领域经历了从传统概率图模型向深度神经网络端到端训练的转型,其发展主线围绕如何近似极高维空间中的真实分布并实现高效采样展开。

回顾过去十余年的技术演进,生成式视觉的发展可划分为五个关键阶段。第一阶段为2013至2015年的奠基期,变分自编码器(VAE)与生成对抗网络(GAN)确立了现代深度生成的两条基本路线。第二阶段为2016至2019年,GAN主导了高真实感图像生成,StyleGAN等模型将人脸生成质量推向巅峰。第三阶段为2020至2021年,扩散模型复兴并完成理论统一,去噪扩散概率模型(DDPM)标志着生成范式从对抗训练转向逐步去噪。第四阶段为2022年,随着CLIP提供图文对齐基础,文生图应用爆发,自然语言成为图像生成的主要入口。第五阶段自2023年至今,以DiT为代表的模型推动骨干网络Transformer化,生成对象从单图向视频及多模态扩展。

GAN路线的巅峰与结构性局限

在2016至2019年间,GAN是生成式视觉的主流技术路线。其核心原理在于生成器与判别器的对抗博弈:生成器试图从随机噪声中生成逼真图像以骗过判别器,而判别器则致力于识别真伪。这种“造假者”与“鉴定师”的相互较量使得模型能够隐式逼近真实数据分布,无需显式写出复杂的概率分布函数。从DCGAN的全卷积结构稳定训练,到pix2pix和CycleGAN实现图像翻译,再到BigGAN和StyleGAN实现高保真合成与可控潜空间,GAN路线在图像真实感方面取得了显著成就。

然而,GAN路线存在明显的结构性局限,这也为其后被扩散模型替代埋下伏笔。首先,对抗优化的平衡难以把握,训练过程不稳定,对超参数和网络结构高度敏感,容易出现不收敛或震荡现象。其次,模式崩溃问题导致生成器可能仅覆盖真实分布的一部分,样本多样性不足。此外,由于缺乏显式似然,GAN难以直接评估样本概率,导致模型比较与训练监控困难。最后,早期GAN主要依赖类别标签作为条件,对自然语言驱动生成的支持较弱,限制了其在复杂语义控制场景下的应用。

扩散模型的兴起与范式替代逻辑

2020年后,扩散模型迅速崛起并取代GAN成为生成式视觉的新主线。扩散模型的思想源于非平衡热力学,通过前向过程逐步向图像加入高斯噪声直至变为纯噪声,再训练神经网络学习反向的去噪恢复过程。这一机制将生成过程转化为稳定的监督学习问题,即给定加噪图像预测去噪方向,从而避免了GAN中的对抗博弈难题。

扩散模型之所以能完成范式替代,主要得益于其解决了GAN的核心痛点。在训练稳定性方面,去噪作为标准监督回归问题,更易复现且无需平衡生成器与判别器。在覆盖度方面,扩散过程对整个数据分布建模,显著缓解了模式崩溃,提升了样本多样性。在可控性方面,去噪的迭代结构便于在每一步注入条件信息,为文本条件生成提供了天然接口。尽管扩散模型存在采样速度慢和像素空间算力开销大的局限,但通过DDIM等确定性采样方法以及潜在扩散模型(Latent Diffusion)将扩散过程移至低维潜空间,这些效率问题得到了有效缓解,同时也为Transformer的介入预留了接口。

Transformer在图像生成中的四步渗透

与在语言领域快速替代RNN不同,Transformer在视觉生成任务中的融入是一个渐进过程,主要经历四个环节。第一环节是作为自回归序列生成器。2021年,DALL·E1和VQGAN通过将图像离散化为token序列,利用Transformer进行统一建模,证明了图像可被序列化且能像语言一样生成,但受限于推理效率和全局一致性,未成为最终主线。

第二环节是作为文本条件编码与注入机制。CLIP通过大规模图文对比学习实现了语言与视觉的对齐,随后Imagen、Stable Diffusion等模型利用Transformer编码文本语义,并通过交叉注意力机制将其注入扩散去噪网络。这一环节使自然语言成为图像生成的主要控制接口,推动了文生图的爆发,此时Transformer承担的是语言理解与条件接入的角色,扩散仍是生成主干。

第三环节是扩散骨干替换。2023年提出的DiT模型用Transformer替代了传统扩散模型中的U-Net骨干网络,在潜空间图像块上进行建模。这一改变验证了视觉生成同样具备规模化扩展潜力,将视觉生成接入了大语言模型时代的规模化路线,但并未改变扩散去噪这一核心范式。

第四环节是多模态统一与时空扩展。随着Sora、Veo等模型的出现,Transformer进一步成为视频与多模态生成系统的统一建模框架。它处理连续时空数据,推动生成式视觉从单图创作向视频生成及多模态交互演进,实现了从静态图像到动态世界模拟的跨越。

结论:Diffusion为主角,Transformer为工程化骨干

综合来看,本轮生成式视觉的核心范式迁移发生在GAN与Diffusion之间,即从对抗生成转向去噪生成。Transformer在这一过程中并非生成范式的更替者,而是作为工程化骨干升级与语言可控接口的关键组件。它通过自回归序列建模、文本条件注入、骨干网络替换以及多模态统一四个环节,逐步深化其在视觉生成领域的渗透。当前,主流文生图产品的生成主干仍是扩散模型,Transformer主要承担文本编码、条件注入以及DiT路线中的骨干角色。这种“Diffusion为主角、Transformer为工程化骨干”的格局,构成了当前生成式智能的技术底座。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至