视频生成模型历史与现状如何?

视频生成模型历史与现状如何?

最佳答案 匿名用户编辑于2024/04/28 09:32

文生视频是个年轻的方向,最早能追溯到 15 年的基于 GAN 生成模型。

文生视频是个年轻的方向,面临着多方面的独特挑战。主要有 1)计算成本高昂:确保帧 间空间和时间一致性需要大量的计算资源,导致训练成本高昂;视频信息的复杂性进一步 加剧了计算成本,需要更强大的计算能力来处理海量数据。2)视频信息复杂:视频数据 形式多样,分辨率和比例各异,包含空间、时间、内容等多维信息;如何找到一种统一的 表示形式,以有效地进行大规模训练,是文生视频技术需要解决的关键问题。3)缺乏高 质量数据集:现有的文生视频多模态数据集数量有限,且标注程度不够,难以满足模型训 练的需求。4)视频描述的模糊性:如何用文本准确描述视频内容,是文生视频技术面临 的另一个难题,简短的文本提示难以完整描述视频,而复杂的描述又会增加模型的训练难 度。

 GAN 和 VAE 时代:文生视频模型最早能追溯到 2015 年。早期研究主要使用基于 GAN(生成对抗网络)和 VAE (变分自编码器)的方法在给定文本描述的情况下自回归地生成视频帧 (如 Text2Filter 及 TGANs-C)。虽然这些工作为文生视频这一新计算机视觉任务奠定了基础,但它们的应 用范围有限,仅限于低分辨率、短距以及视频中目标的运动比较单一、孤立的情况。

Transformer Based:受文本 (GPT-3) 和图像 (DALL-E) 中大规模预训练 Transformer 模型的成功启发,文 生视频研究的第二波浪潮采用了 Transformer 架构。Phenaki、Make-A-Vide、NUWA、 VideoGPT 和 CogVideo 都提出了基于 Transformer 的框架,而 TATS 提出了一种混合方法, 从而将用于生成图像的 VQGAN 和用于顺序地生成帧的时间敏感 Transformer 模块结合起 来。在第二波浪潮的诸多框架中,Phenaki 尤其有意思,它能够根据一系列提示 (即一个 故事情节 ) 生成任意长视频。同样, NUWA-Infinity 提出了一种双重自 回归 (autoregressive over autoregressive) 生成机制,可以基于文本输入合成无限长度的 图像和视频,从而使得生成高清的长视频成为可能。

 Diffusion Based:第三波文生视频模型浪潮主要以基于扩散的架构为特征。扩散模型在生成多样化、超现实 和上下文丰富的图像方面取得了显著成功,这引起了人们对将扩散模型推广到其他领域(如音频、3D ,最近又拓展到了视频) 的兴趣。这一波模型是由 Video Diffusion Models (VDM) 开创的,它首次将扩散模型推广至视频领域。然后是 MagicVideo 提出了一个在低 维隐空间中生成视频剪辑的框架,据其报告,新框架与 VDM 相比在效率上有巨大的提升。 另一个值得一提的是 Tune-a-Video,它使用 单文本 - 视频对微调预训练的文生图模型, 并允许在保留运动的同时改变视频内容。随后涌现出了越来越多的文生视频扩散模型,包 括 Video LDM、Text2Video-Zero、Runway Gen1、Runway Gen2、Stable Video Diffusion 以及 NUWA-XL。

这些模型缺点比较明显,比如支持视觉数据的类别少、视频时间短、视频尺寸固定等。当 时还在 Meta 实习、现任 Sora 项目的负责人之一的 William Peebles 于 23 年 3 月发表的 《Scalable Diffusion Models with Transformers》中的 Diffusion Transformers (DiTs) 对新的视频生成路线起到了关键的作用。DiT 的主要工作是替换了 Stable Diffusion 中 的 UNet 为 Transformer,证明了在图像生成领域的 Scaling Law,也即是减少 patch size 增加参数量对生成图像有较大的积极影响。

Sora 在 DiT 图像生成的基础上拓展到了视频生成,能够生成多样化的视频和图像,解决 了先前方法在视频长度、尺寸和固定大小方面的限制,能够生成任意比例的 1 分钟 1080P 的高质量视频。Sora 没有公布详细的模型架构,后文中我们会对其架构进行逆向工程分 析。 Sora 发布大约一周后,Google 也公布了其采用了类似模型架构的 Genie 视频生成模型, 论文中明确指出是采用了 Spatiotemporal (ST) Transformers 代替了 Stable Diffusion 中的 UNet。Genie 使用户能够逐帧地在生成的环境中操作,而且是在无监督(数据没有 标注)的情况下进行训练,更接近去世界模型的定义。虽然 Genie 目前只能生成 160X90 大小的视频,但是随着数据质量提升、模型规模的扩大,视频生成的尺寸和质量也会有所 提升。

在差不多的时间,Snap 也发布了其使用了 Spatiotemporal(ST) Transformers 的视频生 成模型,主要区别是其采用了 FIT(Far-reaching Interleaved Transformers)技术,该 技术能降低在 Token/Patch 扩大的情况下的计算复杂度。一般来说,n 倍长度的 Token/Patch 在经过 Multi-head Self-Attention 时会有 n^2 倍的计算复杂度,经过 FIT 优化后可以实现 n^4/3 的计算复杂度,降低了生成长视频或者高分辨率视频的算力需求。

国内已有超 15 家企业推出了视频生成工具,既包括字节、百度、阿里、腾讯等 6 家巨头, 也包括爱诗科技、生数科技、智象未来等 9 家创企。 智东西观察发现,文生视频领域大 厂与创企各有领头羊,字节和 Morph Studio 在稳定性和成像质量方面表现出色。然而, 大部分产品仍处于测试阶段,存在临时下线、排队时间长、无独立站点等问题。此外,生 成视频效率低,2-4 秒视频的等待时间通常需要 3-5 分钟甚至更久。同时,现阶段文生视 频的运动程度普遍较低,多为平移式运动或镜头运动,且对于人手、动物等非现实场景, 大模型仍难以理解和生成。

目前已公开的国内视频生成模型还多数处于 Video Diffusion Models 阶段,还没有使用 Diffusion Transformer 架构的。国内公司和机构也在快速跟进,北大的 OpenSora 项目 已经立项,计划复现 Sora 的模型架构与生成效果;字节在 3 月也将对自研的视频生成工 具开启内测,鉴于字节已经拥有上万张计算卡的集群,并且原抖音 CEO 转向剪映业务,字 节的新的视频生成模型也值得期待。

参考报告REPORT

AI模型分析报告:从世界模型看算力需求变化.pdf

AI模型分析报告:从世界模型看算力需求变化。Sora是第一个表现出"涌现"能力的视频生成模型:随着模型规模增大而出现“理解世界”的能力。虽然许多LLM,如ChatGPT和GPT-4,表现出涌现能力,但在Sora出现之前,展示类似能力的视觉模型一直很少。根据Sora的技术报告,它是第一个表现出确认的涌现能力的视觉模型,标志着计算机视觉领域的一个重要里程碑。Sora的成功源于DiffusionTransformer架构的引入,和过去多年高质量数据的积累。从架构上看,视频生成模型的技术路线开始收敛,Sora的DiffusionTransformer架构证实...

我来回答
分享至