Sora模型底座、灵感及核心能力介绍

Sora模型底座、灵感及核心能力介绍

最佳答案 匿名用户编辑于2024/03/21 16:11

如果你对该问题感兴趣的话,推荐你看看《人工智能行业专题报告:从Sora看多模态大模型发展》这篇报告,下面是部分摘录的内容,具体请以原报告为准。

1.Sora模型底座:Diffusion Transformer

Sora是一个Diffusion(扩散)模型:输入有噪声的patch,预测原来“干净”的patch。 同时,Sora是diffusion transformer。Transformer在语言、视觉和图像生成等多个领域都表现出良好的拓展能力。如今,视频 领域同样表现优异。

Sora是一个Diffusion(扩散)模型:输入有噪声的patch,预测原来 “干净”的patch。 同时,Sora是diffusion transformer。Transformer在语言、视觉和图像生 成等多个领域都表现出良好的拓展能力。如今,视频领域同样表现优 异。 Sora模型 VS 基础模型:基于Transformer的Sora与基于U-Net的基础模 型相比,有提升了一个量级的视频时长(2秒到1分),更强的清晰度 (4K到1080P),支持数字世界模拟,在一致性等方面均表现更优。

2.Sora模型灵感:谷歌使用Patchify技术压缩时空变量

2023年12月,斯坦福团队同谷歌合作,推出了用于生成逼真视频的扩散模型W.A.L.T。该方法成功地将 Transformer 架构 整合到了隐视频扩散模型中。

隐扩散模型(LDM)可在源自自动编码器的更低维隐空间中运行,从而降低计算需求。第一阶段,用一个自动编码器将视 频和图像映射到一个统一的低维隐空间,可以在图像和视频数据集上联合训练单个生成模型,并显著降低生成高分辨率视 频的计算成本。第二阶段,该团队设计了用于隐视频扩散模型的新 Transformer 块,其由自注意力层构成,这些自注意力 层在非重叠、窗口限制的空间和时空注意力之间交替。首先,使用局部窗口注意力能显著降低计算需求。其次,它有助于 联合训练,其中空间层可以独立地处理图像和视频帧,而时空层则用于建模视频中的时间关系。

Patchify(图块化)。按照原始 ViT 的设计,该团队对每个隐含帧分别进行图块化,做法是将其转换成一个不重叠图块的序 列。窗口注意力。完全由全局自注意力模块组成的 Transformer 模型的计算和内存成本很高,尤其是对于视频任务。为了 效率以及联合处理图像和视频,该团队是以窗口方式计算自注意力,这基于两种类型的非重叠配置:空间(S)和时空 (ST)。

该团队在文本 - 图像和文本 - 视频对上联合训练了 W.A.L.T 的 文本到视频生成能力。他们使用了一个来自公共互联网和内部 资源的数据集,其中包含约 970M 对文本 - 图像和约 89M 对文 本 - 视频。

3.Sora核心能力:3D一致性&物体持久性

视频生成模型最大的挑战:长视频序列保持时间一致 性。 源于规模效应,Sora生成的人物和场景在三维空间的 移动十分自然。 有效模拟短期和长期依赖关系:物体被遮挡或暂离画 面,也可以准确表示它们。 长时间序列外观一致性:能够在单个视频中生成同一 角色的多个场景,保持外观一致性。

世界交互&模拟数字世界

世界交互:模拟简单行为方式影响世界状态, 如吃汉堡后留下咬痕。 模拟数字世界:如视频游戏。以“Minecraft” 为例,Sora能控制玩家角色,以高度逼真方 式模拟游戏世界变化。

参考报告REPORT

人工智能行业专题报告:从Sora看多模态大模型发展.pdf

人工智能行业专题报告:从Sora看多模态大模型发展。1、OpenAI发布视频生成模型Sora,视频生成能力实现大幅提升:2024年2月16日,OpenAI发布视频生成模型Sora,能生成各种持续时间(甚至长达1分钟)、宽高比和分辨率的视频和图片。Sora模型基于DiffusionTransformer技术,采用视频压缩网络(Videocompressionnetwork)、潜空间patch(Spacetimelatentpatches)、直接在原始大小训练(Trainingondataatitsnativesize)以及重新标注技术(Re-captioningtechnique)技术,可以图像...

我来回答
分享至