OpenAI Sora亮点在哪?

OpenAI Sora亮点在哪?

最佳答案 匿名用户编辑于2024/04/28 15:37

Sora 文生视频模型推出超预期,有效驱动 AI 应用发展。

从全球看,OpenAI 推出文生视频模型 Sora,人工智能赋能短视频领域。2024 年 2 月美国 OpenAI 继 2022 年底 ChatGPT 发布后,推出全球首款文生视频模型 Sora,该款模型可以通过输入文字及提示词 (最长 135 个)后,生成细节连贯的相关视频。Sora 的发布,使得 ChatGPT 从文字、图片层面正式向 成熟短视频层面进行演进,可生成最长 60 秒的全动态视频,通过深入理解物体在现实世界中的存在方 式,具备创建复杂场景和多人物角色的能力。

它能够描绘道具、生成表现出丰富情感的角色,充分展 示了对物体存在的出色理解,确保了生成视频过程中人物、环境等一致性,一经推出备受关注。 Sora 具备“世界模拟器”的潜力,视频长度提升和效果超预期。Sora 发布前,友商 Pika、Runway 等生成模型大多处于生成 4 秒左右的“动图”范畴,60 秒连贯视频叠加 Sora 更强的语义理解能力、对 不同宽高比和分辨率的适应能力、优秀的视频扩展能力等优势,使得 Sora 发布后便同其它模型产生较 大代差,对 AI 制作视频领域带来新一轮突破。

算法原理方面,Sora 本质上基于“Transformer+Diffusion”。Sora 是一个在不同时长、分辨率和宽高 比的视频及图像上训练而成的扩散模型,同时采用了 Transformer 架构,也就是一种“扩散型 Transformer”。 Sora 主要的算法基础原理在于 Transformer+Diffusion,从文字生成视频主要经过三步,分别为语义理解、 生成图像以及图像排序生成视频,语义理解主要基于 ChatGPT,生成图像基于 Diffusion,图像排序生成 视频则基于 Diffusion 及 Transformer。 首先,Sora 需要巨量数据进行学习分析。由于 Sora 属于文生视频模型,故而需要互联网规模的海 量视频数据库进行分析学习,进而通过数据库进行联想,从而对输入的语义有加深的了解;其次,通 过文字生成图片。

在文字输入后,Sora 会将文字先利用 ChatGPT 生成(Transform)图片,即 Transformer, 给出的文字越多,生成的图片细节愈发丰富;而 Diffusion 则会根据关键词特征值对应的可能性概率, 在使用视频库中数据进行多次拟合后,将碎片化信息粘合进行完整的图片输出;生成图片后,再多次 重复该过程,生成完整视频。将完整的图片进行时间序列排序,利用时空补片技术(Spacetime latent patches)生成具有语义代表性的视频成品。给定一个压缩的输入视频,模型会提取一系列时空补片, 充当 Transformer 的 token。正是这个基于补片的表示,让 Sora 能够对不同分辨率、持续时间和长宽比 的视频和图像进行训练,在推理时,模型则通过在适当大小的网格中排列随机初始化的补片来控制生 成视频的大小。

Sora 是对已有信息的整合,未来发展仍可持续演进。根据 Sora 算法原理,我们可以发现其核心是 基于互联网上已有的视频信息,根据文字输入要求进行碎片化拼接整理,从而具备基于现有数据库的 基础联想能力,虽然 Sora 目前突破了文生视频模型的时长限制及连贯性的问题,但尚未完全理解现实 世界中的物理法则和随机应变,未来 AI 发展潜力仍有较大提升空间。 Sora 是 ChatGPT 的延伸,商用前景大有可为。

鉴于 Sora 的算法及底层核心逻辑机制,我们认为当 前 Sora 更多的意义在于将 AI 潜力具象化,当前处于该具象化进程早期阶段,其本质仍然是以 ChatGPT 为底座的文生视频模型,与其它文生视频模型相比,拥有时长更久、长期一致性、多样化视频格式输 出等特点,其内核仍以 ChatGPT 及自身视频训练量关联度较大。我们认为 Sora 作为在 ChatGPT 上衍生 的文生视频模型,未来主要发展方向也正如其所说,或将以“世界模拟器”为前景,逐步提升其创作 能力和推理能力。长期来看,Sora 将远远不只是内容生产工具,其构建的基于三维物理世界来创造数 字原生世界的强大引擎,将给一些产业从底层工具层面带来变化,形成深远影响。

参考报告REPORT

数字经济专题:人工智能行业应用如火如荼,数字经济算力基建再接再砺.pdf

数字经济专题:人工智能行业应用如火如荼,数字经济算力基建再接再砺。OpenAI推出文生视频模型Sora,人工智能赋能短视频应用发展超预期。从全球角度看,OpenAISora的发布,使得ChatGPT从文字、图片层面正式向成熟短视频层面进行演进,可生成最长60秒的全动态视频,具备了创建复杂场景和多人物角色的能力,一经发布业界就引起较大轰动。Sora本质上基于“Transformer+Diffusion”,属于GPT的延申,代表了人工智能应用的进一步尝试,让世界看到了AI行业的更多可能,随着全球对AI的热衷程度不断提高,未来全球AI应用发展有望超预期。政策明确我国数字基础设...

我来回答
分享至