视频生成技术发展历程与爆火原因有哪些?

视频生成技术发展历程与爆火原因有哪些?

最佳答案 匿名用户编辑于2025/11/12 14:15

S o ra 2 三天登顶美国 iOS 应用榜。

1.视频生成技术发展历程:从范式探索到架构收敛

视频生成技术是一条追求更高生成质量、更长内容时长与更强语义可控性的演进之路。视频生成承接图像 生成技术,早期以生成对抗网络(GAN)和变分自编码器(VAE)为代表,通过生成连续图像帧来构建视频,但受 限于稳定性与扩展性瓶颈,往往只能生成分辨率低、时长短的片段。随着技术不断演进,业内分化出两条并行 路线,Transformer 架构凭借其高效处理视频帧之间时序关系的能力展现出巨大扩展潜力;扩散模型(Diffusion Model)则通过从随机噪声中逐步还原画面的“去噪”范式,在生成质量上取得里程碑式突破。2022 年 1 2 月, 融合二者优点的 Diffusion Transformer(DiT)架构论文发表,经由 OpenAI Sora 产品侧验证后,逐步确立了 其作为视频生成领域主流技术范式的地位。

第一阶段(2017 年以前):图像拼接。VAE 于 2013 年提出,采用编码器-解码器架构,先将图像压缩至低 维度的潜在空间,再由解码器从空间中采样并重建图像,从而学习数据的核心分布。VAE 的目标函数倾向于生成 模糊平滑的图像,难以捕捉高频细节。2014 年发表的 GAN 则引入了对抗性训练机制,由生成器从随机噪声合成 图像,再由判别器进行真伪判别,二者竞争下生成器能够产出更真实的图像,判别器也能够更好区分图像真实 性。然而,由于 GAN 的目标函数没有显式地鼓励生成多样性,生成器在优化过程中往往会找到局部最优解,导 致模式崩溃问题。此外,基于 VAE 和 GAN 的视频生成核心在于将二者生成的图片帧进行拼接,缺乏对长距离时 序关系的有效建模,使得视频只能在短时间连贯,无法维持逻辑与内容的一致性。

第二阶段(2017-202 3 年):多路径探索。为解决前述缺乏时空一致性及图像分辨率不足等问题,业内多种 技术路径并行探索。其中,自回归路径将视频帧视为离散的 Token 序列,并逐个 Token 地预测生成后续内容。 为有效建模视频所需的长距离时序依赖,自回归路径通常采用 Transformer 等序列模型,其一定程度维系了视 频生成的时序连贯性,但串行的生成机制也带来了推理速度慢、误差易于累积等挑战。扩散模型路径则采用并 行“去噪”方式生成整个视频片段,极大地提升了生成画面的质量与稳定性。扩散模型路径早期普遍采用 U-Net 网络架构,催生了以 Runway Gen-2 为代表的系列产品,并迅速成为市场主流,但其在模型规模进一步扩大时逐 渐暴露出扩展性上的瓶颈。

第三阶段(2023 年至今):DiT 引领主流技术趋势。2022 年 12 月,《Scalable Diffusion Models with Transformers》发表,其核心思想在于用 Transformer 架构取代主流扩散模型路径中的 U-Net 骨干网络,并证 明了这种新架构(DiT)拥有卓越的扩展性。2024 年 2 月,OpenAI 发布的 Sora 进一步在产品侧验证了 DiT 的可 行性,Sora 的惊艳效果亦迅速推动 DiT 成为行业公认的主流范式。此后,市场上涌现出系列采用或对标 DiT 架 构的模型,如包括生数科技的 Vidu、Google 推出的 Veo 等,标志视频生成领域已进入 DiT 架构主导的新阶段。

2. Sora 2 爆火:产品工程化+社媒裂变

S o ra 2 三天登顶美国 iOS 应用榜。据应用情报提供商 Appfigures 数据,Sora 的 iOS 应用程序首发下载量 5.6 万,并在上线的两天内总计获得了 16.4 万次下载。尽管 Sora 的首日下载量落后于 ChatGPT 和 Gemini,但 考虑其在仅限美国和加拿大地区上线并采用邀请制的情况,其用户偏好可能更强。当地时间 10 月 3 日(周五), Sora 在上线第三天登顶苹果美国应用商店 App Store 的免费应用榜第一名,超越了 OpenAI 的 ChatGPT 和谷歌 的 Gemini。

尽管 S ora 2 尚未发布技术报告,但我们根据现有信息推测其并未在技术上明显突破,而是训练数据、产品 工程化等方面做出优化: 大规模数据训练:据 OpenAI 官网 Sora 2 展示页面表示,Sora 2 的一个重要里程碑是掌握大规模视频数据 的预训练和后训练方法。OpenAI 称,尽管 Sora 2 模型仍存在许多错误,但其证实了进一步扩大视频数据上的 神经网络将使模型更接近模拟现实。 指令遵循与音画同步:Sora 2 在可控性方面也实现了较大突破,其能够执行跨越多个镜头的复杂指令,同时精准地保留世界状态。此外,作为通用的视频音频生成系统,Sora 2 能够创建具有高度真实感的复杂背景音 景、语音和音效。Sand.ai 创始人曹越在接受极客公园访谈时表示:“从纯技术角度看,把声音做好,可能不像 把视频或语言做好那么难。但从产品和用户视角看,声音是决定性的。正是因为 Sora 能让音画同步输出,才 使得普通用户生成的视频具备了直接的可消费性,越过了 C 端产品普及的临界点。” 提示词增强/重写:尽管 Sora2 是视频模型,但其亦可以解决 LLM 基准测试中的问题。Epoch AI 在小部分 GPQA 问题上测试了 Sora 2,其得分为 55%(GPT-5 得分为 72%)。据 Epoch AI 推测,Sora 2 用户的提示可能在 视频生成之前被 LLM 重写,即 LLM 层可能会先解决问题,然后将解决方案明确地包含在重写的提示中。实际上, 混元亦于 9 月开源了 PromptEnhancer 技术架构,仅通过“思维链(CoT)提示重写”的思路使 AI 生图的对齐精 度大幅提升,在抽象关系理解、数值约束等复杂场景中,准确率甚至能提升 17%以上。

产品侧重视 AI+社交则是 Sora 2 爆火的另一重要因素。相较于此前视频生成模型追求高分辨率的输出, Sora 2 仅生成 360p 画面并免费供受邀请用户使用,大幅降低了用户门槛。Cameo 功能则支持用户制作保留面部 微表情与声纹特征的数字分身,并可将分身植入自己或朋友生成的视频场景。考虑到邀请码的裂变机制(受邀 请用户也会生成 4 个新的邀请码)本身强调用户更可能将产品分享给熟悉的朋友,更进一步为 Cameo 功能提供 了基础。通过朋友共创+私域传播,Sora 2 成功打造了“AI+社交”的产品氛围,加速产品爆火节奏。 S o ra 2 的爆火标志着 AI 应用竞争进入了新阶段——单纯的技术参数比拼之下,更重要的是将技术能力无 缝封装进优秀的产品体验、并设计出能够自我驱动的病毒式传播循环,才是引爆大众市场的关键。

参考报告REPORT

计算机行业AI系列报告:一文读懂Sora2核心点.pdf

计算机行业AI系列报告:一文读懂Sora2核心点。Sora2以“为产品定义功能”的产品思维,构建了从拉新、留存到促活的产品闭环,3天登顶iOS应用榜,开启了P、B、C三端共振的千亿级AI视频生成赛道。据测算,AI视频生成市场中期空间将达到763亿元,长期将达到1554亿元。同时,根据我们正文的测算依据,保守估计SoraAPP每日仅推理成本便高达1400万美元,年化成本超过51.2亿美元,预计将带来持续的算力需求。建议关注两大主线,AI应用推荐以阿里为代表的互联网大厂生态伙伴、Pre-AI环节和垂直场景;算力环节推荐算力和端侧AI相关标的。“为产品定义功能&r...

我来回答
分享至