视频生成模型专题深度:技术迭代、Sora启示与核心玩家竞争格局

  • 来源:国金证券
  • 发布时间:2026/08/07
  • 浏览次数:9
  • 举报
相关深度报告REPORTS

互联网行业:视频生成模型专题深度系列(一).pdf

视频生成模型正经历从技术范式探索向商业化加速验证的关键转折。Seedance2.5、MinimaxH3等最新模型的密集发布,标志着行业在原生音视频、多模态理解和长叙事能力上取得显著进展,而Sora的全面关停则提供了关于技术领先与商业成功之间复杂关系的深刻反例。研究目的与核心内容本报告为视频生成模型专题深度系列首篇,聚焦于三个核心问题:技术迭代路线与当前瓶颈、Sora关停的海外启示、核心玩家对比及迭代复盘。报告系统梳理了视频生成从GAN/VAE早期探索,经Token化Transformer与扩散模型并行发展,到DiT成为主流架构,再到原生音视频与多模态创作产品化的四阶段演进。关键技术判断DiT架...

技术路线演进:从GAN到DiT的范式迁移

视频生成模型的技术架构经历了四个阶段的迭代演进。2021年之前的早期学术探索期以GAN和VAE为代表,受限于训练稳定性和算力约束,主要集中于低分辨率、短时长视频生成。2021至2023年进入Token化Transformer与视频扩散并行发展期,形成两条技术路线:基于扩散模型的迭代去噪生成,以及基于Transformer架构的自回归Token预测。2024年以来,Diffusion与Transformer融合的DiT架构成为主流,通过视频压缩网络将原始视频映射至潜空间,再以Transformer替代传统U-Net作为去噪主干,结合了两者的规模扩展能力与长距离依赖建模优势。2025年第二季度至今,原生音视频联合生成与多模态创作成为进化方向,模型将画面、对白、音效和环境声的联合生成,以及多素材参考、续写和编辑能力整合至统一框架。

当前瓶颈:从表面拟合到动态关系学习

视频生成模型的评价重点已转向长时一致性、复杂交互和物理合理性。尽管Scaling效应在视频领域有所显现,但研究表明仅靠扩大模型规模、训练数据和算力,或不足以使模型自动掌握可稳定外推至训练分布外场景的物理规律。在速度、尺寸等条件超出训练分布的物体运动与碰撞场景中,模型仍可能更接近于模仿训练数据中的相似案例。下一阶段的核心目标之一,是推动模型从学习表面规律转向建模物体状态、材料属性、运动轨迹、相互作用及其结果之间的动态关系,以提升复杂场景下的物理合理性。Seedance 2.5的技术描述中也明确指出,复杂运动的物理合理性和极多主体交互场景的稳定性仍有提升空间。

Sora的转折意义:能力突破与商业困境

Sora被视为AI视频生成行业的重要转折点之一,其技术突破体现在四个维度:生成时长突破至约1分钟;复杂提示词理解能力增强;时序一致性与画面稳定性明显提升;初步展现动态镜头下的三维空间关系与物体持续存在能力。然而Sora于2026年全面关停,揭示模型能力突破并不必然转化为商业成功。关停原因涉及三个层面:战略层面,OpenAI全力备战IPO并应对竞争,将资源聚焦至Coding、企业服务等核心领域;商业模式层面,用户热度不持久,7日留存率约为2%,30日留存率约为1%,收入与成本严重倒挂;合规层面,版权治理机制从"主动退出"向授权模式调整,但训练数据授权、未授权角色识别等问题仍未完全解决。

核心玩家差异化定位与能力对比

当前头部视频生成模型形成差异化竞争格局。Seedance 2.5定位为"全模态长叙事与创作控制模型",拥有最大规模的多模态参考数量(单次最多30张图片、10段视频和10段音频)、最长的单次生成时长(30秒)以及时间戳级精细编辑能力,应用场景已扩展至具身智能、工业制造和汽车行业。Kling 3.0系列侧重"角色一致性与可控分镜模型",以Element为核心复用角色外观和声音资产,支持逐镜头设定时长、景别、视角和运镜。Minimax H3定位为"全模态理解与参考编辑模型",核心优势在于跨模态素材关系理解,将生成、参考和编辑任务统一建模。Google Veo 3.1侧重"高画质镜头生成与延展模型",支持4K输出和最多20轮视频延展,但素材参考规模相对有限。

Seedance迭代路径:从生成可用到创作可控

Seedance自2025年6月以来完成四个主要版本迭代,关键里程碑为2.0版本,采用统一的多模态音视频联合生成架构,成为全球首个跨过生产质变点的视频生成模型。2.5版本延续该架构,重点突破长叙事能力、多模态参考能力和编辑能力,单次生成时长提升至30秒,支持多轮延长并保持叙事连贯性。商业化配套方面,火山方舟版权商业化平台于2026年6月正式上线,与比高集团达成AI视频创作版权合作,建立"授权—保护—审核—分发—变现"的全链路机制。

可灵迭代路径:从可用化到All-in-One

可灵的迭代呈现快速演进特征,1.0版本成为全球首个用户可用的DiT架构视频生成模型;2.0推出MVL多模态视觉语言解决输入侧扩展;O1将参考生成和视频编辑统一到同一模型;2.6成为首个支持原生音频视频的模型;3.0迈向All-in-One框架,进一步统一多模态输入、音视频生成与编辑能力,其中3.0侧重通用生成和多镜头叙事,3.0 Omni侧重多参考一致性与专业分镜控制。

产业应用与商业化验证

AI视频生成产业端呈现加速态势。短剧领域,2026年第一季度新上线AI微短剧数量占比超过95%,AI剧和漫剧市场规模在2026年1月至5月已突破220亿元。长剧和电影领域,可灵AI深度参与《太平年》部分虚拟场景及视觉特效镜头创作;国内首部获得《网络剧片发行许可证》的全流程AIGC网络故事片《奇谭:纸刃渡荒墟》登陆爱奇艺,标志着从AI短片到AI商业长片的突破。后续核心关注及潜在催化包括Seedance 2.5实际效果与ARR转化、H3实际效果及商业化贡献,以及其他模型如Kling的更新进展。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至