全球AI公司商业化进展如何?

全球AI公司商业化进展如何?

    标签
  • AI
最佳答案 匿名用户编辑于2025/07/24 09:07

海外商业化更超前,国内出海进展迅速。

全球维度,年化收入超过 1 亿美金的产品绝大多数为海外+多模态+初创公司,且头部效应 显著。据非凡产研统计数据,截至 25 年 5 月,全球主要的 AI 产品中,年化收入超过 1 亿 美金的有 26 个,其中 3 个产品来自国内公司(美图、快手、睿琪软件,其中美图、快手为 上市公司),占比 11.5%;多模态产品有 12 个,占比 46.2%。收入区间上看,年化收入超 过50亿美金的仅有OpenAI(未考虑OpenAI 2B的API收入),10-50亿美金的仅有Anthropic (未考虑 Anthropic 2B 的 API 收入),这两家均为全球大模型的龙头厂商,其模型产品是全 球大模型中的领先者。2-10 亿美金的公司有 Midjourney(图像生成)、Anysphere(AI Coding)、 Dialpad(客户支持)、6sense(营销)。Top 100 AI 产品的年化收入大多在 1 亿美金以下。 我们认为,全球 AI 商业化上,头部效应显著,海外商业化快于国内,多模态产品是其中重 要的产品形态,AIGC、Coding、客服等场景均有较成功的商业化典型。

国内维度,年化收入靠前的产品主要为多模态+上市公司,且出海比例高。据非凡产研统计 数据,国内年化收入超过 1000 万美金的 AI 产品有 31 个,其中拥有最多上榜产品的公司为 美图(5 个产品)。相比全球头部的 AI 产品收入,国内收入差一个数量级以上(美图秀秀/ 快手 1 亿美金年化收入 vs OpenAI 56 亿美金年化收入)。

另外我们还发现,高流量/高 MAU 的产品并不意味着商业化能力更强,流量/MAU/商业化 “三高”的公司,几乎都是海外头部公司,多模态可能是国内商业化更好的出路。具体地, Web 端看,同时出现在 Top 26 收入排行榜和 Top 30 Web 访问量排行榜的,有 ChatGPT (聊天助手)、Perplexity(AI 搜索)、Claude(聊天助手)、Hugging Face(Infra)、Eleven Labs(AI 语音)。App 端看,有 ChatGPT(聊天助手)、美图秀秀(AI 图像)。其中仅有美 图是国内公司。即使像 DeepSeek、豆包这种流量 Top 的国内应用,收入层面也相对较少。 我们认为,流量/MAU/商业化同时有较好实现的公司基本都是海外头部公司,背后可能是付 费习惯/模型智能的差距。产品模态上,文本模态国内外差异化显著,以典型的聊天助手类 应用为例,国内几乎很难实现商业化,而国外却能做到几乎最 Top 的商业化(OpenAI、 Anthropic)。因此多模态或是国内商业化更好的出路,美图、快手、睿琪软件进展较快。

聚焦国内外 AI 应用的上市公司,从 AI 化进度和收入占比角度,差距并不显著。截至最新 年度或季度,1)C 端,我们测算国内上市公司中,AI 收入贡献度平均为 12.5%,而海外典 型的 2C 公司多邻国,AI 收入贡献为 13.1%,差距不大。2)B 端,我们测算国内上市公司 中,AI 收入贡献度平均为 9.0%,海外上市公司平均在 9.4%,较为接近。我们认为,从 2B/2C 上市公司角度看,国内外差距并不显著。只是在前文讨论的一级创业公司上,国内外由于 投融资生态/用户习惯等原因,差距较为明显。

多模态产品持续迭代,可用性和商业化均向好。图像生成:从高质量到易用性,各玩家寻求差异化卖点。图像生成产品经历了从“追求更高逼真度”到“提升易用性与整合度”的路线。Midjourney 不断迭代模型版本提高图像质量和细节理解,同时通过 Discord 社区运营积累大批创意用户; OpenAI 则将 DALL·E 直接嵌入 ChatGPT 对话,让普通用户在聊天中就可生成图像。Adobe Firefly 将 AI 融入现有创意工具,用户几乎无感地在 Photoshop 等产品中使用生成填充等 AI 功能完成设计。这一系列演化体现出图像生成正从小众试验转向大众应用:模型能力提 升的同时,使用门槛大幅降低,AI 生图正在成为普通内容创作的一部分。

随着玩家增多,各家产品都在寻求差异化卖点。新玩家专注解决长期痛点,例如 Ideogram 针对 AI 绘图文字难题提供了出色方案。Leonardo.ai 深耕游戏美术领域,提供从概念图到 贴图甚至简单动画的一条龙服务。Krea 主打多模态实时编辑,让创作过程更直观互动。这 些差异化特性帮助产品在细分市场站稳脚跟。此外,各类型生成工具之间界限日渐模糊, 跨模态融合成为趋势。例如图像平台开始支持视频生成(25 年 6 月 Midjourney 发布视频生 成产品 V1);视频平台增加多语言声音输出(Synthesia、HeyGen 等添加 AI 配音翻译, Google Veo 3 支持原生音频);大平台通过一个入口融合多模型能力,例如微软 Copilot 同 时接入 OpenAI 文本、Suno 音乐等模型,Adobe 把 Firefly 植入全家桶应用。

视频生成:国内厂商多模态发力的主要赛道Sora 指明了 DiT 的视频生成技术路线,但是发布时。间推迟,给了其他厂商追赶机会。Sora 发布之前,主要的视频生成产品是海外 Runway Gen 系列和 Pika 系列,以及国内爱诗科技 Pixverse 系列。Sora 发布后,尤其是 Diffusion Transformer(DiT)技术路线的确认,各初 创公司和大厂在视频生成赛道加速布局,国内厂商进展迅速。初创公司方面,大模型公司 MiniMax 和智谱在 AI 助手中嵌入了视频生成功能,且发布即可用,无需排队等待。大厂方 面,字节即梦和快手可灵先后上线视频生成产品。尤其是快手可灵的商业化进展迅速,成 为国内视频生成领域的标杆应用。

视频生成各平台竞相突破时长、清晰度和一致性瓶颈,各有特色。从早期仅能生成 3–4 秒 片段的实验模型,到如今已有产品支持 10 秒以上甚至分钟级视频(如即梦 AI 可达 12 秒, 快手可灵通过续接实现数分钟)。生成视频的分辨率和帧率也大幅提升,智谱清影已开始探 索 4K 视频生成。与此同时,各模型愈发注重角色和风格的一致性:海螺 AI、Vidu、PixVerse 等先后推出“主体一致”或“角色复用”功能,保证同一人物在不同镜头和片段中形象不 走样;Pika Labs 等则在真实性之外另辟蹊径,提供丰富的创意特效来拓展视频表现力。整 体而言,国内视频生成模型技术差异逐步缩小,多个瓶颈得到突破,功能亮点各有侧重。 商业模式上,大多数产品采用免费+订阅的 Freemium 策略。前文的 AI 产品商业化分析中, 我们已经指出了国内多模态的商业化进展迅速,尤其是视频生成产品性能全球领先,其中 快手可灵(Kling)的商业化已经取得了重大突破。从定价策略上看,大部分视频生成产品 基础功能对公众开放试用,吸引流量和创作生态;高阶功能和算力通过会员收费或按量计 费提供,持续支持研发投入。大多数平台也都开始布局企业服务和 API 接口,将生成视频 能力嵌入商业场景(广告制作、影视预览、游戏内容生成等),并获得 B 端收入。 我们认为,后续更长、更高质、更可控是 AI 视频生成的发展方向。未来视频生成产品或将 从几秒短剪辑走向成分钟剧情片段,从抽象试验走向拟真内容,从生成内容不可控到可控、 可编辑。此外,视频生成模型还需要解决长序列视频的稳定性和因果逻辑不足的问题,以 及进一步降低算力成本以实现实时生成。我们认为,随着模型算法迭代和数据规模增长, 视频生成的应用场景将更加广阔,包括数字人直播、游戏过场动画、教育培训影片等都将 被重新定义,内容生产的门槛和成本将大幅降低。

近期典型视频生成模型更新#1:字节 Seedance 1.0。6 月 11 日火山引擎 Force 原动力大会上,字节发布了全新的视频生成模型 Seedance 1.0, 实现一个模型同时支持文字和图片生成视频,原生具备多镜头叙事能力。在语义理解和指 令遵循方面取得突破,可生成运动流畅、细节丰富、具备影视级美感的 1080p 高清视频。 在第三方评测榜单 Artificial Analysis 上,Seedance 1.0 视频生成、图生视频两个任务的表 现均位居首位(参见图表 24-25)。Seedance 1.0 可以通过即梦、豆包及火山引擎 API 接口 开放使用。

Seedance 1.0 在数据构建上进行了大幅改进。数据很大程度上决定了模型的训练成果。 Seedance 1.0 在数据构建上,聚焦于视频多源采集与描述说明(Caption)获取,通过多阶 段的筛选和均衡来增强模型对视频中的主体、动作、场景、风格以及 Prompt 的理解力。不 仅构建了多种类型、风格、来源的大规模视频数据集,还专门训练了“精准描述模型”来 生成视频描述(Caption),作为训练数据。流程包括三个主要阶段:1)多样性的数据获取: 初始采集和合规性预筛选各种数据;2)多阶段数据管理:将原始数据提炼为视频剪辑;3) 离线数据打包:视频和字幕转成 token 以进行模型训练。

Seedance 1.0 在模型训练架构上进行优化,可同时支持文生视频(T2V)和图生视频(I2V) 等任务。1)时空层解耦:解耦空间层和时间层的扩散 Transformer 模型,空间层在单帧内 部执行注意力聚合,而时间层则专注于跨帧的注意力计算,整体上提升了计算效率。2)多 镜头多模态旋转位置编码:除了按业内常规的策略对视觉 token 使用 3D 旋转位置编码,团 队还为文本 token 添加了额外的一维位置编码,并在拼接后的序列中,引入了 3D 多模态旋 转位置编码(MM-RoPE),增强多镜头生成能力和多模态理解力得以加强。3)任务框架统 一:使用二元掩码来指示哪些帧应遵循生成中的控制条件,实现了统一框架下,只需部署 一个模型就可实现文本到图像、文本生视频和图像生视频等多种任务。

后训练阶段的强化学习进一步增强视频生成效果。自从 24 年 9 月 OpenAI 在 o 系列模型中 开始使用强化学习 RL,这一方法几乎成了全球模型的统一迭代路线。Seedance 1.0 同样 在后训练阶段使用高质量的精调数据集、多维度的奖励模型和反馈学习算法,来进一步提 升运动生动性、结构稳定性、画面质量等。团队采用了为视频生成定制的 RLHF(基于人类 反馈的强化学习)算法,最大化多个奖励模型(RM)奖励值,大幅提升 Seedance 1.0 在 文生视频、图片生成视频两个任务中的综合效果。

算法加速+推理加速,实现 Seedance 1.0 约 40 秒生成 5 秒 1080p 视频。推理速度是用户 体验重要的一环。为了提高推理速度,Seedance 1.0 采用:1)扩散模型算法加速:通过 引入分段轨迹一致性、分数匹配与人类偏好引导的对抗蒸馏机制,在极低推理步数下实现 了生成质量与速度的优化协同。2)底层推理加速:通过融合算子优化、异构量化稀疏策略、 自适应混合并行、异步卸载与 VAE 并行分解等系统级改造,在保证质量的前提下,构建了 面向长序列视频生成的高效推理路径。

近期典型视频生成模型更新#2:MiniMax Hailuo 02。Hailuo 02 实现 NCR 架构创新,3 倍参数量/4 倍数据量加持下模型表现更上一层楼。 MiniMax 自去年 8 月推出视频生成 demo 以来,截至 25 年 6 月已经帮助创作者生成了超过 3.7 亿个视频。25 年 6 月在连续 5 天的模型/产品发布中,MiniMax 更新了视频生成模型 Hailuo 02,相比前一版模型,参数规模是其 3 倍,训练数据量是其 4 倍。模型突破了 DiT 架构,提出 Noise-aware Compute Redistribution(NCR),训练和推理效率提升了 2.5 倍, 使得 Hailuo 02 可以在不增加创作者使用成本的情况下,在复杂指令遵循和复杂物理表现上 更强(对于体操等高度复杂的场景,MiniMax Hailuo 02 是目前全球唯一能够一致化实现的 模型),同时实现了以相对实惠的价格生成原生的 1080p 视频。

基于 Hailuo 02,MiniMax 发布了 Hailuo Video Agent,将视频生成落地到智能体领域。 Hailuo Video Agent 是视频创作 Agent,通过用户输入,能够实现自动分析、构思并生成具 有专业水准、富有观看价值的完整视频内容。单独的视频生成模型,需要用户自己构思创 作的全过程,门槛较高。而 Hailuo Video Agent 能够通过 LLM 调用工具能力,帮助用户打 造视频构思、资料收集、分镜制作、剪辑、配音等视频制作全流程,整个流程提供可视化 的思维链,用户能够实时查看/编辑 Agent 创作流程,实现共创。后续更新中,Hailuo Video Agent 有望实现完全端到端的视频 Agent 能力,大大降低创作门槛。我们认为,Agent 是未 来 LLM 落地最重要的应用形态之一,MiniMax 较早开始在视频生成领域落地 Agent,或能 够率先占据用户心智,打开商业化空间。

其他多模态交互 AI 产品。其他多模态产品的快速崛起,扩展了 C 端用户能够借助 AI 创作的内容类型矩阵。除了之前 讨论的图像、视频外,语音、音乐、3D 等各领域产品也找到了各自的切入点。ElevenLabs 主攻高品质语音合成和克隆;Suno 让普通用户能够生成带人声演唱的完整歌曲。在数字人 方面,Synthesia 定位企业培训、营销的视频生成,强调高质量、严控形象;HeyGen 灵活 面向自媒体和轻量商业,支持用户自定义头像、翻译原有视频内容等。多模态产品的演进 方向各异,但总体趋势是围绕不同内容形式,优化出特定场景下的 AI 创作体验,丰富了 C 端市场的选择。 为满足用户和企业的特定需求,个性化定制能力越来越受到重视。用户场景“千人千面”, 导致过于标准化的产品越来越难以适配需求,多模态个性化能力对于做出产品差异化越来 越重要。一方面是模型输出个性化,典型如用户用自己照片生成专属数字人(HeyGen、 Synthesia 等),用自己声音训练专属语音(ElevenLabs),或用自己数据微调模型风格 (Stable Diffusion 社区大量微调模型)。另一方面是服务层面的定制,如企业希望模型懂自 己的品牌语言和素材,Adobe 提出让 Firefly 训练企业专属风格,Synthesia 为大客户制作 专用 Avatar。这种“千人千面”的趋势将 AI 工具从大众模式带向个人/企业私有化阶段,使 得生成内容更符合使用者期望,也促进了数据生态的发展。

参考报告REPORT

科技行业深度研究:多模态大模型和应用奇点将至.pdf

科技行业深度研究:多模态大模型和应用奇点将至。我们认为,多模态大模型和应用发展的奇点将至。判断依据包括:1)技术进步方面:原生多模态模型架构得到业界认可,OpenAI和Google的原生多模态模型已经在性能、延时、部署上展现出了优势。2)商业化进展方面:全球维度看,除了最头部的OpenAI和Anthropic依靠模型“智能”实现商业化,相当一部分AI应用公司的商业化产品依赖多模态能力。国内维度看,国内公司在视频生成赛道已经实现了较成熟的全球化和商业化之路。与市场不同的观点在于,1)更早认识到原生多模态架构将成为主流;2)AI商业化不能仅聚焦在二级公司,更要关注全球维度一...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至