2025年人工智能行业分析:AI新纪元,砥砺开疆·智火燎原

  • 来源:中信建投证券
  • 发布时间:2025/07/28
  • 浏览次数:993
  • 举报
相关深度报告REPORTS

人工智能行业分析:AI新纪元,砥砺开疆·智火燎原.pdf

人工智能行业分析:AI新纪元,砥砺开疆·智火燎原。自ChatGPT发布后,大模型向更强、更高效、更可靠方向发展,呈现推理模型深化、智能体模型爆发的格局。美国在探索更强大模型上保持全球领先,中国企业则在算力受限下实现高效性全球领先。2025年是应用加速落地之年,OpenAI已达百亿美金ARR,Claude月收入环比增速超20%。受互联网大厂推动AI与业务结合、Agent推出、主权AI需求及多模态渗透等因素影响,AI算力消耗从训练转向推理,带来显著增量,国内算力自主可控趋势凸显。B端应用渗透率慢于C端,落地顺序由容错率与复杂度决定,从高容错、单一任务场景到低容错、高复杂度场景尚需时间...

一、大模型发展情况及展望

大模型发展历史:人工智能发展历经三个主要阶段,从符号智能、专用智能迈向通用智能,2017 年之后我 们正处于通用智能阶段。从专用智能向通用智能转变的过程中,能力来源(数据)、训练方法等都发生了变化, 如数据从有标注变为通用无标注数据,学习方法从过去的有监督学习变成无监督学习,能力从专用任务(如图 像识别)扩展到通用任务,这个过程中,在算力的加持下,参数量和数据量都急剧变大,因此有了我们今天看 到的大模型。 大模型能力来源关键:2017 年是个关键的时间点,那一年,Google 提出了 Transformer 架构,得益于其自 注意力(self-attention)机制,使得 Transformer 能够对序列中的每个 Token 分配不同的权重,并捕捉到上下文之 间复杂的关系,文字序列预测变成了可能,并通过无标注大数据对世界知识进行萃取。更可喜的是,当人类把 大模型训练的越来越大时,大模型出现了涌现能力,即“相变”式突现出在小模型中不存在的能力,比如数学 推理能力。规模扩展不仅是量变,同时也是质变,更是人类迈向通用人工智能的可能路径之一。

大模型是电力+算力+数据+人才的综合产物,围绕大模型衍生出来一系列应用最终将深刻改变我们的世界 形态。站在今天看未来,大模型发展将围绕以下三点展开:更强大、更高效、更可靠。 更强大我们看到:1)Scaling law 依然有效;2)增强的推理模型及更长的上下文窗口;3)多模态的集成; 4)Agent 及群体智能出现;5)实时数据集成和检索增强生成;6)合成数据助力。 一、Scaling Law依然有效:与人类对比,参数量某种程度上类似于神经元,神经元的增加带来生物个体智 能涌现。直到今天,提升模型参数规模、扩大训练语料库仍然是大语言模型提升性能的重要手段。在多模态数 据中、在模型推理过程中、在生物数据中、在世界模型、Agent 应用中,缩放法则刚刚初步崭露头角,缩放法则 将从文本为主的大语言模型训练迁移到更加广阔的人工智能领域。 二、推理模型:在后训练部分,通过强化学习可实现推理能力的自主进化,模型开始学会了深度思考。目 标为了作对题目,大模型就会自发进行更长地思考,并且最后回答效果更好。在这个过程中,自发涌现出“反 思”、“多步验证”等复杂推理行为,出现问题后,模型会自动纠正早期错误,这种“智能”的出现,为未来更有 智慧的 Agent 出现铺平了道路。 三、多模态的集成:模态信息的扩充让大模型对世界的理解开始变得更为宽广。文本、语音、图片等单模 态模型已经相对成熟,大模型正在朝着多模态方向快速发展,原生多模态较好地解决了输入延迟等问题,同时, 基于 Transformer 架构的扩散模型展现出了更好的扩展性,文生视频的质量也有明显提高。 四、Agent 及群体智能出现:迈向 AGI 核心任务之一是拓展能力树,大模型不能停留在纸上谈兵阶段。 Agent 的出现将快速把大模型能力从“做题”延伸到“工作”中,简而言之,大模型开始从“小镇做题家”变成 “都市白领多面手”。生物群落带来生物群体智能涌现,多智能体群聚也将带来 AI 群体智能涌现,进一步提升 大模型性能,如第四章介绍的 TradingAgents 多智能体架构开源交易系统。 五、实时数据集成和检索增强生成:2025 年,大模型在实时数据集成能力上呈现显著提升态势。以检索增 强生成(RAG)架构为典型代表,其核心价值在于通过将大语言模型(LLM)的生成能力与真实、具备时效性 的外部知识进行 “锚定”,有效缓解了大模型固有的 “幻觉” 问题 —— 即生成内容时编造不实信息的倾向。类似微软 Copilot 等工具,通过接入实时互联网进行信息验证,进一步减少模型输出的偏差,使响应结果更贴合 人类认知与实际需求。 六、合成数据:数据作为模型能力提升的核心基石,其供给规模与质量直接影响技术演进节奏。据研究机 构 Epoch AI Research 预测,人类生成的公开文本数据总有效存量约为 300 万亿 tokens;若按当前消耗速度, 互联网上所有高质量文本数据或将在 2028 年耗尽,而机器学习所依赖的高质量语言数据集,其枯竭时间点甚 至可能提前至 2026 年。此外,机器人领域的相关数据集因采集难度高、场景覆盖有限等问题,获取成本显著 上升,一定程度上制约了具身智能的发展进程。因此,合成数据需求越显迫切性,可喜的是,以 Kimi K2 为代 表的开源大模型,通过大规模智能体数据合成,显著地提升了模型性能。

更高效我们看到:1)MOE架构的进一步优化;2)FP8 等低精度的应用;3)超越标准 Transforme r 的新型 架构范式,如 Mamba 这样的状态空间模型(SSM)、RNN 与 Transformer 等一系列新的架构探索;4)计算效率 提升。 一、MOE架构:即通过多个专家网络处理不同特征,提升模型的整体能力。在全球范围内,中国大模型在 MOE 架构优化方面处于领先地位,不仅体现在专家数量的优化配置上,还在于门控模型及注意力机制的深度创 新。典型的如 DeepSeek R1、Kimi K2。 二、FP8 等低精度的应用:低精度进行大模型训练始终是一个难题,难以在效果和成本上取得平衡,而以 DeepSeek R1 为代表的模型很好地应用 FP8 精度实现了模型的训练。后续 FP6/FP4 等精度的推出,给予不同应 用领域在成本与效果上更多的选择。 三、超越标准 Transformer 的新型架构范式,如 Mamba 这样的状态空间模型(SSM)、RNN 与 Transformer 等一系列新的架构探索:部分新架构的探索体现在对 Transformer 的二次时间复杂度的注意力机制优化上,状态 空间模型(SSM)如 Mamba,通过引入状态空间的动态演化机制,摒弃传统 Transformer 的二次时间复杂度的 注意力机制,在处理长序列数据时,展现出线性复杂度的计算优势,大幅提升计算效率,尤其适用于语音识别、 时间序列预测等需要处理长序列信息的任务。此外,RNN 与 Transformer 的融合架构探索也取得进展,结合 RNN 对序列顺序依赖的良好建模能力与 Transformer 的并行计算优势,提升模型在复杂序列任务中的表现,为 大模型架构创新开辟新方向。 四、计算效率提升:英伟达每一代芯片性能都有明显提升,另外针对底层的流水线并行策略等一系列优化, 也使得计算效率提升。产业对于计算架构的思考与实践在不断进行,从谷歌推出的 TPU,到 Nvidia 推出 GP U 内 置 Tensor Core,到寒武纪的 NPU,到 Groq 提出的 LPU,大规模计算时代对于计算的架构探索在不断进行,大 的趋势是从存算分离的架构,逐步到存算耦合度提高,再到存算一体的思路在演进,其演进的节奏有产业趋势 的强支撑,也有商业化各方利益的角逐约束。 更可靠我们看到:1)Scaling law 依然有效,GPT4.5 幻觉明显下降;2)实时数据进行事实验证;3)思维链 等。有些方法实际上兼而有之,如实时数据集成和检索增强生成则既可以增强性能,更多的事实检查也可以降 低幻觉,以思维链为核心的推理模型也可以大幅提升问题的准确率。 时至今日,美国依然在探索更强大模型上具备全球领先性。目前呈现推理模型深化、智能体模型爆发的发 展格局。OpenAI o3 领跑全球,但近期受到 Claude 4、Gemini 2.5 pro 升级版的挑战,大模型竞争格局逐渐从 OpenAI 一家独大转变为北美大厂竞相霸榜。

而中国企业在算力受限的情况下,在更高效上做到了全球领先。从地理分布上看,全球已经形成人工智能 的“两极格局”,且未来这一格局仍将长期保持。至 2024 年,中美两国自研大模型数量占全球 80%以上,中国大 模型数量已经接近 100 款。根据斯坦福以人为本人工智能研究所(Human-Centered Artificial Intelligence, HAI, 领导者为李飞飞)发布《2025 年人工智能指数报告》,2024 年结束后,中美顶级 AI 模型的能力(多项基准测试 得分加权平均)差距已由前一年的 20%缩小至 0.3%。中国视角来看,DeepSeek-R1 迈出了中国 AI 全面追赶美 国的关键一步。DeepSeek-R1 通过架构创新、软件优化及前沿方法,在推理能力上逼近国际顶尖水平,且训练成 本大幅降低。其开源策略为本土 AI 发展提供了技术参考,缩小了与美国的技术差距,如今豆包 Seed1. 6、阿里 通义千问、Kimi K2 等国产模型呈现百花齐放局面,并且开源的 Kimi K2 再次体现国产模型更高效的特点。从 大模型的技术本质与人才储备来看,中国的大模型企业的能力并不落后,2025 年是世界认知中国人工智能潜力 的第一年,未来有望走出国门走向世界。 在中美两国的引领下,全球对更强大、更高效大模型地探索持续深化。进入 2025 年,大模型的应用落地 进程呈现显著加速态势。我们总结了目前海外典型大模型 ARR(年化收入,亿美元)情况,OpenAI 已实现百亿 美金 ARR,月度 CAGR 仍然保持 10%的环比增速,Claude4 凭借代码优势,ARR 半年时间从 10 亿美金奔向 30 亿美金,月度 CAGR 超过 20%的环比增速,海外大模型开始加速实现商业化落地。然而,这只是刚开始,结合 Pew Research 的样本调查,截至 1Q25,34%的美国成年人已经采用 ChatGPT,大约相当于美国 PC 互联网 2003- 04 年的渗透率水平,也就是说,ChatGPT 2 年零一个季度的渗透率大致对应 PC 互联网 10 年的渗透进度。A I 大 模型对产业的渗透速度超过此前互联网革命,并且其展现出来的商业化潜力和付费意愿也超过传统应用。从 Sensor Tower 统计的应用内购收入来看,AI 应用占据整体应用(剔除游戏)比例约 1.73%。而如果从 AI 应用的下 载量来看,2024 年 AI 应用下载量达 14 亿次,占据全球所有应用下载量约 1.0%,付费比例超过了下载比例。

最后,以大模型为核心的产业链,深刻改变了全球资本市场。美当地时间 7 月 9 日,英伟达成为全球首个 破 4 万亿市值公司。复盘美股主要算力与模型标的,2023 年至今算力板块累计涨跌幅达到 496.6%,模型与应用 板块累计涨跌幅达到 151.1%,均受益于 AI 从而产生较大涨幅;从涨幅趋势对比,算力与模型板块涨跌幅存在 极为相通的波动趋势,任何的算力降本亦或模型突破范式,最终都将转化为对两个板块的同时利好。从涨幅绝 对值对比看,2023-2024 年初基于“模型爆发到应用爆发”转化时间的不确定性,算力与模型涨幅差距相对不大。 但 2024 年以来伴随模型 Scaling law 的持续演进,以及算力板块业绩的快速兑现,算力开始相较模型跑出巨大 的收益差距,直至 2025 年 1 月 DeepSeek 的发布对模型 Scaling law 范式产生一定冲击,同时叠加宏观因素导致 算力收益率大幅下行。此后,伴随海外新一代模型陆续发布,Post-train、Test-Time Training 等层面的 Scaling law 仍在持续演进,同时 AI+传统应用带来大量推理需求,二者共同推动算力板块进入触底反弹阶段,并在 25 年 6 月逐渐达到新高。

1.1 人工智能发展历史

1.1.1 人工智能定义

人工智能是智能机器所执行的通常与人类智能有关的智能行为,这些智能行为涉及学习、感知、思考、理 解、识别、判断、推理、证明、通信、设计、规划、行动和问题求解等活动。随着时代的演进,人们对人工智 能的定义也在不断地发生变化。 1950 年图灵(Turing)设计和进行的著名实验(后来被称为图灵实验,Turing test),提出并部分回答了“机器 能否思维”的问题,是对人工智能的一个很好的诠释。图灵测试的方法很简单,就是让测试者与被测试者(一个 人和一台机器)隔开,通过一些装置向被测试者随意提问。进行多次测试后,如果有超过 30%的测试者不能确定 出被测试者是人还是机器,那么这台机器就通过了测试,并被认为具有人工智能。 其后也有很多学者机构对人工智能提出定义。在 Transformer 架构发布前后,Google 提出人工智能是能够执 行通常需要人类智能的任务,诸如视觉感知、语音识别、决策和语言翻译的计算机系统理论和开发。

进入大语言模型(LLM)时代,人们对人工智能的认识进入到了一个全新的阶段,提出通用人工智能 (Artificial General Intelligence, AGI)的概念作为人工智能终极目标。AGI 是指一种智能系统,其智能水平与人 类相似,能够在广泛的任务和领域中表现出类似于人类的推理能力和智慧。AGI 的目标在于构建一个能够像人 类一样执行各种认知任务的智能系统,具备高度的灵活性和自适应性,能够在多样化的任务和环境中学习、改 进,并展现出卓越的智能表现。

1.1.2 自计算机时代一波三折的 AI 之路

人工智能第一次发展浪潮:推理与搜索占据主导,但由于当时机器计算能力的不足而经历了第一次低迷期。 人工智能(Artificial Intelligence,缩写 AI),是研究、开发用于模拟、延伸和扩展人的智能的理论、方法、技术 及应用系统的一门新的技术科学。这一概念最早由麻省理工学院的约翰·麦卡锡在 1956 年的达特茅斯会议上提 出,随之迎来了人工智能的第一次发展浪潮(1956-1974)。这一时期的核心在于让机器具备逻辑推理能力,通过 推理与搜索尝试开发能够解决代数应用题、证明几何定理、使用英语的机器。该阶段的成果几乎无法解决实用 问题,另外实际应用中人工智能计算量的增长是惊人的,特别是模拟人类感知带来的巨大运算量远超 70 年代的 计算能力,因此人工智能经历了第一次低迷期。 人工智能第二次发展浪潮(1980-1987):专家系统开始商业化,场景局限性限制其发展。这一时期的核心 是基于“专家系统”思想,让 AI 程序能解决特定领域问题,知识库系统和知识工程成为了这一时期的主要研究 方向,专家系统能够根据该领域已有的知识或经验进行推理和判断,从而做出可以媲美人类专家的决策。典型 代表如医学专家系统 MYCIN,MYCIN 具有 450 条规则,其推导患者病情的过程与专家的推导过程类似,开处 方的准确率可以达到 69%,该水平强于初级医师,但比专业医师(准确率 80%)还是差一些。随着人们发现专 家系统具有很强的场景局限性,同时面临着升级迭代的高难度和高昂的维护费用,因而 AI 技术发展经历了第二 次低迷期。

从 1993 年开始,AI技术步入了第三次发展浪潮(1993-):深度学习引领浪潮。这一时期,计算性能上的障 碍被逐步克服,2006 年深度学习这一重要理论被提出,并解决了训练多层神经网络时的过拟合问题。2011 年以 来,深度学习算法的突破进一步加速了 AI 技术发展的第三次浪潮,标志性事件是 2012 年 ImageNet 图像识别大 赛,其深度 CNN 网络的错误率仅为 15%左右,远远好于第二名支持向量机算法的 26%,这一结果迅速点燃了 产业对神经网络和深度学习的兴趣,深度学习也快速的实现了商业化。

1.1.3 从机器学习到深度学习

机器学习(ML)是人工智能(AI)的重要分支(其它核心子领域包括自然语言处理 NLP 和计算机视觉 CV 等),主要解决计算机从数据中学习拟合规律,从而实现智能预测、决策与优化这一问题。机器学习三要素分别 为数据、算法、模型,三者关系可以简单理解为数据+算法=模型,即将数据在不同算法的训练学习下,最终形 成模型,用以对外部数据进行预测。按照范式分类,机器学习可分为监督学习、无监督学习、强化学习等。

神经网络是机器学习的重要分支。但是受算力限制影响,上个世纪 50-60 年代神经网络只能处理线性分类, 因此应用领域狭窄,使得神经网络研究陷入 20 年停滞。在深度学习概念被明确提出之前,针对神经网络的研究 为后续深度学习的提出和发展完成了基础性工作。第一代神经网络从 1958 年感知机算法被提出开始,其可以对输入的多维数据进行二分类,并通过梯度下降(使网络的预测值与网络的实际/期望值之间的差异不断缩小)的 方法从训练样本中自动学习更新权值(模型进行分类的参数),由此引发了第一次神经网络研究的热潮。1969 年, Minsky 在著作中证明了感知机本质上只是线性模型,对于即使是最简单的非线性问题都无法正确分类,随后导 致了对神经网络的研究陷入了近 20 年的停滞。

上个世纪 80-90 年代神经网络具备持续优化和解决非线性能力后,开启第二代神经网络研究热潮,但由于 存在梯度消失问题,研究也逐渐冷淡。Hinton 于 1986 年提出了反向传播算法(从最后输出的神经元开始,反向 更新迭代每一个神经元的权值,计算当前数据通过神经网络后的结果与实际结果的差距,从而根据差距进行参 数优化),并采用 Sigmoid 作为激活函数进行了非线性映射,让神经网络具有了解决非线性问题的能力,由此开 启了第二代神经网络研究热潮。但后续由于神经网络缺乏相应的严格数学理论支持,甚至被指出存在梯度消失 问题(随神经网络层数增多,靠近输入层的层之间的权重无法得到有效修正),严重影响深度神经网络的训练效率 和效果,因而神经网络的第二次热潮也逐渐冷淡。这一时期中,也出现了具有革新意义的模型,如 CNN-LeNet 和 LSTM 模型,其分别在手写数字识别、序列建模两个方面取得了良好效果,但由于神经网络研究整体处于下 坡而并没有引起足够关注。

解决了梯度消失以及利用 GPU 进行神经网络训练后,计算机能处理的神经网络层数大大增加,而当神经网络层数增加到一定数量后,模型学习能力得到了质的提升,这就是深度学习,而深度学习也被认为是神经网 络的第三次研究热潮,并持续至今。2006 年 Hinton 提出了梯度消失的解决方案以及利用 GPU 进行深度学习训 练,首次提出了深度学习这一概念。2011 年,新的 ReLU 激活函数被提出,有效抑制了梯度消失的问题。2011 年,微软首次将深度学习应用在语音识别上,取得了重大突破。2012 年,Hinton 课题组参加 ImageNet 图像识别 比赛,其深度学习模型 AlexNet 夺得冠军,识别率远远超越了基于 SVM 方法的第二名。理论上的不断完善和硬 件算力(GPU)的突破共同在全世界范围内掀起了研究深度学习的热潮并持续至今。

1.1.4 Transformer 架构引爆大语言模型时代

深度学习在自然语言处理、计算机视觉领域展现出了前所未有的重要性。在自然语言处理领域中, Transformer 结构的提出是深度学习发展过程中的重要里程碑,为后续深度学习的进一步发展奠定基础。2017 年,为 NLP 下游任务中的机器翻译而提出的 Transformer 模型成为了新的重要创新。其利用多个注意力模块的 组合,让神经网络得以利用有限的资源从大量信息中快速筛选出高价值信息,不断提取并学习目标对象中更为 重要的特征,进而实现了传统卷积遍历等方法所不能实现的效率,促成了模型参数量与性能的大幅提升。

Transformer 架构最初设计用于序列转导或神经机器翻译,Transformer 擅长将输入序列转换为输出序列。 这是第一个完全依靠自关注来计算输入和输出表示的转导模型,而不使用序列对齐 RNN 或卷积。Transfor me r 架 构的核心是编码器-解码器模型。如果将 Transformer 架构简单理解成一个连接输入输出的“黑盒”,那么这个黑 盒的核心组成部分就是编码器(encoder)和解码器(decoder)。 编码器的主要功能是将输入标记转换为上下文表示。与早期独立处理 token 的模型不同,Transformer 编码 器根据整个序列捕获每个 token 的上下文。工作基本步骤为:输入嵌入、位置编码、编码器层堆栈。解码器的作 用主要是制作文本序列。与编码器类似,解码器也配备了一组类似的子层。它具有两个 Multi-Head attention 层, 一个点前馈层,并且在每个子层之后都包含剩余连接和层归一化。

在解决了模型参数量限制的问题后,OpenAI 和 Google 基于 Transformer 分别提出了 GPT 和 BERT,提 升了诸多自然语言处理下游项目的最优性能。后续 Transformer 强大的特征提取能力被包括计算机视觉在内的其 他人工智能领域广泛采用,其核心注意力模块逐渐成为深度学习中不可或缺的部分,大幅推进了各领域人工智能算法的性能表现。后续人工智能深度学习中的大部分模型框架也都是建立在 Transformer 的基础上,包括引发 热议的 GPT-3 和 ChatGPT。而 GPT 是一个自回归模型,意味着它生成每个词时仅依赖于前文。BERT 的核心是 通过双向编码器进行训练,能够理解一个词的前后文信息而非只有前文。二者的路线差异最终导致了 GPT 成为 现行技术框架的主宰,而 BERT 渐渐淡出了这场大模型的百舸争流。至此,深度学习便从最初简单的感知机算 法,简单的神经网络,发展到目前参数量达到数千万亿的庞大而复杂的神经网络,成为当下人工智能技术、应 用、产业中的主流解决方案。

1.1.5 GPT 时刻到来

2018 年,OpenAI 团队发布 GPT-1,其核心技术逻辑是在大规模未标注数据集上预训练一个通用的语言模 型,再在特定 NLP 子任务上进行微调,从而将大模型的语言表征能力迁移至特定子任务中。其创新之处在于, 提出了一种新的预训练-微调框架,并且特别强调了生成式预训练在语言模型中的应用。生成式,指的是通过模 拟训练数据的统计特性来创造原始数据集中不存在的新样本,这使得 GPT 在文本生成方面具有显著的优势。 GPT 使用了 Transformer 的解码器部分,整体上模型结构分为三部分:输入层(将文本转换为模型可以处 理的格式,涉及分词、词嵌入、位置编码等)、隐藏层(由多个 Transformer 的解码器堆叠而成,是 GPT 的核心, 负责模型的理解、思考的过程)、输出层(基于隐藏层的最终输出生成为模型的最终预测,在 GPT 中,该过程 通常是生成下一个词元的概率分布)。在隐藏层中,最核心的两个结构分别是掩码多头自注意力层、前置反馈网 络层。

基于这一技术路线,2022 年 11 月,ChatGPT 发布,生成式人工智能(AIGC)正式进入平民时代。ChatGPT 通过对话框,利用一个大语言模型就可以实现问题回答、文稿撰写、代码生成、数学解题等过去自然语言处理 系统需要大量小模型定制开发才能分别实现的能力。ChatGPT 是 AI 从专用工具向通用助手进化的里程碑,是 AI 产业从单点突破到生态爆发的里程碑,自 ChatGPT 发布后,“人工智能改变世界”正式从口号变为了现实。

1.1.6 强化学习成为打开推理时代和智能体时代的钥匙

针对 AGI 的远大愿景与目前人工智能领域所能触及的智能边界,OpenAI 对于 AGI 未来发展之路做出了 进一步的阶段性解读,将 AI发展划分为了五个阶段,分别为:L1-聊天机器人/Chatbots。AI 具备基本对话和交 互能力,能与用户进行流畅的对话;L2-推理者/Reasoners,AI 将能解决类似人类博士水平的复杂问题,展现强 大推理和问题解决能力;L3-智能体/Agents,AI 能独立采取行动,不仅能思考,还可以在没有人类持续监督的情 况下执行任务;L4-创新者/Innovators,AI 能协助发明创造,推动科技进步,具备创造性和创新能力;L5-组织者 /Organizations,AI 将能执行整个人类组织的工作,展现出高度的自主性和策略性。

人工智能正向智能体发展,AI发展五大阶段中,目前处于推理者与智能体的交叠时期。随着模型越来越智 能,能够使用工具的智能体会变得越来越重要。智能体将具备更高的情境感知能力和自主执行力,能够在动态 环境中整合信息,自主判断并选择合适的行动方案,从被动的任务执行者转变为能够主动规划和优化行动的综 合性系统。GPT4 系列基础模型效果不及预期,说明预训练受到 Scaling Law 限制愈发明显,仅提升参数规模、 扩大数据集对模型性能的提升边际递减。另一方面,后训练、测试时 Scaling 方兴未艾,DeepSeek-R1 等实践已 经证明,现在推理时代已经全面开启。

强化学习(Reinforcement learning, RL)是一种很重要的模型训练技术,它的基本原理可以这样理解:智能 体(也就是模型)通过和环境互动,按照人为设定的策略来行动,之后会收到相应的奖励,同时进入下一个状 态。它的最终目标,就是找到能让累计奖励尽可能最大化的最优策略。借助动态优化机制和 “试错搜索” 这种 目标导向的反馈循环,强化学习能生成高质量的推理过程,大大增强了大语言模型的推理能力。它的核心逻辑 是把人类思考时的推理过程,转化成一个可以量化的决策问题,再通过奖励函数引导模型自己去探索最优策略。 在基于强化学习的推理模型里,模型经过多轮优化迭代的过程,其实就相当于它在进行推理思考;可以说,正 是强化学习让模型具备了推理能力。

以 DeepSeek R1 为例,其采用两轮 RL+两轮 SFT(监督微调)的多阶段训练框架,每一轮训练都基于前一轮 迭代调整,成功在后训练阶段赋予了模型推理能力。第一阶段通过纯 RL(GRPO)优化推理准确性,第二阶段通 过 SFT 解决语言混合问题,再通过 RL 结合规则奖励进一步提升性能 在强化学习之外,研究者也发现了“测试时扩展(Test-time scaling)”。在大语言模型结束强化学习之后,即 使在推理阶段,通过不断延长大语言模型的推理时间,大语言模型也能够取得更加优异的推理成绩。模型预训练、后训练的强化学习、推理时的测试拓展共同组成了我们现在看到的三段式 Scaling Law。

在 AI发展的五个阶段中,我们目前处于 L2→L3,即推理式人工智能向智能体人工智能升级阶段,这两个 阶段中,强化学习均起到了至关重要的作用。业界实践已证实,让 AI 增强思考能力、提升行动能力的关键在于 强化学习。此外强化学习也已经越来越深入大模型的训练(DeepSeek-R1、阿里 QwQ)、测试(TTRL)阶段,以进一 步提升模型能力。 AI基准测试的设定原则也将随着强化学习的应用而更新,人们对人工智能能力的评价基准也或将进入通过 强化学习不断迭代升级的发展新路径。旧路径:新模型在基准测试中不断改进、催生更难的基准测试,而后诞 生新的模型,模型-基准-模型依次阶梯上升。新路径:开发针对现实世界能自我迭代的泛化基准,在迭代的基准 中提升 AI 能力,实现模型与基准的实时同步升级。

不过也应注意 RL 在一些实际场景出现技术弊端。例如奖励欺诈、过度思考等问题。RL中不完备的奖励函 数会变相鼓励模型“瞎掰”,通过最佳猜测达成最大化奖励,进而导致幻觉率提升。(例如 OpenAI o3 幻觉率为 o1 的 2 倍,被认为是 RL 奖励机制所致)另一方面,基础模型反思的能力在预训练阶段就能显现,说明推理能 力并非一定是强化学习促成。因此,RL 固然重要,但还远未达到“RL is all you need”的程度。

1.2 海外基础大模型发展趋势及技术展望

自 ChatGPT 发布后,大模型行业发展不断加速,目前呈现推理模型深化、智能体模型爆发的发展格局。海 外大模型发展势头总体持续保持领先。OpenAI o3 领跑全球,但近期受到 Grok4、Claude 4、Gemini 2.5 pro 升 级版的挑战,大模型竞争格局逐渐从 OpenAI一家独大转变为北美大厂竞相霸榜。

1.2.1 OpenAI

OpenAI成立于 2015 年,由萨姆·奥尔特曼(Sam Altman)、埃隆·马斯克(Elon Musk)等硅谷科技领袖 联合创立,初期为非营利组织,2019 年转型为“封顶”营利性实体,现由非营利母公司 OpenAI Inc.与营利性子 公司 OpenAI LP 组成,微软为最大投资者(持股 49%)。创始团队早期聚焦开源工具开发,随后转向大型语言模 型研究。 OpenAI 于 2018 年发布 GPT-1,2019 年升级至 GPT-2 并开源部分模型,2020 年推出参数达 1750 亿的 GPT3,2022 年 11 月 ChatGPT 上线,5 天用户破百万,引发全球 AI 热潮,2023 年用户数突破 1 亿,成为史上增长 最快的消费级应用。多模态领域,2021 年推出图像生成模型 DALL-E,2024 年 2 月推出文生视频模型 Sora ,被 视为 AI 内容创作的里程碑,推动公司估值不到 10 个月增至 800 亿美元。2024 年 9 月,公司发布推理模型 o1, 标志着 AI 正式迈入推理时代。 OpenAI地位优势显著,从 2018 年推出基于 Transformer 架构的 GPT-1 以来,公司始终走在 AI大模型的 最前沿。技术层面来看,openAI 的具备大模型全栈领先技术,推理模型、智能体等产品能力始终保持在全球领 先水平;此外,公司不断推行与大模型相关的行业基准、未来观点等,进一步强化公司在细分市场的绝对影响 力。2024 年,公司以 7100 亿元估值位列胡润全球独角兽榜第三,2023 年营收突破 16 亿美元,用户覆盖 92%的 财富 500 强企业,全球访问量跻身前 50 大网站。其技术领先性、微软 Azure 云的算力支持等优势使其在全球 AI 领域的龙头地位持续巩固。

2024 年 12 月,OpenAI发布最新 o3 模型。作为目前最强大的推理模型,o3 在图像推理、编程、工具调用 等方面表现出色。o3 能够将图像内容融合入思维链中,能在思考全程任何时刻进行视觉推理,多模态能力显著 提升。同时,o3 通过扩展强化学习提升了工具能力,研究团队在模型强化学习阶段进行了大规模 Scaling,训练 了模型使用工具的能力。此外,o3 也是未来 Agent 的强力基底模型,可以通过 API 中的函数调用访问自定义工 具,结合模型自身强大的推理能力,能够自主完成更多更加复杂的任务,特制版本的 o3 已经作为 OpenAI Deep Research 的基底模型提供服务。OpenAI o3 拥有强大的图像推理能力,首次实现了图像与思维链的整合。模型 不仅能“看到”图像,更能“用图像进行推理”。这一突破实现了视觉与文本推理的深度融合,使其在多模态基准测试中达到最先进水平。o3 强大的图像推理能力基于视觉理解与工具调用的有机结合实现。一方面,o3 的视 觉理解能力十分强悍,根据用户测试,不论是手写内容,还是拍摄照片,模型都能实现准确理解。即使图像存 在模糊、倒置或低质量的情况,模型仍能准确解析。另一方面,模型具有很强的工具调用能力,配合 Python 数 据分析、网络搜索和图像生成等工具,o3 能在推理过程中即时操控图像,让图像处理成为其思考的一部分。

OpenAI的基础模型目前受到 scaling law的限制,开发进度显著不及预期。2025 年 2 月,OpenAI发布 GPT4.5,定价$75(150)/百万 tokens 输入(输出),比 GPT-4o 高 15-30 倍,模型研发过程中更是出现耗时严重超期、 计算集群频繁故障等问题。4 月发布 4o 续作 GPT4.1 系列(GPT4.1、GPT4.1 mini、GPT4.1 nano),性能较 GPT-4o 有所增强,在多模态处理、代码能力、指令遵循和成本方面显著提升,且上下文窗口提高到了 100 万 tokens。 OpenAI 未来或将致力于打通基础模型与推理模型,逐渐实现现阶段 AI 大模型的“泛化”。公司将于未来 数月推出 GPT5。GPT-5 不同于前代仅仅只是基础模型,更将成为一个打通 o 系和 GPT 系的“全能系统”。GPT5 整合多项尖端技术(包括 o3),或将同时具备博士级学科专业能力、更快的推理速度、全感官多模态。GP T 5 将 成为 OpenAI 在 AGI 路上的重要里程碑。

1.2.2 Anthropic

Anthropic 于 2021 年由 Dario Amodei 和 Daniela Amodei 兄妹及一批前 OpenAI核心研究人员共同创立, 公司自创立之初便将“AI 安全”置于核心,致力于构建可靠、可解释和可控的 AI 系统。Anthropic 的技术核心 是其独创的“宪法 AI(Constitutional AI)”方法。该方法通过一个由多份文件(包括《联合国世界人权宣言》)组 成的“宪法”来训练和约束模型,指导其生成更可靠、诚实且无害的回答。 技术发展方面,Anthropic 推出的 Claude 系列模型是其核心产品。2023 年 3 月发布 Claude 1、2023 年 7 月 发布 Claude 2、2024 年 3 月发布 Claude 3,模型迭代速度惊人。其模型在长文本处理、推理能力和安全性方面 表现出色,成为 OpenAI 最强有力的竞争者之一。Anthropic 的财务增长堪称爆炸性。截至 2025 年 5 月,其年 化收入(ARR)已达到 30 亿美元,五个月内增长了两倍。目前,Anthropic 的总融资额已超过 127.5 亿美元,公 司估值也达到了 615 亿美元。 2025 年 2 月,Claude-3.7 Sonnet 发布,首次引入混合推理功能,结合了普通大型语言模型和专门的推理模 型能力。Claude-3.7 Sonnet 有两项关键升级:一是超强的多模态能力:能准确解读图片内容,理解图表、截图中 的文字,甚至可以分析复杂的技术图像。二是超长上下文支持:能够处理高达 20 万 tokens 的内容,相当于一本 小说的长度。此外,AI 编程工具 Claude Code 为 Claude 提供强大的编程能力基础。能够通过自然语言指令帮助 开发者高效编写代码,简化开发过程,并在 AI Agent 领域展现出强大潜力。Claude 3.7 Sonnet 扩展思考模式计 费标准为每百万输入/输出 tokens 3/15 美元。

2025 年 5 月,Claude4 系列发布,共包括两款模型:Opus 4(旗舰款)和 Sonnet 4(标准款)。据 Anthropic 介绍,新发布模型专为高级推理、代码生成、智能体任务等新一代人工智能功能设计,在复杂长时间任务方面 展现出强大的性能。Claude Opus 4 在 SWE-bench 和 Terminal-bench 测试中,分别以 72.5%和 43.2%的得分全面 领先,碾压 OpenAI 刚刚发布的编程智能体 Codex-1 和最强推理模型 o3。而标准款 Claude Sonnet 4 的编码能力 突出,在 SWE-bench 测试中取得 72.7%的成绩。Sonnet 4 在内部及外部应用场景中,均实现了性能与效率的良 好平衡,可操控性也大大增加,在能力与实用性之间达到了最佳平衡。

Claude 4 具备一系列新的强大功能:一是使用工具进行扩展思考,在推理和使用工具之间交替切换,提升 了其推理能力;二是与 Claude Code 深度集成,大幅提升其代码能力与任务执行能力;三是一系列新 AP I 功能, 包括 MCP、代码执行、本地文件 API、提示词长缓存,使其综合实力非常完备。Claude 4 出色的编程能力也表 明,在人工智能从推理 AI 迈向智能体 AI 的过程中,大模型的能力拓展方向已经开始向编程、工具调用等方向 转变。

1.2.3 Google

Google 在人工智能领域的探索与投入根植于其公司历史。2023 年,Google 整合了 Google AI、DeepMind 两 大团队,成立了 Google DeepMind,由杰夫·迪恩(Jeff Dean)和戴密斯·哈萨比斯(Demis Hassabis)等传奇人 物领导,旨在加速其通用人工智能(AGI)的研发进程。作为 Transformer 架构的诞生地,Google 在 AI 领域拥 有深厚的技术积淀和人才储备。 受到组织架构以及初期 BERT 技术路线选择的影响,Google 在大模型方面发力较晚。2023 年底,Google 正式推出其对标 GPT 系列的多模态大模型 Gemini 系列,整整比 ChatGPT 晚了一年时间。Gemini 包括能力最强 的 Ultra、性能均衡的 Pro 和轻量化的 Nano,并将其全面融入搜索、云、Android 和 Workspace 等核心产品生态 中。自 Gemini 1.0 发布以来,Google 的模型迭代不断加速,于 2024 年 2 月推出 Gemini 1.5、2024 年 12 月发布 Gemini 2.0、2025 年 3 月发布 Gemini 2.5。 Google 在 AI 竞赛中具备两大核心优势。一是 AI 应用生态构建完备。Google 更新 AI mode 搜索引擎,能 够处理多重查询,提供更深入多样化的搜索结果。此外,Google 还在测试“深度搜索”和实时视觉数据功能, 计划将其整合到常规搜索中,力图通过 AI 重塑其搜索引擎业务。此外在 XR 方面,Google 推出了首个 Ge min i 时代的 Android XR 平台。该系统专为 XR 头显、智能眼镜等扩展现实设备设计,通过与 AI 深度整合实现“无 接触辅助”功能。二是 Google 具备垂直领域全方位整合突破的能力,Google 是目前全球唯一一家在算力芯片、 基础模型、云推理计算、AI应用方面全栈深度布局的公司,反映出 Google 全面推进 AI战略的宏图壮志。根据 SemiAnalysis 分析,全球 AI 工作负载中,NVIDIA GPU 占 70%,而 Google TPU 则占据了 28.6%,Google 在 AI 领域的硬件优势也十分显著。强大的硬件则为公司大模型和各种端侧模型设备提供了良好的算力支撑,进一步 奠定了 Google 打造 AI 应用全家桶的坚实基础,形成数据-算力-模型-场景的正向循环。

Gemini 2.5 pro 的发布正式标志着 Google 在 AI模型竞赛中取得了实现后进者超越的成效。Gemini 2.5 Pro 是 Google Gemini 2.5 系列模型的专业版,于 2025 年 3 月首次发布,并在 2025 I/O 大会发布升级版本。Gemini 2.5 pro 编程能力强大,在测试中优于领域标杆 Claude 3.7 Sonnet,在 Mensa Norway 的 IQ 测试中突破 130,同时具有很高的性价比。

在升级版本中,Gemini 2.5 pro 新增“Deep Think”模式,推理能力大幅提升,通过并行探索多种假设并交 叉验证,在 USAMD 2025、LiveCodeBench、MMMU 等模型基准测试中均位列第一,全方面超过 OpenAI 的 o3 和 o4-Mini。Gemini 2.5 Pro 在多模态处理方面也取得了显著进展,能够无缝集成分析视频、音频、图像、文字 和代码等多种数据格式,VideoMME 基准测试中得分高达 84.8%,能够处理长达 6 小时的视频内容,优于同类 模型。此外,Gemini 2.5 Pro 的编程与开发能力增强,模型可将描述性语言直接转化为可运行的代码,并进一步 提升了处理复杂的前端开发任务的能力。

Gemini 2.5 Flash 于 2025 年 4 月发布,定位是“提供强大性能的同时注重效率”的推理模型。Google 计划从第三季度开始,将 2.5 Flash 模型引入本地部署环境。Gemini 2.5 成本优势极高,在 Aider polyglot 编程基准测 试中成本仅次于 DeepSeek。端侧模型方面,Google 基于 Gemini 2.0 开源发布本地化轻量级模型 Gemma 3(包括 1B、4B、12B、27B 版本),在预训练和后训练过程中,Gemma 3 使用了蒸馏技术与强化学习进行了优化,是谷 歌迄今最先进、最便携的开源模型,专为端侧设备本地化部署、运行而设计,完全可以在 3090 GPU 的消费级设 备上运行。

1.2.4 xAI

xAI 由埃隆·马斯克(Elon Musk)于 2023 年 7 月正式创立,汇集了来自 OpenAI、Google、微软研究院等顶 尖机构的资深研究员和工程师。公司的目标是“理解宇宙的真实本质”,致力于探索通用人工智能。马斯克本人 深度参与公司的战略方向和技术研发,并强调 xAI 将与他的其他公司 X、特斯拉等产生紧密协同效应。2024 年, xAI 宣布完成了 60 亿美元的 B 轮融资,估值达到 240 亿美元,并计划建造一台巨型超级计算机“算力超级工厂” (Gigafactory of Compute)来支持其未来更大规模模型的训练。 xAI 推出的首个大模型名为 Grok,其显著特点是能够通过 X 平台实时访问信息,从而提供比其他模型更新、 更具时效性的回答。Grok 模型的迭代速度非常快,Grok-1 于 2023 年 11 月首次发布,并于 2024 年 3 月开源; Grok-1.5 于 2024 年 3 月发布;Grok-2 于 2024 年 8 月发布并引入图像生成;Grok-3 于 2025 年 2 月发布,同时 引入深度推理和深度搜索功能。 2025 年 7 月,xAI公司发布其最新一代大模型 Grok-4,引发行业高度关注。Grok-4 的目标是在所有学术领 域达到或超越博士级别的智能水平,标志着大模型竞赛的焦点,正从提升信息整合与文本生成能力,转向攻克 更高维度的复杂推理与原创性问题解决能力。Grok-4 的发布,进一步加剧了与 OpenAI、Google 等头部厂商在 顶尖性能模型上的竞争。 xAI构建“巨像”超级计算机对 Grok4 进行训练,搭载超过 20 万块英伟达 H100 GPU,为模型的复杂训练 与高强度推理提供了强大的算力保障。Grok 4 在 HLE(Humanities Last Exam)中的成绩达到 50.7%。远高于目 前的任何模型。Grok-4 标准版定价为每月 30 美元,同时提供算力更强的 Grok-4 Heavy 版本,定价为每月 300 美元,显示出明确的性能分层与商业化路径。

1.2.5 Meta

Meta(原 Facebook)由马克·扎克伯格领导,旗下的人工智能研究部门 FAIR (Fundamental AI Research) 长 期以来在 AI 领域享有盛誉。Meta 的核心 AI 战略是“开源”,致力于通过开放模型和工具来推动整个社区的创 新和发展,并以此构建自身的生态系统。 Llama 系列模型 Meta AI 战略的核心。从 2023 年发布的 Llama 2 到 2024 年功能更强大的 Llama 3,Meta 始 终免费提供给研究和商业使用,极大地降低了全球开发者和企业使用先进大模型的门槛,催生了无数创新应用。 Llama 3 在性能上已达到甚至超越了部分顶尖的闭源模型。 2025 年 4 月,Meta 开源最新系列模型 Llama 4,包括 Llama 4 Scout、Llama 4 Maverick 和 Llama 4 Behemoth。Llama 4 在多个 benchmark 上的表现非常出色,其性能在多个关键指标上均优于 Llama 3 和其他主流 模型。该模型采用混合专家(MoE)架构,具有原生多模态能力,能够处理和整合多种类型的数据。 Meta 团队提出 LCM(Large Concept Models):Meta FAIR 团队发表文章,提出在概念级别而非 token 级别构 造语言模型。在论文中提出了几种不同的架构,其中也有借鉴 Diffusion Models 的部分。将文本分割为概念(句 子)后,能大大缩短序列长度,缓解计算负担,且这工作方式更接近人类认知模式。

1.3 国内基础大模型发展趋势及技术展望

1.3.1 中美差距不断缩小,国产模型百花齐放

从全球视角来看,中美处于大模型研发领导地位,两国大模型发布数量也在不断增加。从地理分布上看, 全球已经形成人工智能的“两极格局”,且未来这一格局仍将长期保持。至 2024 年,两国自研大模型数量占全球 80%以上,中国大模型数量已经接近 100 款。目前,两国大模型性能迭代速度齐平。中美大模型在性能迭代上呈 现出交替追赶态势。中国大模型应用广泛落地,具有显著的比较优势,AI 产品占据全球市场半壁江山。公司角 度,国内大厂已有多家跻身大模型前十,大厂的技术与资本实力是中国 AI 发展的重要支撑。另一方面,以 DeepSeek 为代表的新势力也在强势参与竞争。

聚焦中美两国,中美 AI实力的差距正不断缩小,OpenAI一枝独秀的优势已开始受到各方冲击。根据斯坦 福以人为本人工智能研究所(Human-Centered Artificial Intelligence, HAI,领导者为李飞飞)发布《2025 年人工 智能指数报告》,2024 年结束后,中美顶级 AI 模型的能力(多项基准测试得分加权平均)差距已由前一年的 20% 缩小至 0.3%。从企业角度来看,美国仍保持较明显的领先优势。2024 年全球知名模型中,有 40 个来自美国, 而中国只有 15 个。中国视角来看,DeepSeek-R1 迈出了中国 AI 全面追赶美国的关键一步。DeepSeek-R1 通过 架构创新、软件优化及前沿方法,在推理能力上逼近国际顶尖水平,且训练成本大幅降低。其开源策略为本土 AI 发展提供了技术参考,缩小了与美国的技术差距。

DeepSeek-R1 的发布加剧了中美 AI竞争的激烈程度,全球 AI格局向更激烈的“两极竞争”方向发展。根据 《2025 年人工智能指数报告》,中国等亚洲国家对人工智能表现出较高的兴奋度,信心优势显著。全面竞争的格 局或导致未来中美 AI 产业路径分道扬镳。算力禁售的约束仍在加强, 而国产芯片自主可控需要长周期的解决。 伴随着 Agent/MCP 的繁荣与应用的增多,未来国内 AI 发展或将走上具有本土特色的 AGI 之路:不再堆砌算力, 而是寻求模型的“性价比 Scaling”;并通过大量 Agent 应用获取“经验数据”,相互高效传导(如 MCP)进而实现 AI 能力跃迁和泛化。

自 DeepSeek 发布以来,中美竞争进入全方位、白热化的全新阶段,美国基本已形成自上而下的技术封锁 体系。OpenAI 公开呼吁美国政府立法禁止 DeepSeek,同时给予 AI 公司豁免权。Anthropic 强调美国应该加强出 口管制,包括控制 H20 等高端芯片出口中国、加强对二级国家的芯片流通监管审查,等等,以此巩固并扩大美 国的领先优势。美国总统特朗普也于 1 月签署总统行政命令 14179,通过降低国内 AI 产业监管、调整出口管制 战略方向等措施减缓中国模型技术创新的快速发展,拖慢中国自主可控的节奏,以此消除美国在 AI 领域领导地 位的障碍。在这场人工智能科技革命中,美国对中国的制裁可以总结为以算力芯片贸易、算力芯片制造、A I 模 型开发三个方面“三位一体”的限制。同时美国制裁也是一个动态的、不断更新的系统,在持续的博弈中不断 调整和升级。美国的精准制裁无疑给中国 AI 产业带来了严峻的挑战,尤其是在短期内面临着高端算力短缺和 先进制程工艺“卡脖子”的困境。然而,从长远看,这种外部压力也正以前所未有的力度,倒逼中国加速构建自 主可控的 AI 技术体系。从芯片设计、制造到软件框架、应用生态,中国正走上一条“全栈自研”的道路。中国视 角来看,DeepSeek-R1 迈出了中国 AI 全面追赶美国的关键一步。DeepSeek-R1 通过架构创新、软件优化及前沿方法,在推理能力上逼近国际顶尖水平,且训练成本大幅降低。其开源策略为本土 AI 发展提供了技术参考,缩 小了与美国的技术差距,如今豆包 Seed1.6、阿里通义千问、Kimi K2 等国产模型呈现百花齐放局面,并且开源 的 Kimi K2 再次体现国产模型更高效的特点。从大模型的技术本质与人才储备来看,中国的大模型企业的能力 并不落后,2025 年是世界认知中国人工智能潜力的第一年,未来有望走出国门走向世界。

回到国内,2023 年至今,国内外大模型能力持续发展,目前依旧呈现百花齐放的态势。国内模型经历了一 年多的迭代周期后,与 OpenAI 的差距从 2023 年 5 月的 30.12%,缩小至 2024 年 8 月的 1.29%。DeepSeek R1、 Qwen 系列、豆包、MiniMax 等模型相继发布,模型能力滚动提升。2025 年“人工智能+”被写入政府工作报告, 未来中国大模型行业或将呈现以下趋势:一是技术创新加速,聚焦多模态、具身智能等前沿领域;二是应用场景深化,垂直行业渗透(如医疗、制造)与消费级终端(AI 手机、智能汽车)齐头并进,API 调用量爆发式增 长;三是生态构建起步,通过开源开放降低门槛。

1.3.2 DeepSeek

DeepSeek(深度求索)是一家专注于通用人工智能的中国初创公司,创始人为梁文锋,由私募股权巨头幻 方量化(High-Flyer Quant)支持创立。公司自成立以来便秉持“技术驱动”的理念,低调而务实地在底层技术 上进行深耕。DeepSeek 的核心团队在高性能计算、模型架构和数据处理方面拥有深厚积累,这使其在模型训练 效率和性能优化上具备显著优势。

DeepSeek-R1 在全球范围形成有力竞争。2025 年 1 月,深度求索 Deepseek 发布 R1 模型。模型在推理任务上表现出色,取得了与 OpenAI o1 相媲美的成绩。在知识密集型任务基准测试中,性能显著超越了 DeepSeek V3 基础模型,同时在开放式问答领域也展现出了强大能力。DeepSeek R1 在长 CoT 数据微调基础上应用强化学习, 除性能提升外,DeepSeek R1 采用 GRPO 强化学习策略,专门优化数学推理任务,减少计算资源消耗,实现更 低的成本。此外,DeepSeek R1 能够通过蒸馏将 R1 的推理能力迁移到更小的模型中,经过 R1 蒸馏的小模型, 在推理能力上得到了显著提升。推理成本来看,R1 模型价格只有 OpenAI o1 模型的几十分之一,具有极高的性 价比优势。

DeepSeek V3 是 R1 的基底模型,由深度求索公司于 2024 年 12 月推出,是一款自研混合专家(MoE)模 型,目前已开源。该模型拥有 6710 亿参数,激活参数 370 亿,并在 14.8 万亿 token 上进行了预训练,DeepSeek - V3 还率先采用了无辅助损失的负载均衡策略,并设置了多令牌预测训练目标,以增强模型性能。模型 AP I 服务 定价为每百万输入 tokens0.5 元(缓存命中)/2 元(缓存未命中),每百万输出 tokens8 元。3 月,DeepSeek -V3- 0324 更新版本公布,新版 V3 模型借鉴 DeepSeek-R1 模型训练过程中所使用的强化学习技术,大幅提高了在推 理类任务上的表现水平,相较于第一代 V3,基准测试的准确率最高提升了近 20%。在数学、代码类相关评测集 上取得了超过 GPT-4.5 的得分成绩。

DeepSeek 近期发布一系列技术进展,不断压实 R2 发布预期。2025 年 4 月,DeepSeek 团队联合清华大学 发表论文,提出 DeepSeek-GRM-27B,运用“自我原则点评调优(SPCT)”的学习方法,增加了推理阶段的计算 资源,实现了推理优化,显著提升模型性能。DeepSeek 同期开源发布 DeepSeek-Prover-V2,参数规模分别为 7B 和 671B,是一款专为数学/编程打造的模型,通过递归+强化学习的模式大幅增强了数学推理能力。DeepSeekProver-V2 的技术亮点有两个,一是通过递归证明搜索方法生成冷启动推理数据,利用 DeepSeek-V3 作为统一工 具进行子目标分解;二是基于冷启动数据进行强化学习,采用 GRPO(同样用于 DeepSeek-R1)的强化学习算法。

1.3.3 阿里千问

Qwen 3 占据全球开源模型领先地位。2025 年 4 月,阿里发布开源 Qwen3,训练过程为:在 36 万亿 token 上进行三阶段预训练,之后通过长 CoT 冷启动、RL、思维模式融合等方式进行后训练。全球开发者、研究机 构和企业均可免费在 HuggingFace 等平台下载模型并商用。Qwen3 系列模型包含两款 MoE模型以及六款密集模 型,其中较大的三款模型也已经上线了 Qwen Chat 网页版和手机 App。 性能方面,在代码、数学、通用能力等基准测试中,旗舰模型 Qwen3-235B-A22B 与 DeepSeek-R1、o1、o 3- mini、Grok-3 和 Gemini-2.5-Pro 等主流模型表现相当。小型 MoE 模型 Qwen3-30B-A3B 比 QwQ-32B 表现更优, 实现“以小博大”。模型核心亮点有以下几方面:①支持思考/非思考模式,使用户能够根据具体任务实现精准高效的回答;②多语言能力,Qwen3 模型支持 119 种语言和方言;③Agent 能力,Qwen3 模型的 Agent 和代码能 力得到增强,同时加强了对 MCP 的支持。

2024 年 09 月,阿里发布 Qwen2.5 系列,以及专门针对编程的 Qwen2.5-Coder 和数学的 Qwen2.5-Math 模型。Qwen2.5 所有系列模型都在 18Ttokens 的数据集上进行了预训练,在编程和数学方面有了大幅提升。 Qwen2.5-1M 在处理长文本任务表现出色。全新的视觉开源模型 Qwen2.5-VL-72B 在 13 项权威评测中夺得视觉 理解冠军。大规模 MoE模型 Qwen2.5-Max 使用精选的监督微调 SFT 和从人类反馈中强化学习 RLHF 方法进行 了进一步的后训练,性能全面超越 DeepSeek V3。 2025 年 3 月,阿里开源发布新推理模型 QwQ-32B,性能比肩 DeepSeek-R1 671B 满血版,并发现大规模 RL Scaling 能够实现与超大型 MoE模型媲美的性能。同月底,通义团队又发布并开源首个端到端全模态大模 型 Qwen2.5-Omni-7B,采用首创全新 Thinker-Talker 双核架构,未来或在国行 IOS 系统上搭载。目前,阿里通 义团队已累计开源 200 多款模型,Qwen 已经稳居全球最大规模 AI 大模型族群。未来还将持续拓展多模态能 力边界,发展全面的通用模型。

1.3.4 腾讯混元

腾讯混元大模型(Tencent Hunyuan)由腾讯公司全链路自研,其 API支持 AI搜索联网插件,通过整合腾 讯优质的内容生态,提供强大的时新、深度内容获取和 AI问答能力。涵盖混元生文、混元多模态、混元生 图、混元生视频、腾讯元器等工具,其全矩阵产品对大模型加速落地具体应用场景起到了非常重要的促进作 用。 以 AI助手腾讯元宝为例,2025 年 2 月,腾讯宣布元宝搭载混元+DeepSeek 双模型引擎免费向用户开放, 实现“稳定+深度思考”的双重突破。腾讯元宝借助腾讯生态优势强势入场,新增用户量一度领先国内一众 APP。其核心亮点包括:①双模型(混元与 DeepSeek R1)自由切换;②联网搜索+腾讯生态内容,提升回答准 确性 30%以上;③网页、APP、微信搜索三端同步开放,实现“搜索即 AI”。

2025 年 3 月,腾讯发布混元-T1 正式版。T1 是腾讯自研的强推理模型,基于业界首个超大规模 Hybrid Transformer Mamba MoE 大模型 TurboS 快思考基座,在实际生成效果表现中远快于 DeepSeek-R1,且输出价格 更具优势。腾讯在如微信、元宝、腾讯云、QQ、微信读书、腾讯新闻等内部业务场景均已接入大模型能力, 未来将全面赋能腾讯 APP 生态。 Mamba 是一种状态空间模型(SSM)——该架构的一大显著优势是能高效地捕获序列数据中的复杂依赖关 系,高效处理长序列数据,并由此成为 Transformer 的一大强劲对手。经典 SSM 可被视为循环神经网络 (RNN)和卷积神经网络(CNN)的融合模型。Hybrid-Mamba-Transformer 融合架构有效降低了传统 Transformer 架 构的计算复杂度,减少了 KV-Cache 的内存占用,从而显著降低了训练和推理成本。

1.3.5 字节豆包

豆包是字节跳动公司自主研发的多模态 AI平台。豆包大模型 1.6(Doubao-Seed-1.6)其最新版本,由 doubao-seed-1.6、doubao-seed-1.6-thinking、doubao-seed-1.6-flash 三款模型组成。模型具备 256k 长上下文窗 口,最大输入长度可达 224k tokens,输出长度支持最大 16k tokens。豆包 1.6 支持深度推理、深度研究、多模 态(包括视频生成)、GUI 操作等能力,初步实现了 AI 功能”All in one”的效果。模型在多个权威测评中表现优 异,推理和数学能力显著提升。

作为豆包 1.6 中的推理模型,Seed1.6-Thinking 总体延续 Seed1.5-Thinking 的训练方法,训练过程中采用了 多阶段的 RFT 和 RL 迭代优化以提升模型推理能力。根据字节推理模型 Seed1.6-Thinking 技术报告,Seed1.6- Thinking 在 Seed1.5-Thinking 的基础上拓展了训练算力,加大了高质量训练数据规模,提升了模型在复杂问题上 的思考长度,并且在模型能力维度上深度融合了 VLM,给模型带来清晰的视觉理解能力。Seed1.6-Thinking 在 复杂文本场景中的推理能力明显提升,同时也具备了较好的视觉推理能力。

Seed1.6 提出“动态思考能力”,提供全思考、不思考、自适应思考三种推理模式,在保证效果的同时大幅 压缩 CoT 长度。具备多模态动态思考能力的模型可以通过 prompt 设置让模型在推理过程中处于三种推理模式。 此外,豆包 1.6 在高考测试中也展现出了良好的推理能力,理科水平突出,可与 Gemini-2.5 pro 相媲美。

1.3.6 MiniMax

MiniMax 开源 MiniMax-M1,在多个基准测试上表现可比或超越 DeepSeek-R1、Qwen3 等标杆开源模型, 在工具使用和部分软件工程等复杂任务上甚至超越了 OpenAI o3 和 Claude 4 Opus。MiniMax-M1 原生支持 100 万 token 的输入长度,是 DeepSeek R1 的约 8 倍。同时支持 8 万输出 token,超过 Gemini 2.5 Pro 的 6.4 万,成为 世界最长输出。生成 10 万 token 时,推理算力只需要 DeepSeek R1 的 25%。MiniMax-M1 采用 Lightning Attention 机制的混合注意力架构,Lightning Attention 把注意力计算分成块内和块间两部分,块内用传统注意力计算,块 间用线性注意力的核技巧。采用全新的 CISPO 算法,在长推理中表现良好。 MiniMax 发布其通用智能体产品——MiniMax Agent,MiniMax Agent 不仅能编写包含复杂组件和跳转逻 辑的网页、网页游戏,更与众不同的是,还能通过模拟用户操作进行全面的自动化测试。MiniMax Agent 内置了 稀宇科技自研 MCP,以强化其多模态输出能力。同时也集成了 Google Maps、Github/Gitlab、Slack、Fig ma 等常 用的工具。

1.3.7 智谱 GLM

2025 年 1 月,智谱发布新一代旗舰级模型 GLM-4V-Plus-0111,定位为“可执行的专业级视觉大脑”。该模 型采用原生可变分辨率技术,支持处理长达 2 小时的视频内容,在 MVBench 等权威评测榜单中综合性能位居榜 首。核心技术亮点包括多模态长思维链训练、教育医疗等行业知识深度融合、实时交互能力等。 智谱在 2025 年 7 月 2 日生态大会上发布新一代通用视觉语言大模型 GLM-4.1V-Thinking,以“小参数、 强推理、跨模态”为核心突破,标志着多模态模型从“感知”向“认知”的关键跃迁。其核心技术在于①引入思 维链推理(Chain-of-Thought Reasoning),支持多步逻辑拆解,提升数学等领域的逻辑推理能力;②创新课程采 样强化学习(RLCS),提升模型的时序因果推理稳定性。

1.3.8 月之暗面 Kimi

2025 年 1 月,月之暗面推出 Kimi 全新 K1.5 多模态思考模型,其实现了 SOTA 级别的多模态推理和通用 推理能力。官方表示,在 short-CoT 模式下,Kimi k1.5 的数学、代码、视觉多模态和通用能力大幅超越了全球 范围内短思考 SOTA 模型 GPT-4o 和 Claude3.5 Sonnet 的水平,领先达到 550%。Kimi k1.5 的开发包括几个阶段:预训练,原始监督微调(SFT),长 CoT 监督微调和强化学习(RL)。k1.5 的设计和训练有几个关键要素:长 上下文缩放、改进政策优化、简单化框架、多模态。其中长上下文扩展和改进的策略优化方法是其关键组成部 分。

月之暗面开源万亿模型 Kimi K2,刷新开源模型上限。2025 年 7 月 11 日,月之暗面正式发布并全面开源 其最新一代大模型 Kimi K2。Kimi K2 以 MoE架构为核心,主攻代码生成和通用 Agent 两大前沿方向。通过上 线即开源的策略,Kimi K2 抢占了开源模型性能制高点,并加速 AI 从“聊天伴侣”向“全能工作助理”的演进。 Kimi K2 刷新开源模型上限,再次提振资本市场对于国产大模型的信心。Kimi K2 总参数量高达 1 万亿(1T), 单次推理仅激活 320 亿(32B)参数的 MoE模型。这种先进的架构使其能够在拥有海量知识的同时,大幅降低 实际推理成本,是当前业界公认的突破“不可能三角”(成本、性能、速度)的关键技术方向,实现了“大而精, 大而快”。性能测试登顶多个权威基准,代码与 Agent 能力领跑开源。Kimi K2 在多个高难度基准测试中表现极 为出色,直接对标全球顶尖模型。

1.3.9 昆仑万维天工

天工大模型是昆仑万维自主研发的大语言模型系列,最新代模型 Skywork-OR1 系列于 2025 年 4 月开源。 OR1 聚焦逻辑理解与复杂任务求解,是当前同参数规模下推理性能领先的开源模型。模型经过多段 GRP O 强化 学习训练、动态熵控制采样、数据混合验证等手段,保证了推理的准确性和高效性。模型包括 Skywork-OR1-Math7B(数学专项模型)、Skywork-OR1-7B-Preview(通用模型)、Skywork-OR1-32B-Preview(旗舰版本)。公司计划在 2025 年内推出更强大的推理模型正式版本,并探索多模态与具身智能的融合。

1.3.10 百度文心

2025 年 4 月,百度发布文心大模型 4.5 Turbo、文心大模型 X1 Turbo,围绕“多模态、强推理、低成本” 三大核心特性展开,API 调用成本仅为 DeepSeek-R1 的 25%。文心 4.5Turbo 高效继承文心 4.5 的文本和多模态 能力,同时显著降低训练和推理成本,多模态能力与 GPT 4.1 持平,文本能力与 DeepSeek V3 最新版持平。主 要技术创新包括:①复合思维链架构融合了工具调用与逻辑推理,支持 50 步以上复杂操作流程;②多模态流式 分块预填充,提升多模态数据解析速度 8 倍以上。

1.3.11 讯飞星火

2025 年 3 月,科大讯飞正式发布了其升级版深度推理大模型——星火 X1。这一新版不仅在算法与架构上 进行了全面优化,其数学能力的表现甚至对标了业界领军者 DeepSeek R1 及 OpenAI 的最新模型。讯飞星火 X1 在近期参加的小初高(含竞赛)、大学(含竞赛)、AIME、MATH 500 等多项“考试”中成绩十分亮眼,用更 少的算力,实现了业界一流的效果,多项指标国内第一。在医疗领域,讯飞星火 X1 的模型策略也已取得初步验 证成效。

1.3.12 中国移动九天

2025 年 3 月,中国移动推出九天深度思考大模型,专注于解决建设项目审计、智能通信等复杂行业问题。 该模型采用跨领域知识融合策略,结合工程审计语料库与通用数据,实现专业场景与自然语言的无缝切换。九 天大模型核心能力包括慢思考迭代、多模态协同推理、端侧低时延部署运行等。

1.3.12 中国移动九天

2025 年 3 月,中国移动推出九天深度思考大模型,专注于解决建设项目审计、智能通信等复杂行业问题。 该模型采用跨领域知识融合策略,结合工程审计语料库与通用数据,实现专业场景与自然语言的无缝切换。九 天大模型核心能力包括慢思考迭代、多模态协同推理、端侧低时延部署运行等。

1.3.14 华为盘古

2025 年 5 月,华为发布盘古 5.5,参数规模达 718B,支持 128k 长序列处理与复杂科学计算,全程基于华 为昇腾 AI 计算平台完成训练,实现了 AI 基础设施与大模型协同突破。技术突破包括:NLP 模型集群架构升 级,盘古 5.5 通过 Ultra/Pro MoE 双模型架构与自适应推理技术,可实现每秒上千 token 吞吐量(800I A2 上可达 1529 token/s),领先同规模业界模型 15%以上。 模型架构方面,盘古团队在MoE模型训练推出参数规模高达718B的准万亿全新模型 ——Pangu Ultra MoE, 以实现超大规模 MoE 架构在模型效果与效率之间的最佳平衡。Pangu Ultra MoE 是一个超大规模、高稀疏比的 架构,采用 256 个路由专家,每个 token 激活 8 个专家。引入 MLA 多头注意力机制,缓解推理阶段内存带宽瓶 颈。同时采用单头 MTP、Dropless、RL等训练技术,全面提升推理效率与性能。

1.3.15 阶跃星辰

2025 年 1 月,阶跃星辰发布 Step 1o、Step R-mini 等模型。其中 Step 1o 为多模态模型,其视觉推理版本 Step-1o Vision 较前一代进行了架构升级,在视觉识别、感知、指令跟随、推理等核心能力上都有大幅提升,模 型不仅能看懂图片,还能基于图像内容进行深度思考和推理。Step-R mini 为推理模型,在 AIME 和 Math 等数 学基准测试上,它的成绩超过了 o1-preview,比肩 OpenAI o1-mini。

1.3.16 百川智能

2025 年 1 月,百川发布首个全场景深度思考模型 Baichuan-M1-preview,同时具备语言推理、视觉推理、 搜索推理三个维度的全面推理能力。Baichuan-M1-preview 在数学能力、代码任务上,成绩超越了 o1-previe w。 视觉推理能力方面超越了 GPT-4o、Claude3.5 Sonnet、QVQ-72B-Preview 等模型。百川智能同时开源医疗增强通 用大模型 Baichuan-M1-14B。作为行业首个通用模型,Baichuan-M1-14B 的表现优异,在多个权威医学知识和临 床能力评测上的成绩超越了 Qwen2.5-72B-Instruct。

1.3.17 Vidu AI

2025 年 1 月,Vidu 2.0 上线,Vidu 是北京生数科技有限公司联合清华大学发布的中国首个长时长、高一致 性、高动态性视频大模型。包括文生视频、图生视频和参考生视频。Vidu 2.0 集成了价格、速度、质量优势的“不 可能三角”,其生成 1 秒 512P 单片段视频时间在 2.5 秒内,模型生成单秒 720p 视频仅需 0.26 元。

1.3.18 快手可灵

2025 年 4 月,可灵大模型 2.0 正式发布。可灵 2.0 模型在动态质量、语义响应、画面美学等维度,保持全 球领先,在文生视频领域,可灵 2.0 对比谷歌 Veo2 的胜负比为 205%,对比 Sora 的胜负比达 367%,在文字相 关性、画面质量、动态质量等维度上显著超越对手。Artificial Analysis 发布最新的全球视频生成大模型榜单中, 快手可灵 1.6pro(高品质模式)登陆图生视频赛道榜首。可灵 AI 的全新交互理念 Multi-modal Visual Language 让用户能够结合图像参考、视频片段等多模态信息,将脑海中包含身份、外观、风格、场景、动作、表情、运镜 在内的多维度复杂创意,直接高效地传达给 AI。

1.3.19 面壁智能 MiniCPM-V

2025 年 7 月,面壁智能在 nature 子刊发布端侧新模型 MiniCPM-V 系列,包括 MiniCPM-V 1.0、MiniCPMV 2.0 和 MiniCPM-Llama3-V 2.5。MiniCPM-V仅用 8B 参数就实现了 GPT-4V 级别的多模态能力,在基准测试 中全面超越 GPT-4V、Gemini Pro 和 Claude 3 等头部模型,让手机端也能运行媲美云端的多模态大模型。得益 于部署优化技术,MiniCPM-Llama3-V 2.5 可以在手机和个人电脑上高效运行,提供可接受的延迟和吞吐量。

1.4 多模态大模型发展趋势及技术展望

1.4.1 多模态模型密集迭代,架构创新与效果提升双轮驱动

多模态模型支持图像、音频、视频等多种模态的输入与输出。LLM 大模型极大地推动了通用人工智能的发 展进程,然而为了将大模型应用于更广泛的场景,就需要模型能够理解文字语言之外的信息,包括图像、视频、 音频等多种模态,因此多模态模型应运而生。通过输入端扩展使其理解多模态内容,通过输出空间扩展使其生 成多模态回复,最终支持多模态信息交互。从分类上看,多模态模型既包括 GPT-4o、Gemini、豆包 1.6 等同时 支持文字、图片、视频多种模态输入和输出的模型,也包括快手可灵、Sora 等聚焦视频/图像/音频单一种内容的 模型。 多模态模型的演进经历了三大阶段: 1)任务导向阶段:早期的多模态模型大多是为特定任务场景设计的,如视觉问答(VQA)、图像描述(Image Captioning)和图文检索(Image-Text Retrieval)等。每个任务通常需要专门的形式和数据集进行定义。主流的模 型架构也根据对应的任务进行设计,因此通用性较差、跨任务应用中表现不佳、迁移成本高。 2)视觉-语言预训练阶段:为提升模型的通用适配能力,研究者引入类 BERT 自监督预训练方法,通过在 大规模图文对(Image-Text Pair)数据上执行自监督学习,使模型习得可迁移的多模态表示,该表示可直接应用 于多项下游任务。此方法虽拓展了模型对不同任务场景的适应范围,但仍需针对特定任务引入专属参数进行微 调,尚未实现真正意义上的零样本应用能力。 3)多模态大模型阶段:受大语言模型的启发,研究者们希望利用语言作为用户与模型的统一交互工具,通 过将不同模态的信息与语言对齐,使得模型能够在零样本场景中理解多模态信息并生成响应,显著提升通用性 与交互性。

普通的多模态模型通过不同模块,进行多模态数据处理,从而导致数据输入和输出的延迟较大。以 GPT-4的语音模式为例,首先一个专门模型将用户的语音转录成文本;然后使用文本模型生成回复;最后再用语音生 成模型将生成的文本回复转换成语音输出。这种处理方式,使音调、不同说话者的声音或背景噪音等重要语音 特征无法被直接处理。 原生多模态模型将语音、图像、视频和文字融合至统一的表征框架下,统一进行理解和推理,较好地解决 了上述痛点。原生多模态大模型集成多种类型数据的处理能力,通常在输入层进行数据融合后,使用共享或专 用的编码器处理不同模态的数据。Gemini 和 GPT-4o 均为主流原生多模态模型,其中 GPT-4o 能一定程度捕捉说 话者语音语调和语气,并通过视觉能力识别人的面部表情和情绪,增加人机对话的沉浸感。

除了原生多模态模型以外,当前关注度高的还有视频生成模型。视频是用户消费时间最长的内容形式,据 Questmobile,2017-2022 年全球视频流量占互联网网络流量的比例已从 73%上升至 82%,叠加视频制作时间长、 成本高,因此 AI 视频一直以来都是 AI 发展的重要方向。2014-2023 年视觉生成式技术框架逐渐从生成对抗网 络(GAN)向扩散模型(Diffusion Model)过渡。23 年已出现 Pika、Runway 等明星产品,主要基于扩散模型, 但生成时长仅 3-5 秒、人物动作幅度较慢,难以满足日常使用需求,主要是因为过去视觉生成主要采用基于卷 积神经网络 U-Net 的扩散模型,随着参数量的提升,此架构的效果提升会显著放缓甚至消失。 24 年初 Sora 验证了 DiT 架构在视频生成方面的可行性,驱动视频生成的质量和时长实现跃升,主要是因 为基于 Transformer 架构的扩散模型展现出了更好的扩展性,有助于进一步提升模型的生成质量及效率。后续国 内公司普遍沿用 Sora 的技术路径,在 DiT 架构上进行微创新来研发视频生成模型。24 年下半年以来国内一批 AI 视频产品已经在可用度和性价比等方面赶超海外,如快手可灵、Minimax 海螺 AI、字节即梦等。

我们从不同维度对比国产 AI视频与海外模型的效果: 1)视频尺寸——国产产品也能支持多种尺寸:Sora 采用时空补片技术(Spacetime latent patches),将不同 时长、宽高比和分辨率的视频、图片数据,转换为格式统一的时空补片后,再用于模型训练,使得 Sora 生成的 视频支持任意宽高比、分辨率和时长。目前快手可灵、Minimax 海螺、字节 Seedance 等国内主流产品同样支持 多种视频尺寸。 2)视频时长——国产产品最长突破 2 分钟,部分产品以推理速度快作为竞争优势。Sora 支持生成 60 秒视 频,远高于同期 Pika、Runway 的 3-5 秒。可灵将视频时长拓展至 2 分钟(目前实际开放 5s/10s 两种规格),在 国内产品中排名首位。部分产品虽然视频生成时长也在 10 秒以内,但其着重提高推理速度。目前主流生成 5s 视 频大约需要 5 分钟,智谱清影和生数科技 Vidu 则将该时长缩短至 30 秒。 3)视频效果——国产产品整体接近 Sora,细节处理略有差距。Sora 物理性强,能创造出带有动态视角变 化的视频,让人物和场景元素在三维空间中进行连续移动,并模拟出影响世界状态的简单行为。此后国产视频 模型同样着眼于视频的动态性和物理性,视频效果显著提升。25 年 3 月以来国产视频模型屡登顶 Artificia l Analysis 全球视频模型榜单,超越 Sora 和谷歌 Veo,具体包括可灵 1.6、可灵 2.0 和字节 Seedance 1.0 Pro。 4)使用门槛——国产产品使用方式多样、价格低。目前 Sora、Runway、谷歌 Veo 等海外模型主要通过网 页版使用,使用场景受限制。而快手可灵、字节 Seedance 1.0 均支持网页版、移动端 App 等多端使用,且不同 端的数据互通,使用便捷度更高。价格方面,国产模型生成 5 秒视频的最低价已经下降至 0.5 元,可灵和字节 Seedance 生成 5 秒视频的价格覆盖 1-10 元、0.5-3.7 元,可以满足普通休闲娱乐、短视频生成、广告营销、专业 级影视内容生成等不同垂类场景需求。而 Sora、Runway Gen3 生成 5 秒视频的最低价格为 3 元左右。

今年以来多模态模型的更新迭代显著加速。据我们的不完全统计,25 年上半年全球有超 30 款多模态模型 更新或发布,其中超 75%为国产模型。新模型包括视频、图像、音频等几乎所有多模态,除了整体的生成效果 提升以外,部分产品还在指令遵循能力、特效能力、效果逼真度等多维度取得较好进展。具体来看: 1)视频模型:整体生成效果提升,注重细节还原和主体一致性。既推出低参数版本,降低算力需求和门槛 (阿里万相 2.1 可以在消费级显卡中运行),也引入视频剪辑、视频特效等新功能,增加视频模型的实用性。 2)图像模型:包括 GPT-4o、即梦 3.0 等,核心进展主要体现在两大方面,一是指令遵循能力、特效能力、 效果逼真度等多维度取得较好进展。二是效果好、图像逼真,基本不用人工修改。 3)音频模型:Minimax、豆包等均推出新的语音模型,可自由组合多种语言、口音、音色,并支持方言、 情绪效果、特殊音效等。目前已经可以基于文章生成逻辑性强、互动性与趣味性兼具的完整播客。

1.4.2 AI 视频应用场景

AI 视频有望率先落地 C 端社交娱乐、中短视频内容创作和专业级影视创作三大场景。在 C 端社交娱乐场 景,用户对娱乐类 AI 多模态需求显著,AI 视频生成玩法有望融入社交平台。Meta 计划 2025 年将 AI 视频能力 集成至 Instagram等社交应用,国内快手已积极在平台内推广 AI 短视频,提供 AI 玩法的模仿与二创增加平台活 跃度。在中短视频内容创作场景,未来有望重构短视频创作工作流,并向 AI 短视频社区迭代,打造 AI 时代的 抖音和快手。在专业级影视创作场景,行业对 AI 工具需求旺盛,头部视频模型已积极与影视行业展开合作,如 Runway 与狮门影业合作构建 AI 视频生成和编辑模型,可灵启动 AI 导演共创计划等,推动 AI 渗透影视制作全 流程。

场景一:C 端社交娱乐。去年至今出圈的妙鸭相机、Remini 粘土特效、对嘴型唱歌等 AI 玩法,均验证用户 对娱乐类 AI 多模态场景的高需求。对于普通用户而言,视频剪辑和生成都不是高频功能,且现有视频模型对 prompt 的要求仍比较高,因此 C 端玩法需要聚焦具体、高频、刚需的社交娱乐场景。

在视频生成方面,AI视频特效玩法已多次出圈。24 年 Pika 和 PixVerse 先后通过“AI 捏捏”特效和毒液特 效出圈,其中毒液特效视频在全球社交媒体的播放量超 10 亿次,远超过同名影片的观看人次。25 年的可灵的 AI 毛绒特效获得高关注度,相关视频在快手上的播放量超 5 亿次,引起大量用户模仿和二创,驱动 25 年 2 月 可灵 App 月活环比增长 113%至 151 万人。

随着 AI视频生成玩法融入社交平台,可玩性与想象空间显著提升。 1)看国内:快手积极在平台内推广 AI短视频,AI玩法的模仿与二创增加平台活跃度。随着可灵 AI 发布, 快手通过一系列用户运营活动在平台内进行产品推广。除了常规的带话题分享,快手已在可灵生成的 A I 视频左 下方增加跳转链接,用户可以一键跳转至可灵的视频生成界面,创作同类短视频。此类推广有望引起用户模仿 和二创,从而形成社交裂变,增加平台活跃度。24 年下半年以来,快手中由 AI 生成的视频数量显著提升,包括 专辑封面动态、老照片动起来等,目前“可灵 AI”“ai 视频”话题播放量分别达 102 亿、13 亿次,均为一年前 的十倍左右。

2)看海外:Meta 旗下社交应用有望陆续集成 AI视频能力。当前 Meta AI 集成在公司旗下各个 App 中,提供资料搜索、文字和图像生成、图像理解等功能。Meta 首席执行官马克·扎克伯格在年度股东大会上表示,公 司人工智能助手 Meta AI 目前拥有 10 亿月度活跃用户,渗透率约 30%。据 Meta 官网,AI 视频能力有望在 25 年 集成至Instagram等社交应用中,用途包括制作生活日常短视频并在 Reels 上发布、定制生日问候并通过WhatsApp 发送给朋友等。 在视频理解方面,豆包则率先将 AI 视频通话功能在国内落地。大模型基于手机摄像头展示的周围环境与 用户互动,例如识别花草和建筑物、提供穿搭建议。从实际体验看,豆包能快速准确地识别和理解摄像头中出 现的内容,语音回答的延迟度低。 这是国产 AI 助手在文字和语音交互的基础上,首次拓展至视频模态。豆包视频通话功能的落地存在两方 面利好:1)沉浸感和实用性更足:虽然豆包此前已经会理解用户上传的图片并回答问题,但当物体发生变化, 或豆包需要其他视角的图片时,用户需要再次拍摄和上传。而视频通话上线后,用户可以一边移动手机摄像头 一边与豆包对话,向豆包提问的过程更加直接高效。2)降低 AI 助手的使用门槛:对于部分中老年用户而言, 文字输入、用语言把问题描述清楚,仍有一定的难度。目前只要直接将手机摄像头对准与问题相关的物体,就 可以快速地通过语音交互完成问答。

在视频编辑方面,美图秀秀的 Wink 脱颖而出,成为继剪映/Capcut 后,又一款 AI视频编辑产品。Wink 主 要用于视频剪辑,通过人像视频美容和画质修复与头部的剪映/Capcut 进行差异化竞争。Wink 的视频剪辑功能 更简单易上手,仅有一条视频轴和 11 个常规的编辑功能,并主推一键剪辑功能,而剪映/Capcut 拥有画面、音 频、字幕三条时间轴,并辅以各种特效和 AI 字幕、AI 数字人等复杂功能。但 Wink 的人像美颜和画质修复功 能则更细致完善,在人像美颜方面推出独有的去油光、皮肤细节、眼部精修等功能,在画质修复上不仅可以提 高分辨率,还有人像、文字增强,以及适配游戏、动漫、商品图等垂类场景的画质增强功能。 看功能更新,Wink 的 AI玩法更多元丰富,功能的高频迭代带动用户规模增长。根据我们统计,Wink 发布 至今已进行 9 次 AI 功能更新,包括 AI 修复、AI 画面扩展、AI 美容、AI 特效等。爆款功能成为用户规模跃升 的主要驱动力之一。例如 2024 年 4 月新上线 AI 动图(图片转视频)功能,用户使用粘土滤镜和 AI 动图功能制 作彼时全球爆火的粘土风格动图,推动 Wink 连续 10 天登顶泰国 App Store 总榜第一名;2023 年推出的 AI 动漫 功能则刺激日本用户增长,成功登顶日本市场 iOS 分类榜第一名。

看商业化进展,Wink 已成为全球收入第三的视频编辑移动端产品,仅次于字节的 Capcut 和 Bending Spoons 的 Splice。Wink 的使用门槛更低、免费权限更大,基础的视频剪辑、人像美颜和画质修复功能可以免费使用, 而剪映的画质修复功能都需要收费。为了降低付费功能的使用门槛,不同于其他主流软件以订阅为主的模式, Wink 也创新性地使用了按次内购+订阅的模式。内购模式主要用于算力消耗较大的高阶视频增强功能,通过按 次付费覆盖每次的算力成本。订阅模式则主要用于部分美颜模板、AI 玩法和人像/游戏/商品图等垂类场景的画 质修复。据点点数据、白鲸出海基于今年 3 月 21 日-4 月 21 日的流水统计,Wink 在全球视频编辑移动端产品中 仅次于字节的 Capcut 和 Bending Spoons 的 Splice。

场景二:中短视频内容创作。对于创作者而言,AI 有望重构短视频创作工作流。前期市场认为 AI 视频产 品不具备实际作用,因为现有产品主要以独立的网站形式出现,在视频生成之后,用户还需完成视频剪辑、字 幕添加、音频添加等大量细节处理,需要在多个工具中来回切换,不仅环节繁琐,还需要处理多个工具的格式 不兼容问题。而以可灵为代表的 AI 短视频的制作和发布都可以在同一个 App 中完成。以集成可灵 AI 功能的快影为例,目前用户输入文案后,即可在 5 分钟内生成相应的短视频;支持一键跳转至剪辑界面进行剪辑,然后 再一键发布至快手上。

AI 短视频在海外百花齐放,近期海外多个 AI 短视频在社媒平台出圈,播放量最高达亿级。4 月以来多个 视频模型完成新一轮大版本更新,基于新模型创作的多个 AI 视频在海外社交平台爆火。其中播放量最高的是使 用海螺 2.0 创作的一个 34 秒视频,展现不同品种的猫进行跳水的动态,流畅性与稳定性较高,视频播放量也达 2.3 亿。 本轮出圈有望加速 AI 视频在短视频创作中的应用。我们认为这些视频的出圈,驱动力主要来自内容的创 新,而非用户对 AI 视频的新鲜度。对于创作者而言,AI 降低短视频创作门槛,可以将更多精力投入到视频创 作中;对于平台而言,数量更多、质量更优的内容上线,也能提升用户活跃度和黏性。

展望后续,AI视频产品有望迭代为 AI短视频社区,成为 AI时代的“抖音”和“快手”,以可灵为例: 1)可灵 1.0:AI视频工具。目前快手可灵集成在快手官方的视频剪辑应用快影中,主要赋能快手创作者的 AI 视频创作。变现模式是会员订阅和 API 调用,短期内贡献收入较少。2)可灵 2.0:AI视频社区。类比 GIF 快手向短视频社区转变,我们预计可灵也有望陆续从快影中独立出来, 变成独立的 AI 视频社区,除了拥有更完善的视频创作和编辑工具以外,还具有视频发布、分享、评论和相应的 推荐算法。而且与普通的短视频社区相比,AI 视频社区的去中心化程度可能更高。一方面,平台官方基于用户 偏好进行实时的个性化内容创作和推送,形成更加千人千面的内容社区;另一方面,AI 视频创作者也能积累自 身的粉丝群体,形成一个个小的社交关系网络。 3)可灵 3.0:AI 视频社区的商业化落地。除了作为 AI 工具向用户收费以外,可灵社区还有望通过数字人 直播打赏、广告等方式进行商业化。根据快手 CEO 程一笑在 24 年底公布的信息,可灵服务用户超 500 万,月 流水超 1000 万元人民币,由此测算年化的单用户收入约 24 元/人。而 24 年全年快手的单月活收入达 186. 76 元, 为可灵的 7 倍。因此随着可灵转型为 AI 视频社区,无论是用户规模,还是单用户收入,均有较大的提升空间。

场景三:专业级影视创作。专业的影视创作场景对 AI 工具需求高、付费意愿强。据动画艺术家工会 (Animation Guild)24 年上半年对美国 55 万名影视行业从业者进行的问卷调查,目前已经有 69%的公司在使用 生成式 AI 技术,其中约 44%的公司将其应用于 3D 生成模型,39%的公司应用于设计角色和环境。因此 Sora 、 Runway、Meta Movie Gen、快手可灵等头部视频模型均积极与影视行业开展合作。 2024 年 9 月以来,头部视频模型与影视行业的合作包括:1)Runway 与狮门影业达成 AI 电影制作的合作。 狮门影业将开放其丰富的影视资源库,包含超两万部影视作品,其中包括《饥饿游戏》系列和即将上映的《大 都市》等影片。Runway 将基于该影视数据,构建一个定制化的 AI 视频生成和编辑模型,旨在辅助狮门影业的 创意团队提升制作效率;2)可灵 AI 联合李少红、贾樟柯、叶锦添等 9 位知名导演共同发起“可灵 AI 导演共创 计划”,该计划目前已有 3 部影片在快手上线,时长约 3.5 分钟,点赞量约 1 万。 可灵在最新发布的《AI 影像创作者手册》中首次披露了 AI 导演共创计划的合作细节。合作导演普遍遵循 AI 生成分镜图片—将分镜图像生成动态影像—将影像片段连接成短剧的技术路径。从效果上看,他们认为 1) AI 是辅助:当下视觉生成模型并不能完全替代传统创作中的任何环节,AI 主要用于解决繁琐的技术性问题,核 心创造力需要导演和编剧。2)AI 在幻想类内容、动物形象塑造方面表现较好:AI 帮助生成独特、非现实画面, 节约时间和成本;而且可以呈现逼真的动物毛发、神情和动作姿态,与实际拍摄相比,可控性更强。3)AI 的思 维模式与人类有一定区别:一方面,AI 通过训练尽可能地与人类的思考模式同步,例如说到西瓜,可以联想到 水分、甜度;另一方面,AI 的思维方式也可以带来突破人类想象的未知。 从成本上看,我们根据《AI 影像创作者手册》中披露的数据,测算可灵生成单部平均时长 3.5 分钟的短剧需要成本约 0.21-1.40 万元,较真人短剧降本最大约 94%。

AI视频产品与影视行业合作成效初现,25 年上半年多部 AI 专业级影视制作作品集中上线且关注度较高: 1)海外 X 平台:海外创作者、X 平台用户@PJaccetturo 综合使用 Sora、可灵和 Luma,将《指环王:护戒 使者》的预告片重新剪辑成动漫风格的视频。他首先用 Sora 将原预告片的每一帧画面转换成动漫风格,然后利 用可灵和 Luma 将静态图像转变成动态影像。该短片自 2025 年 3 月 27 日在 X 平台上发布,目前播放量 720 万。 2)国内快手:上线全球首部 AI 单元剧《新世界加载中》,被称为 AI 版《爱死机》。该剧由快手可灵 A I 与 星芒短剧联合出品、异类 Outliers 团队制作。该剧包含 7 部独立单元剧,涵盖科幻(如《马丁症》)、奇幻(《虎 与旅行者》)、荒诞喜剧(《宇宙肥肠》)和历史等多元题材,总时长 180 分钟,从东方美学到三维写实,视觉风 格多样。

1.4.3 AI 图像应用场景

AI图像应用在 B 端和 C 端具有不同的落地路径。C 端聚焦休闲娱乐场景,美图秀秀等头部产品凭借在“变 美”赛道长期积累的 know how、功能的快速迭代更新以及产品矩阵的快速扩充构建壁垒,AI 优化相关功能的效 果并提升用户付费率和付费意愿。B 端则围绕电商物料制作、营销素材制作等场景,逐渐从海报创作、商品图 制作等单一功能,拓展至 AI 营销全工作流,使用户一站式完成相关素材的创作。B 端应用以会员订阅、AP I 调 用等商业模式为主,但付费意愿通常比 C 端高。 C 端聚焦 AI美颜、表情包创作等休闲娱乐场景: 美图旗下的美图秀秀和美颜相机是典型的 C 端 AI图像应用。这两个产品分别为修图工具和人像拍摄工具, Questmobile 数据显示 24 年底月活分别为 9791 万和 7200 万。23 年生成式 AI 技术大规模落地以来,这两款产 品均积极拥抱 AI,2023 年至今 AI 功能更新次数分别达 29 和 23 次,既包括 AI 画面扩展、AI 扩图、A I 生成童 年照等针对整张照片进行编辑的 AI 功能,也有 AI 减肥、AI 增肌、AI 表情、AI 一键提拉等美化人物细节的 AI 功能。具体来看: 1)功能类型:新 AI 功能上线和现有 AI 功能更新几乎各占 50%。美图除了创新 AI 玩法以外,还持续对现 有功能进行迭代,例如美图秀秀的 AI 发型功能在 2024 年 12 月新增微卷短发、羊毛卷、鱼尾烫等;美颜相机的 AI 写真功能早在 2023 年 5 月就上线,此后陆续更新多种写真风格、全家福写真、一键生成多种写真造型等不 同的细分功能,完善用户体验。2)更新节奏:2024 年以来 AI 功能更新显著提速。2023-2024 年,上述两款产品进行 AI 功能更新的次数呈 增加态势,2024 年下半年达 15 次,显著高于上半年的 11 次。

在竞争相对激烈的 C 端赛道,美图秀秀和美颜相机的核心壁垒除了 AI 在“变美”场景的大量 know how 以 外,还有公司以极短的产品开发周期,将全球关注度最高的 AI 玩法集成至旗下产品,扩充产品功能矩阵,最终 凭借完备、高质量的功能,吸引广泛的用户。 1)AI扩图:2023 年中 PhotoShop 和 Midjourney 的 AI 扩图功能受到全球关注,美图秀秀和 Wink 也在 2023 年 7 月快速上线该功能。PhotoShop 当时只支持海外应用商店的电脑端使用,使用门槛较高;Midjourney 不支持 用户导图,只能扩展自身生成的图片,泛用性不高。对比看,美图秀秀的 AI 扩图功能使用门槛低、交互也相对 简单,用户通过移动端导入图片、选择扩展比例,点击开始即可生成。 2)AI 捏捏特效:Pika 在 2024 年 10 月更新的版本中上线爆炸、压扁等 4 大特效,为图片增加动态特效。 压扁特效模拟手指挤压物体的过程,具备解压效果,在社交平台热度高。2024 年 11 月美图秀秀增加 A I 捏捏特 效,并向用户免费开放,同样具备生成速度快、使用门槛低的特点。

B 端聚焦 AI营销素材和商品图创作。今年以来 GPT-4o、Midjourney、字节即梦等新模型并未对图像生成的 工作流产生革命性影响,但整体生成效果显著提升,减少人工二次修改的频率,推动 AI 图像的应用场景从个人 娱乐向大规模商用拓展。我们看好三大应用场景提速:1)IP 形象焕新:GPT-4o 在水墨、赛博朋克、动漫等 10 多种风格图片生成效果好,有助于 IP 形象的更新与优化;2)宣传图制作:GPT-4o 和即梦 3.0 在图像翻译、模 特换衣、产品渲染等电商/广告/设计场景中的可用性强,GPT-4o 的细节处理更真实细腻,即梦 3.0 的图像色彩更鲜艳,且支持中文海报生成。3)长期赋能广告行业:AI 有望实时生成广告素材,实现广告推荐效果提升—广告 主 ROI 增加—广告加投的正向循环。

美图设计室是国内商业化规模最大的 B 端 AI 图像应用之一。目前美图设计室已成为美图旗下收入和用户 规模最大的 B 端产品,24 年底月活 1886 万,付费用户 113 万,付费率 6.0%,高于公司整体付费率 4.7%;全年 收入同比翻倍至 2 亿元,贡献公司收入比例 6.0%。每一届美图影像节都对美图设计室进行了大版本更新。

1)第一届美图影像节:首次发布美图设计室产品,核心功能为营销海报制作。用户输入文字和图片、选定 海报模板即可一键生成。 2)第二届美图影像节:更新多个 AI商品图创作功能,完成度更高。具体包括 AI 潮鞋(将线稿图变为创意 效果图)、AI 商品图(生成不同场景下的商品宣传图)、AI 试衣(AI 生成模特的衣服试穿图)等。3)第三届美图影像节:新功能聚焦物料批量制作和 AI产品视频,进一步覆盖电商物料的制作流程。此前 美图设计室已覆盖完整的 AI 商品图制作流程,本次将原来单一图片制作,升级至批量制作,用户把一批商品实 拍图导入,即可一键完成抠图、编辑,从而制作出一批产品不同、适应不同平台要求的商品图。AI 商品视频功 能则将商品展示形式由图片拓展至视频,用户围绕商品拍一圈视频,即可生成 3D 商品视频,使产品展示更立体 清晰。此外更新聚焦核心的电商卖家群体,针对性解决用户痛点。围绕各平台对物料图片要求不同的问题,推 出 AI 批量抠图功能,一键生成不同尺寸的物料图片,减少重复性操作;围绕商品视频制作难、成本高的痛点, 推出商品视频生成功能,将 AI 物料制作由图片拓展至视频模态。

1.4.4 AI 音频应用场景

AI+音乐难度较大,文生音乐尤甚。与文本生成相比,生成完整音乐旋律具有更大的挑战性,因为音乐旋律 需要考虑完整性、连续性和结构性,每个音符都受到之前音符以及整体音符分布的影响,需要对不同类型的信 号、模块进行不同层级的建模,且需要考虑和弦。 Suno 是最主流的 AI音乐生成产品之一。Suno 成立于 2022 年,23 年底发布网页端音乐生成工具,用户可 通过简单文本提示生成 30 秒音乐片段,初步展现 AI 在音乐创作中的潜力。24 年 3 月发布 V3 版本,支持生成 2 分钟广播级音质的完整歌曲,涵盖多样风格与多语言演唱,凭借超预期的歌曲效果驱动日活用户突破百万。24 年 11 月再度推出 V4 版本,支持生成 4 分钟高保真音乐,新增智能歌词优化与多轨道混音功能,并与多家音乐 平台达成分发合作,推动 AI 音乐进入主流市场。最新的 V4.5 版本则在 25 年 5 月推出,音乐时长增加至 8 分 钟,且实现更自然的嗓音演绎和更智能的提示词理解,擅长理解篇幅长、结构化、描述性的语言提示。 Suno 商业化落地快,中长期同样可能实现从 AI 工具向 AI 音乐社区迭代。Suno 从发布开始就面向用户收 费,目前月订阅会员为 10 美元,可以生成 500 首歌,折合每首 0.02 美元。24 年公司成功完成 1.25 亿美元融资, 估值 5 亿美元,用户数也从 1000 万增长到 2500 万。展望后续,公司 CEO Mikey Shulman 在接受知名播客 20VC 采访时提到,Suno 有可能成为类似 Instagram 这样的社区,既存在大量普通用户通过音乐进行点对点互动,也 有一些专业音乐人发布经过精心打磨的歌曲。 除了音乐以外,AI生成对话也是 AI音频的重要落地场景,25 年上半年字节豆包在这方面落地较快,主要 包括:

1)AI 语音通话。25 年初豆包发布实时语音大模型,并基于此模型全量上线豆包 App 实时语音通话功能。 根据我们的实测,新功能与豆包此前上线的语音功能相比,音色和情感效果显著提升,不仅能表现“喜、怒、 哀、乐”等情绪,还可以咳嗽、叹气、笑、甚至说悄悄话。 2)AI播客功能。豆包模型根据用户上传的 PDF 文件和网页链接生成播客,采用分段生成模式,支持边收 听边生成。播客采用双人对话形式,模拟真实交流场景,使内容传递更具互动感与代入感。针对专业内容,模 型会自动将专业术语、复杂表述转化为通俗易懂的口语化表达,降低信息接收门槛。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至