2025年人工智能行业研究框架:大模型白热化,应用加速分化

  • 来源:中邮证券
  • 发布时间:2025/09/05
  • 浏览次数:238
  • 举报
相关深度报告REPORTS

人工智能行业研究框架:大模型白热化,应用加速分化.pdf

人工智能行业研究框架:大模型白热化,应用加速分化。大模型:加速多模态研发,闭源模型逐步逆袭开源。多模态技术路线尚未收敛,国内外大模型厂商持续刷新SOAT。图片领域,GPT-4o图像生成功能引发热潮后,谷歌Gemini2.5FlashImage登顶多主流图像榜,Meta也从Midjourney授权AI图像模型;视频领域,阿里字节等刷新能力高度,谷歌将视频模型推进至实时交互通用世界模型阶段。Deepseek开源浪潮推动模型平权与应用加速,浪潮后闭源模型逐渐维持性能领先,且借开源策略打造生态入口。一方面,预训练模型ScallingLaw增速放缓使闭源与开源模型性能差距收窄,但OpenAI、谷歌等闭源...

大模型:加速多模态研发,闭源模型逐步逆袭开源

多模态技术尚未收敛,生成视频、多模态实时交互为未来方向

多模态大模型融合了多种感知路径和表达形态,能够同时处理文本、图像、语音等多种数据,并进行深度的语义理解和交叉模态处理,具备深度人机交互和全面智能应用 的潜力。当前,多模态大模型主要分为理解和生成两种类型,技术路线尚未收敛,成为国内外大模型厂商重点突破方向之一。

多模态理解模型:多模态理解模型对齐视觉特征与文本特征实现跨模态的统一理解,分为以下两类技术路线:1)一方面,基于语言大模型底座,配合多类外部专家模型共 同实现多模态处理;2)另一方面,通过跨模态特征对齐学习,实现多模态输入的统一和融合,例如OpenAI的CLIP模型通过对比学习,将图像与文本通过各自的与训练模 型获得的编码向量在向量空间上对齐,从而理解和推理图像和文本之间的关系。

多模态生成:多模态生成模型基于对不同模态信息的理解,具备文本、图像、视频、语音信息的生成能力,分为两类技术路线:1)一方面,DiT结合扩散模型与 Transformer优势,成为视频生成模型主流架构;2)另一方面,端到端统一多模态架构,实现跨模态生成与实时交互响应,例如GPT-4o与Gemini均采用端到端原生多 模态单体模型的方式学习文本、视觉、语音等不同模态的统一表征,实现跨模态实时交互响应。

国内外大厂积极涌入多模态赛道,图片&视频陆续刷新SOAT

图片:继GPT-4o原生图像生成功能掀起使用热潮后,谷歌最新Gemini 2.5 Flash Image迅速登顶多个主流图像排行榜;Meta也宣布将从初创企业Midjourney授权AI图 像模型,以跟随OpenAI与谷歌步伐。

3月底,GPT-4o集成多模态原生图像生成功能,效果良好引爆用户使用热情。GPT-4o原生图像生成,意味着图像生成不再依赖于单独的DALL-E 3模型,而是直接集成到 了GPT-4o的核心能力中,这种集成带来了更流畅的用户体验和更强大的图像生成、修改能力,具备更好的文本集成、增强的上下文理解、改进的多对象绑定、多样化风格 适应等优势。得益于超预期的效果,GPT-4o原生图像功能上线不到72小时,OpenAI CEO奥特曼宣布ChatGPT图像生成功能开始暂时受限。

8月底,谷歌发布了最新的图像生成和编辑模型Gemini 2.5 Flash Image,成为新晋性能冠军,单图片生成成本仅0.039美元。2.5 Flash Image相较2.0 Flash Image, 在图像质量、编辑控制和应用场景上有大幅改进。用户不仅可以对人物和宠物进行精准编辑,保持其特征一致,还能实现多图合成、多轮次修改与风格迁移等复杂操作。 在大模型竞技场LMArena的文生图与图像编辑两个场景,谷歌的图像模型均拿下全球第一,在图像编辑榜单上模型表现尤为出色,获得1362的高分。

经历开源浪潮后,闭源模型逐渐开始维持性能领先优势

25年开年,DeepSeek多款模型通过算法的系列创新提升算力利用率,以成本、低价、性能等特征显著出圈,带来了模 型平权和应用加速。

DeepSeek以开源方式加速追赶闭源模型,API低价推动“大模型平权”。2024年12月,深度求索推出的DeepSeekV3以极低的训练成本,实现了与GPT-4o和Claude Sonnet 3.5等顶尖模型相媲美的性能;2025年1月,DeepSeek推出 推理模型DeepSeek R1,在后训练阶段大规模使用了RL技术,在仅有极少标注数据的情况下,在数学、代码、自然语 言推理等任务上,性能比肩OpenAI o1正式版。R1 API输出16元/百万tokens,而GPT o1为438元/百万tokens。

模型能力和推理成本迎来拐点,国内Agent应用企业积极接入DeepSeek API,把握AI应用需求爆发红利。2月,国内 万兴科技、易点天下、泛微网络等AI应用厂商相继宣布自身产品接入DeepSeek模型系列,并取得良好的协同赋能。

算力:海内外资本开支提振,芯片厂加速推出新版本芯片

国内外CSP厂商开启AI军备竞赛,Capex先行提高投入

海外:微软、谷歌、Meta、亚马逊四者合计资本开支在2023Q3后连续多个季度环比上升,同时上调资本开支指引。 微软:25Q2(2025财年第四财季)资本开支为242亿美元,同比+27%,Q1同比+53%;其中,不动产和设备相关的现金支出171亿美元,同比+23%,Q1同比+52%。 目前,微软正在加速建设数据中心,以满足对AI训练和工具激增的市场需求。公司预计,2026财年第一财季有望将资本开支提升至300亿美元以上。 谷歌:由于云产品和服务的需求强劲且不断增长,25年capex上调至850亿美元,同比+13%,此前2月份预计全年capex为750亿美元;预计26年capex将进一步增加。 亚马逊:2025财年制定了1000亿美元的激进资本支出计划,重点关注人工智能基础设施和数据中心的扩张。 Meta:25Q2,将全年capex的最低水平从上季度的640亿美元上调至660亿美元,capex范围在660亿美元至720亿美元之间,25年的总支出将在1140-1180亿美元之间。

英伟达由B向R卡跨越,AMD布局26年新型MI400系列GPU

英伟达芯片架构正在由Blackwell向Rubin过渡。根据美股研究社,短期看,英伟达GB300相比GB200在性能、存储、互连、安全与管理等多个方面进行了全面升级,性 能增幅高达50%,25Q4或是NVL72规模化出货节点。26年下半年,英伟达将发布Vera Rubin架构,这是基于HBM4内存、基于3nm节点构建的全新芯片系列。Vera Rubin NVL144将提供比GB300高三倍以上的推理计算能力提升,同时提供机架级系统级架构兼容性。在2027年之前,Rubin Ultra设计将继续突破极限。凭借NVL576机 架设计,它可以提供高达15 exaFLOPS的FP4吞吐量,大约是新GB300系统计算能力的14倍。

AMD MI350系列对标GB200,MI400系列计划为26年新型服务器“Helios”的基础。6月,AMD正式推出下一代Instinct MI350系列,其中包括MI350X和旗舰MI355 GPU及平台。在FP4和FP6精度,新GPU芯片相对MI300X实现的AI计算性能提升4倍,推理性能提升35倍。此外,AMD预览了基于MI400 GPU的下一代人工智能机架 “Helios ”。

云端巨头竞相自研ASIC推理芯片

根据TrendForce集邦咨询,AI Server需求带动北美四大CSP加速自研 ASIC芯片,平均1~2年就会推出升级版本。CSP为应对AI工作负载规模逐步 扩大,同时计划降低对NVIDIA、AMD的高度依赖,因此积极投入ASIC开发 进程,以便能控制成本、性能和供应链弹性,进一步改善营运成本支出。

谷歌:已推出TPU v6 Trillium,主打能效比和针对AI大型模型的最佳化,预 计2025年将大幅取代现有TPU v5。

亚马逊:目前以与Marvell(美满电子)协同设计的Trainium v2为主力,其 主要支持生成式AI与大型语言模型训练应用,AWS也和Alchip合作 Trainium v3开发。

Meta:成功部署首款自研AI加速器MTIA后,正与Broadcom共同开发下一 代MTIA v2,MTIA v2设计特别聚焦能效最佳化与低延迟架构,以确保兼顾 推理效能与运营效率。

微软:目前在AI Server建置仍以搭载NVIDIA GPU的解决方案为主,但也加 速ASIC开发,其Maia系列芯片主要针对Azure云端平台上的生成式AI应用 与相关服务进行优化,下一代Maia v2的设计也已定案,并由GUC负责后段 实体设计及后续量产交付。

国内:阿里巴巴旗下平头哥(T-head)已推出Hanguang 800 AI推理芯片; 百度继量产Kunlun II后,已着手开发Kunlun III,主打高效能训练与推理双 支持架构;腾讯除了自家AI推理芯片Zixiao,亦采用策略投资的IC设计公司 Enflame(燧原科技)解决方案。

应用:海外应用加速分化,聚焦与数据结合的 复杂toB场景

创新竞争加速,货币化进展成为AI初创公司的关键维度

AI初创公司ARR放量时间显著缩短,货币化速 度或为初创公司未来估值提升的重要考量。

OpenAI:得益于用户的高速增长与较强的粘 性,OpenAI 25年收入有望达到116亿美元, 同比翻2倍+,25年8月ARR已达到120亿美元。 根据NerdyNav,ChatGPT为有史以来增长最 快的应用程序,仅5天就达到100万用户,前两 个月达到1亿用户,该公司的目标是在2029年 实现盈利,收入目标为1250亿美元。

Anthropic:根据COATUE,Anthropic年化收 入0 → 1、1 → 2、2 → 3亿美元分别经过21、 3、2月,创收能力快速提升。根据ARR.club, 25年7月,Anthropic ARR已突破50亿美元, 是去年12月底的5倍。

企业级Agent落地较快,核心在于打破数据孤岛与保障结果准确

toB企业级Agent为主流。根据头豹研究院的研究报告,2023年中国Al Agent市场规模为554亿元,预计至2028 年将达到8520亿元,年均复合增长率高达72.7%。而在这8520亿元中,根据观研天下数据预测,预计2028年B端 AI agent市场规模为8390亿元,占比98.5%。

对比通用型Agent,企业型Agent落地的关键,在于与业务流程深度结合,确保输出结果的准确可靠。AI能够理 解实际应用场景,能够在特定的业务场景、流程与数据库中稳定工作,使得企业能够通过数字员工提高生产力。

我们认为,企业级Agent的价值落地需分层推进“可靠性基础”与“业务流程结合”两大目标。前者依托大模型迭 代,如思考模式下GPT-5较GPT-4o、o3事实错误率分别降约45%、80%,通过架构优化、数据扩容与强化学习降 低幻觉率,筑牢技术底座;后者更依赖企业将行业隐性know-how转化为Agent可执行参数,及打通ERP、CRM 等系统数据孤岛以实现业务流程的闭环,推动Agent从工具升级为流程主体。基于此,未来Agent将聚焦与业务数 据深度绑定的复杂toB场景,最大化释放Agent降本增效的价值。

C端应用:创意类开始挤压工具类,AI的替代性开始显现

多模态大模型发展推动创意类应用从 “辅助工具” 进化为能理解复杂需求、提供创造 性解决方案的 “创意伙伴”,这种进化既强化其替代优势,又使其以低学习成本、快产 出吸引用户,持续逼近传统专业工具价值腹地。

以UI/UX设计为例,Figma、Canva等创意软件的快速增长有望挤占传统工具软件 Adobe的市场份额。

Figma:支持构建的app、网站及数字界面,正将AI深度嵌入产品流程,以提升效率。 最具代表性的AI功能Figma Make,支持用户通过提示快速生成可交互原型,并可结合 现有设计组件。截至25Q1,Figma MAU超过1300万,其中约三分之二为非设计师, 95%的财富500强企业;付费用户高达45万,其中ARR超10万用户达1031家,相对 23Q1+126%,ARR超1万用户达11107家,相对23Q1+86%。

Canva:轻便的设计工具,降低设计门槛。Canva推出视觉套件2.0,引入了AI设计助手、 视觉化工作表、图表生成、批量创作等核心功能,极大地拓展了AI在设计与内容创作中 的应用领域。根据Demandsage,24年底Canva拥有2.2亿MAU,同比+63%,其中 2100万为付费订阅用户;《财富》500强企业中有95%使用Canva。

Adobe:长期以来主导着设计市场,其产品套件(如Photoshop、Illustrator)在各个 设计领域占有重要地位,然而,其相较缓慢的云端化进程,使其在部分新兴市场上面临 来自类似Figma的竞争压力。

报告节选:

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至