IT服务行业深度报告:AI Infra研究专题2,AI云业务核心竞争点_单任务成本

  • 来源:浙商证券
  • 发布时间:2026/09/14
  • 浏览次数:15
  • 举报
相关深度报告REPORTS

IT服务行业深度报告:AI Infra研究专题2,AI云业务核心竞争点_单任务成本.pdf

全球AI产业重心正从模型训练转向大规模推理落地,单位任务完成成本成为AI云业务的核心竞争焦点。伴随大模型推理规模持续扩张,德勤数据显示2026年推理算力负载预计将达三分之二,全球Token调用量呈指数级增长。在此背景下,全栈优势与规模优势构成AI云业务的两大核心竞争力。全栈优势:系统最优与高附加值全栈优势旨在通过全链路全局协同,解决算力集群因网络、调度等环节薄弱导致的“短板效应”,实现从“局部最优”到“系统最优”。谷歌TPU与Gemma模型的跨层协同优化,以及英伟达Run:ai与Nebius的动态GPU分片实践,均证明了全局调优能显著提升GPU利用率并压降推理成本。此外,全栈能力推动AI基础设...

随着大模型推理规模持续扩张与技术迭代,“单位任务完成成本”正成为AI云业务的核心竞争焦点。德勤数据显示,2025年推理算力负载已达到50%,预计2026年将达到三分之二。全球Token调用量呈指数级增长,至2030年预计将增长24倍。在此背景下,技术本身不构筑壁垒,全栈技术在帮助企业实现“更优的经济模型”中构筑壁垒。

全栈优势:从局部最优到系统最优

全栈优势的核心在于打通硬件、底层软件、模型与业务场景之间的边界,通过全局协同取舍实现系统层面的整体最优。算力集群GPU利用率不足的根源通常在于“短板效应”,即整体性能受限于网络传输、底层基建、调度机制等薄弱环节。2024年Fujitsu数据显示,即便处于峰值负载条件下,仍有超过75%企业的GPU平均利用率不足70%。

谷歌的全栈自研方案体现了跨层协同优化的效果。在Google Cloud公有云环境下测试Gemma-4-31B时,TPU v5p-8配合该模型在训练速度上较H100提升1.61倍,综合训练成本下降为GPU H100的47.06%。这得益于TPU芯片架构、JAX/XLA编译栈与Gemma模型的深度适配。此外,英伟达Run:ai与Nebius的联合调优也验证了动态GPU分片对效率的提升。实验显示,使用0.5 GPU分片配置可支持8,768个并发用户,占GPU总容量的86%,且仅带来轻微的性能损失。

全栈能力还驱动AI基础设施向高附加值环节升级。AI云服务从底层至顶层分为物理基础设施、托管基础设施、托管推理服务(Token Factory)、智能体优化层四大层级。全栈演进路径的分化体现在Neocloud厂商之间:CoreWeave主要处于第二层级(托管多租户基础设施),而Nebius则位于第三层级(托管推理Token Factory),拥有更低的客户集中度和更完善的全栈技术。

规模优势:大数定律与边际成本下降

规模优势通过大数定律消除流量波动,提高集群利用率。大规模推理流量可平滑负载潮汐波动,提升GPU集群利用率并压缩推理边际成本。GPU分片、连续批处理、Prefill/Decode解耦及资源复用等技术,均需依托大规模任务才能充分释放性能。例如,连续批处理允许在每一个推理解码步动态插入新请求,大幅减少GPU空载等待时间;PD解耦则将计算密集型的Prefill阶段与显存带宽密集型的Decode阶段拆分至独立GPU资源池,避免资源争抢。

在边际成本(TCO)方面,大规模厂商依靠采购议价及ODM直采模式压低硬件采购成本。2015-2020年,以销售服务器为主营业务的ODM企业台湾广达、超微电脑的平均营业利润率仅为2%和4%,远低于戴尔和惠普的10%和11%。同时,算力规模扩张摊薄供电、空载散热等固定能耗,推动PUE下行。2025年,AWS、谷歌云、微软云、阿里云的PUE分别为1.14、1.09、1.12、1.19,显著低于数据中心平均水平的1.54。此外,规模效应还摊薄了团队人力等固定成本,如谷歌云人员成本收入占比在2023-2025年间持续回落。

Hyperscaler与Neocloud的竞争格局

CSP(大型云服务商)凭借横向规模红利和纵向全栈整合能力维持行业领先地位。2025年,头部三大CSP云业务收入均达百亿美元级别,AWS、Azure更是实现千亿美元营收。大型云厂商积极布局自研芯片,如亚马逊的Trainium、谷歌的TPU、微软的Maia,形成英伟达GPU与自研芯片并行的双轨算力布局。ASIC芯片相比通用GPU可降低40%-65%的总拥有成本,并通过“芯片-硬件-调度-推理Runtime”四层跨层协同优化构建结构性降本飞轮。

Neocloud(新兴AI云厂商)虽在体量上远小于CSP,但凭借纯AI集群的专用化架构和第三方模型推理的同质流量构筑差异化壁垒。2025年,Nebius和CoreWeave的营收增速分别高达351%和168%。Signal65测算显示,CoreWeave的TCO较超大规模云厂商低44%-47%,主要源于其面向AI单一负载做基础设施专用化设计,消除虚拟化损耗并内置配套服务。同时,大量第三方客户集中部署主流开源模型形成的同质流量,有利于请求合批、缓存复用与统一执行路径,显著提升推理吞吐。

投资建议与风险提示

看好AI云高景气需求下,全栈优化与规模优势带来的长期投资机会。建议关注亚马逊、微软、谷歌、阿里巴巴、百度、Nebius、CoreWeave等标的。需警惕AI技术迭代不及预期、算力供需格局波动、行业竞争加剧、客户需求波动以及政策与合规风险。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至