2024年人工智能计算中心行业分析:从独立基建到全国算力网络的新范式

  • 来源:其他
  • 发布时间:2025/12/02
  • 浏览次数:389
  • 举报
相关深度报告REPORTS

2025人工智能计算中心发展白皮书2.0.pdf

该文档为《2025人工智能计算中心发展白皮书2.0》,聚焦于人工智能算力基础设施的建设与发展。白皮书深入分析了在AI大模型技术爆发背景下,人工智能计算中心作为关键新型基础设施的战略地位与演进趋势。内容涵盖算力中心的架构设计、技术路线选择、运营模式创新以及生态体系建设,旨在为政府、企业及科研机构提供关于算力规划、部署与优化的专业指导。通过梳理行业现状与未来机遇,白皮书揭示了算力对数字经济发展的核心驱动作用,并探讨了如何通过技术协同与资源整合提升算力效率,推动人工智能产业的高质量发展。

人工智能作为数字经济高质量发展的核心引擎,正驱动全球科技与产业变革。人工智能计算中心,作为提供专用算力的人工智能基础设施,已成为培育数字经济技术优势、拉动新增长点的关键举措。自2020年《人工智能计算中心发展白皮书》提出“一中心四平台”理念以来,中国在人工智能计算中心建设上取得了显著进展,深圳、武汉、西安等多地计算中心已投入运营。当前,面对超大规模预训练模型带来的算力需求激增以及国家“双碳”战略目标,人工智能计算中心的发展正经历深刻变革,其形态正从独立的计算系统逐步走向相互联接的算力网络。本报告将深入分析这一演进过程的现状、驱动力、架构及未来趋势。

一、 全球竞相布局AI算力基建,中国坚持自主创新路线引领高质量建设

全球主要经济体已将人工智能基础设施的布局提升至国家战略高度,力图在新一轮国际科技竞争中掌握主导权。美国通过《美国人工智能倡议》和《2021年美国创新与竞争法案》等政策,计划在2025年前完成超过30个人工智能计算平台和技术中心的建设,并投资约690亿美元用于人工智能、量子计算等基础科研。欧盟通过“地平线欧洲”计划投资24亿欧元用于人工智能和高性能计算基础设施项目,德国政府更计划到2025年将对人工智能的投资增加到50亿欧元。日本则以“超智能社会”为愿景,强化人工智能的顶层设计。在这场全球竞赛中,各国不仅比拼算力规模,更在核心技术路线上展开角逐。美国依托NVIDIA、Intel等企业的技术优势,加快超大规模计算中心建设,如算力达3.4 EFLOPS的Summit系统和即将上线的E级系统Frontier。欧洲在采用成熟技术的同时,积极推动欧洲处理器计划(EPI)以强化本土芯片研制。日本则采用富士通等本土IT企业路线,打造了基于Arm架构、AI算力峰值超过1 EFLOPS的“富岳”系统。

与全球趋势同步,中国的人工智能计算中心建设呈现出鲜明的“政府主导,自主创新”特点。国家层面,《新一代人工智能发展规划》、《十四五规划纲要》等政策均明确要求加快建设新型基础设施。各地政府将此作为推动人工智能与实体经济深度融合的重要抓手。武汉市为推进国家新一代人工智能创新发展试验区建设,专门出台政策指导建设武汉人工智能计算中心,其核心建设周期仅5个月,上线即饱和运营,体现了“武汉速度”。更为关键的是,在复杂的国际竞争环境下,中国各地政府深刻认识到科技自立自强的重大意义,在计算中心建设中普遍坚持全栈自主创新技术路线,以应对底层基础设施可能面临的供应风险。位于深圳的鹏城云脑II是这一路线的典范。它作为支撑鹏城实验室的大科学装置,由4096颗昇腾910处理器构成,算力达E级,并基于昇腾AI基础软硬件平台构筑。鹏城云脑II不仅在AIPerf榜单位居第一,更支撑发布了全球首个两千亿参数中文NLP大模型“鹏程.盘古”和面向生物医学的“鹏程.神农”平台,彰显了自主技术路线的强大生命力。这种政府统筹规划与自主技术创新相结合的模式,为中国人工智能产业的健康发展奠定了坚实底座。

二、 “大模型+大数据+大算力”驱动需求变革,算力网络成为破局关键

人工智能领域正经历一场由超大规模预训练模型引领的范式革命。以GPT-3、鹏程.盘古、紫东.太初等为代表的“基础模型”展现出强大的通用性和泛化能力,标志着“大模型+大数据+大算力”成为迈向通用人工智能的一条可行路径。然而,这条路径对算力基础设施提出了前所未有的需求。模型的参数量从千亿级别向百万亿级别迈进,使得算力需求从PFLOPS级别跃升至EFLOPS级别,甚至开始触及10 EFLOPS级别。据华为《智界2030》白皮书预测,到2030年,AI计算总量将达105 ZFLOPS,相较于2020年增长显著。这种需求不仅是量的增长,更是质的飞跃,例如训练GPT-3模型一次就需要EFLOPS级算力持续数天。同时,大规模批处理、自动模型结构搜索等新方法也进一步加剧了计算需求的复杂性和规模。

另一方面,高质量大规模数据集是训练这些大模型的基石,但我国人工智能数据集建设相对分散,缺乏统一标准和流动共享机制,形成了数据孤岛。以遥感数据为例,虽然武汉大学发布了全球最大遥感数据集武汉.LuojiaSet,但其他地区的中小企业仍难以获取和利用,需要重复建设或高价购买,制约了整体创新效率。此外,人工智能赋能区域经济发展也面临新需求。我国企业人工智能接受度高达85%,远超美国的51%,但85%以上的AI算力集中在互联网和公安领域,在教育、医疗、制造等更广阔领域的应用深度不足。行业应用需要与具体业务流程深度结合,门槛较高。而超大规模预训练模型的出现,为降低门槛提供了可能。基于盘古大模型的实践表明,行业应用只需结合领域数据进行微调,即可在能源、金融、医疗等上百个场景中取得显著效果,例如帮助能源客户节约电力成本50%。这要求基础模型能够便捷地在不同区域的计算中心部署和迭代,以结合当地产业特色生成下游应用。

面对算力需求持续攀升、数据要素流动不畅、应用落地不均衡等挑战,将人工智能计算中心视为独立个体的传统模式已难以为继。人工智能计算中心的网络化、集约化发展,即构建“人工智能算力网络”,成为必然选择。算力网络通过新型网络技术将分布各地的计算中心节点联接起来,实现算力资源的全局感知、统一调度和弹性分配。这不仅能汇聚超级算力满足大模型训练需求,避免重复建设,还能通过任务调度实现“削峰填谷”,大幅提升各计算中心的利用率。例如,当某区域计算中心算力满载时,排队任务可被调度至处于算力波谷的其他中心,从而优化全局能效。在国家“双碳”战略背景下,这一点尤为重要。数据显示,2018年中国数据中心总用电量占全社会2.5%,预计2023年将达2600亿千瓦时。虽然AI计算中心能效是传统数据中心的10倍,且通过先进技术(如华为Atlas 900 AI集群的液冷技术可将PUE降至1.1以下),但业务波动仍会导致能耗闲置。算力网络的协同调度能从全局视角最大化能耗效率,是响应“双碳”目标的重要举措。因此,算力网络是应对当前新形势、新需求,实现算力、数据、模型、应用等AI生产要素高效流动与价值释放的关键基础设施。

三、 算力网络架构明晰作用深远,未来将向融合AI、HPC、BigData的多样性算力演进

人工智能算力网络并非简单的物理联接,而是一个具备复杂架构的智能系统。其整体架构可划分为三个关键平面:算网一体基础设施、统一运营多维调度管理、大规模分布式多方协同计算。在基础设施层面,计算与网络深度融合,构筑一体化底座。网络设施需具备智能接入、流量优化、健康监测和安全防护能力,形成稳定、高效、低延迟的“算力高速公路”。在管理平面,核心是调度平台和运营平台。调度平台如同整个网络的“大脑”,能够基于能耗、电价、负载、应用质量等多维感知信息,智能选择最优的计算中心和网络路径执行任务。运营平台则提供全局算力视图、统一账户认证、计量计费等功能,并建立应用、模型、数据三大市场,促进资源的安全可信流通。在协同计算平面,算力网络使能了联邦学习、多方协同计算等新型范式,使得数据“可用不可见”,在保护隐私的前提下实现跨地域的联合建模和分布式训练。

这一架构的核心作用在于实现“一网络三汇聚”。首先,是算力的汇聚。它将分散的算力资源整合成一台虚拟的、规模巨大的“超级计算机”,能够根据任务需求动态分配从数百GFLOPS到数EFLOPS不等的算力,既满足大模型训练的超级算力需求,又通过全局调度显著提升资源利用率和能效。其次,是数据的汇聚。通过制定标准接口和安全技术(如可信计算、安全沙箱),算力网络能够逻辑上汇聚分布于各节点的数据资源,形成更高质量、更大规模的数据集,同时确保数据主权和安全,极大促进AI算法的开发和行业落地。最后,是生态的汇聚。算力网络为跨区域科研协作和产业聚合提供了平台。科研机构可基于网络上开放的通用大模型(如鹏程.盘古),结合本地产业数据进行微调,快速生成特色应用;企业则可以更低的门槛获取AI能力,促进重点行业的智能化改造,最终形成围绕大模型的产业集群和创新生态。

人工智能算力网络的建设是迈向更宏大愿景的第一步。随着5G、AI、云计算、大数据等技术的交叉应用,行业需求的多样性决定了算力的多样性。未来,算力网络必将从当前以AI计算为中心,进一步融合高性能计算(HPC)和以大数据处理为代表的通用算力,演进为多样性算力网络。HPC在国防、能源、气象等领域的仿真建模中不可或缺,而大数据则是数字经济的关键生产要素。三者融合将支持更复杂的应用工作流,例如,AI用于数据预处理和结果分析,HPC进行核心仿真计算,大数据平台管理海量数据。多样性算力网络将实现对AI训练与推理、HPC仿真建模、大数据分析等任务的统一智能调度和一体化服务,为用户提供无缝体验。其架构将在现有基础上扩展,支持大模型并行训练、分布式高性能计算和多源数据一体化分析等更丰富的场景。最终,算力网络有潜力像电网和互联网一样,成为普惠的基础设施,消除数字鸿沟,为千行百业的数字化转型提供强大动力。

以上就是关于2024年人工智能计算中心行业的分析。总体来看,人工智能计算中心的发展正从初期的独立基础设施建设阶段,迈向以网络化、集约化为特征的算力网络新范式。这一变革由全球AI竞争加剧、国内“大模型+大数据+大算力”的技术趋势、赋能区域经济的迫切需求以及“双碳”战略目标共同驱动。中国在政府主导和自主创新技术路线的引领下,已在全国范围内布局了多个高质量的计算中心,为算力网络的建设奠定了坚实基础。算力网络通过其创新的三层架构,实现了算力、数据和生态的汇聚与共享,显著提升了资源利用效率和产业赋能能力。展望未来,向融合AI、HPC、BigData的多样性算力网络演进是大势所趋。为了推进这一进程,需要在政策层面加强统筹,鼓励重点区域先行先试,探索算力网络联盟运营机制,并持续攻关关键核心技术,推动标准化建设。人工智能算力网络作为新型数字底座,将为我国数字经济的高质量发展和共同富裕目标的实现注入强劲动能。

编辑:666知识控
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至