分布式智算中心无损网络解决方案设计原则、架构分及技术特征析

分布式智算中心无损网络解决方案设计原则、架构分及技术特征析

最佳答案 匿名用户编辑于2025/04/11 15:53

提供高效稳定训练能力。

1.方案设计原则

分布式智算中心无损网络是一种特别设计的网络架构,通过全栈创新,旨在整合盘活闲散算力资源,实现算力高效互补和联动,进而构建极致可靠的算力集群,为大规模分布式智能计算提供高性能、低延迟且无丢包的数据传输能力。这种网络架构可以提供接近于本地智算中心网络性能的计算效率和数据处理速度,对于支持大规模机器学习模型训练和高性能计算至关重要。分布式智算中心无损网络在方案设计时,应遵循打造超大规模算力集群、提供高效稳定训练能力、实现算网灵活调度供给以及坚持绿色低碳节能减排四大设计原则:

(1)打造超大规模算力集群 当前智算集群主要规模为单数据中心内的数千张计算卡,更大规模的万卡乃至超万卡集群建设尚处于初期阶段。构建超大规模算力集群将进一步缩短大模型训练时间,加速模型能力迭代。通过分布式智算中心无损网络可以实现多节点算力协同,构筑超大规模的极致算力集群。 (2)提供高效稳定训练能力 大模型的计算量大、训练时间长,训练期间涉及节点间的频繁交互,对网络稳定性要求高。如果训练期间网络出现不稳定,轻则将回退至上一个分布式训练的断点,重则可能要从 0 开始,会影响整个训练任务进度,给客户带来重大损失。分布式智算中心无损网络需要在支持大模型高效训练的同时,保持长期训练的稳定性。

(3)实现算网灵活调度供给 构建多 DC 算力集群灵活调度,实现算力高效互补和联动。同时,通过应用服务、算力使能平台和算力底座的深度适配,高效的算网调度及协同,实现训练资源的按需分配,为用户提供接近本地训练的算力效率和灵活的算力供给能力。

(4)坚持绿色低碳节能减排 通过分布式部署的算力集群分担电力,实现电力与算力的最优配置,并通过800G C+L 构建低时延、高带宽的全光网络,为智算集群提供超大带宽的主干道,实现最优成本的 bit 传输和算力的绿色供给。

2.分布式智算中心无损网络总体架构

分布式智算中心无损网络总体架构由多个单节点智算中心网络组成,其中每个单节点智算中心网络均包括多个业务区块:AI 集群区、通用计算区、存储区、带外管理区、管理区、网络服务区、接入区。每个区域负责特定的功能,区块间通过核心交换区的核心交换机连接在一起构成单节点智算中心网络,多个单节点智算中心网络之间通过广域互联区互联,构成分布式智算中心无损网络,共同支撑起整个分布式智算中心的运行。

AI 集群区:包括 GPU、TPU 或其他加速器等高性能计算节点,用于智算集群分布式训练时的参数交换。要求网络具备大带宽、高吞吐、无丢包能力,需要部署无损网络。

通用计算区:包括 CPU 等通用服务器,支持各种类型的应用程序和服务。提供标准的计算资源,用于运行非 AI 相关的计算任务,通常部署为TCP/IP有损网络。 存储区:包括高速缓存存储、块存储、对象存储等多种存储类型,用于存储大量数据和模型文件。要求网络具备高速大带宽互联能力,可按需部署无损网络。管理区:包括监控系统、配置管理系统和安全控制系统。负责整体网络的监控、配置和安全管理,通常部署为 TCP/IP 有损网络。

带外管理区:用于管理计算节点和其他网络设备的带外接口。提供独立于主网络之外的管理通道,确保即使在主网络出现问题时也能进行设备管理,通常部署为 TCP/IP 有损网络。 网络服务区:提供防火墙、负载均衡、DNS、NTP 等网络服务,保障网络设备和服务的正常运行,通常部署为 TCP/IP 有损网络。接入区:是智算中心对外连接的主要入口。包括防火墙、负载均衡器等设备,用于连接外部网络和提供安全防护,通常部署为 TCP/IP 有损网络。广域互联区:包括路由器、OTN 等设备。多节点智算中心通过具备高通量的联算网关互联,中间通过 OTN 全光网络提供高品质的大带宽连接,实现AI 集群训练网络的跨 DC 互联互通,需要部署无损网络。

这些区域共同构成了分布式智算中心网络架构,每个区域都承担着特定的角色,通过相互协作确保整个分布式智算中心的高效运作。其中,构建AI 集群之间的无损广域互联网络是方案中的设计重点。通过提供物理隔离、全程资源独享的高质量、低时延的波长级大带宽管道,实现 DC 间的多方向任意互联,并提供抗多次断纤的能力,保证互联的可靠性。在大带宽的传输资源基础上,智算中心出口通过联算网关提供灵活的、易扩展的跨智算中心组网和长距无损、高吞吐、高可靠的数据承载。

AI 集群网络架构从下到上分成四个层次: 接入层:由 Server Leaf 交换机组成,支持 AI 算力服务器的高密规模接入,上下行带宽收敛比推荐 1:1。AI 训练服务器每个接口采用独立IP,以独立链路方式接入到 Server Leaf 交换机,不做链路捆绑。接入侧支持光模块故障保护机制,避免接入侧链路故障导致训练中断。 汇聚层:由 Spine 交换机组成,下行接 Server Leaf 交换机,上行接DCI Leaf 交换机。Spine 交换机的数量决定了本节点 AI 集群的总规模,根据训练业务模型的选择,汇聚层可以有一定的收敛比。 集群出口层:由联算网关组成,作为 AI 集群的出口,联算网关下行与多Spine交换机进行全互联,上行通过 OTN 和其他节点互联。集群出口层也可根据业务模型的选择进行收敛。此外,集群出口层采用算网协同、DC 间与DC内级联精准流控等技术,实现网络负载均衡和长距无损,为 AI 集群的高效训练提供基础网络保障。 广域互联层:不同智算中心节点之间采用 OTN 全光网一跳直达,全程无拥塞,无丢包。广域互联层提供单纤 96Tbps 的超大带宽能力,利用高性能的WSON技术和智能运维技术,保障智算高可靠互联,同时具备与业务联动的波长级拆建能力,实现算网协同。 通过这些设计,AI 集群网络架构能够在长距离、大规模的分布式计算环境中提供稳定、高效的数据传输能力,为大规模智算中心的高效运行提供坚实的基础。

3.方案技术特征

分布式智算中心无损网络将智算中心无损网络从数据中心网络向广域网延伸,方案具备长距无损、超大带宽、超高可靠、弹性敏捷和智慧运维的特征。(1)长距无损:在大模型训练过程中,采用 RDMA(远程直接内存访问)作为输入输出协议。由于 RDMA 对网络拥塞和丢包非常敏感,即便是少量的丢包也会导致性能急剧下降。因此,底层网络必须具备无损传输能力,确保数据传输过程中不会出现拥塞或丢包现象,从而避免上层协议性能受损。

(2)超大带宽:超大带宽能够确保大量数据在分布式智算中心之间快速传输,加速 AI 模型的训练和推理过程。随着数据量的增加,分布式智算中心之间需要高效同步数据和模型参数,这就要求网络提供足够的吞吐量,以避免网络拥塞和性能下降。 (3)超高可靠:为了保证分布式智算中心之间的长期稳定训练,防止网络施工等外来因素导致的训练中断,传输网络需要具备高可靠性。例如在网络链路发生故障时能够快速恢复,保证智算不中断,任意二次故障带宽不下降,以避免因链路中断而导致的智算训练回退和算力效率下降。

(4)弹性敏捷:分布式智算中心无损网络需要根据多租户的不同需求,能够灵活地组建不同规模和类型的集群组网。这意味着网络需要具备弹性敏捷的按需拆建能力,能够根据计算需求的变化快速调整,动态分配大带宽资源。(5)智慧运维:传统网络运维面临同缆&同沟、误码闪断等难题,导致保护机制失效和业务异常。分布式智算中心无损网络需要具备智慧运维能力,能够快速准确地定位和解决问题,提高故障定位的准确率,确保网络的稳定运行。

参考报告REPORT

中国电信:分布式智算中心无损网络技术白皮书.pdf

2024年3月,政府工作报告中首次提出开展“人工智能+”行动,打造具有国际竞争力的数字产业集群。这意味国家将加强顶层设计,加快形成以人工智能为引擎的新质生产力。随着这一行动的深入推进,人工智能将在推动产业升级、促进新质生产力加快形成等方面发挥重要作用。随着人工智能的浪潮来袭,以大模型为代表的AI方案逐步深入千行百业,算力需求日益攀升,智算基础设施的重要性进一步凸显。然而,在智算基础设施建设过程中尚面临组网、通信、能耗、成本等多重挑战,行业要“以网强算”,通过无处不在的网络资源,补齐单点算力规模不足的差距,夯实智算业务发展基础。本白皮书聚焦AI大模...

我来回答
分享至