分布式智算中心无损网络场景、挑战及核心技术有哪些?

分布式智算中心无损网络场景、挑战及核心技术有哪些?

最佳答案 匿名用户编辑于2025/04/11 15:52

目前,分布式智算中心无损网络主要适用于两类场景:算-算拉远和存-算拉远。

1.分布式智算中心无损网络场景

(1)算-算拉远场景 我国单点智算中心规模普遍偏小,规模为 100-300PFLOPS 的小型智算中心占比超 70%,而规模超过 1EFLOPS 的大型智算中心仅占25%,且多由云提供商及大型企业自建,集中在京津冀、长三角和粤港澳。算-算拉远可以将区域内多个已经建成的智算中心的算力进行整合,从而无需建设超大规模集约型智算中心就能够训练更大的模型。

此外,单个智算节点往往会存在资源利用率不足、闲散算力资源浪费的问题。在算力使用过程中,租户算力诉求与实际部署算力往往不一致,导致算力零散在本地,智算中心算力资源碎片化。如何把零散的资源整合起来,系统优化算力基础设施,布局盘活机房,促进跨集群算力高效互补和协同联动成为充分发挥算力的关键能力。算-算拉远能够充分利用碎片资源来执行合适的任务,提升系统利用率。

(2)存-算拉远场景 高性能、高可靠存储是公有云最基础的服务之一。当前公有云中广泛采用存算分离架构,即计算集群和存储集群可能位于 Region 内的不同DC中,而互连计算集群和存储集群的网络成为实现云存储服务高性能和高可靠性的关键。存- 算拉远可以将 Region 内的计算集群和存储集群无损互联,满足数据本地化需求,保障数据安全。

2.分布式智算中心无损网络挑战

在探索跨智算中心构建超大规模智算集群过程中,算力和网络均遇到了诸多问题和挑战。首先,集群拉远部署相比于本地集群部署在DCN 协议面需要解决时延和丢包两个难题。 (1)拉远增加网络传输时延:AI 训练每轮迭代会通过集合通信进行参数同步,而集合通信内部存在多轮数据交互,以及多次跨长距通信。长距拉远后,传输距离每增加 10km,通信时延增加 10ms 左右,对 AI 大模型的训练效率产生极大影响。

(2)网络拥塞丢包,使性能急剧下降:当前 AI 训练采用RDMA协议,而RDMA 的高效率依赖于极低的丢包率。数据显示,当网络的丢包率大于10 -3时,RDMA 有效吞吐将急剧下降;2%的丢包率会使 RDMA 吞吐率下降为0。因此,要使得 RDMA 吞吐不受影响,丢包率必须保证在十万分之一以下,最好为零丢包。在长距拉远场景下,当网络出现拥塞时,若没有在RTT(往返时间)内及时缓解拥塞,就会发生丢包,导致一轮迭代训练时间增加,大模型的训练效率下降。

其次,集群拉远部署和本地集群部署相比在传输网也需要解决高带宽和稳定性难题。 (1)超大带宽、灵活组网保证长距拉远算效:在跨DC 分布式训练场景中,需要提供充足的互联带宽,并根据智算中心空闲服务器数量灵活组网,避免网络拥塞,实现高效传输。 (2)高可靠机制保证 AI 训练的稳定:检查点(checkpoint)机制是AI 训练的必要需求,主要用于在训练过程中保存模型的权重,以便在训练中断或模型更新时恢复训练,从而提高训练的效率和稳定性。网络还需要具备抗多次断纤能力,防止网络故障引起 AI 训练中断。 (3)故障分钟级检测及定位:模型训练期间可能受施工震动、挤压弯折、意外挖断、接头松动、老化等影响,从而导致光缆故障,训练也会随之中断。为保证训练的稳定,要求网络具备故障时分钟级自动检测和定位、分钟级提前预警的能力,以保证智算拉远训练时的高可用。

针对以上难题,若要实现长距无损传输,需要协同优化IP 层和光传输层技术,构建分布式智算中心无损网络,实现多数据中心协同提供服务。在IP层,一方面可以优化集合通信算法,减少长距链路的流量传输,从而消除流量交叠现象;另一方面可以引入全局负载均衡和精准流控技术,实现多节点互联网络的无拥塞、高吞吐。在光传输层,一方面可以依托城域网或区域网延伸覆盖智算节点,并在资源不足区域新建 800G/1.2T 超大带宽的互联网络,构建高品质光互联;另一方面,可以提高网络故障处理能力,实现高可靠、智慧化运维。

3. 分布式智算中心无损网络核心技术

分布式智算中心无损网络在 IP 网络层和光传输层都需要引入新的技术点,以实现长距无损、超大带宽、超高可靠、弹性敏捷、智慧运维等需求。

3.1 异构网络集合通信优化技术

异构网络集合通信算法针对异构网络设备带宽和时延不对称(主要针对长距链路)的问题对智算业务流量进行调整,从而大幅度降低链路拥塞的可能性。在同构网络场景下,业务流量具有高度的对称性,每个节点承担的带宽业务压力是相同的。而在异构网络场景下,网络设备的处理能力不同,因此业务流量也需要调整以适应新的网络情景。例如减少长距链路上传输的数据量和传输次数,从而大幅降低长距链路拥塞的可能性。 智算业务的通信模式为集合通信,其中最主要的是AllGather 和AllReduce集合通信。集合通信的特点是所有主机都会进行相同的操作。AllGather:多台主机把数据的不同部分发给所有主机。AllReduce:多台主机把数据的相同部分发给所有主机。然后所有目的主机都做一定的操作,例如求和、求最大值、求平均。

针 对 这 两 种 集 合 通 信, 业 界 主 流的 集 合 通 信算法包括Ring 算法和Halving-Doubling(HD)算法。其中 Ring 算法通信模式简单,每台主机只需跟自己的邻居通信;HD 算法通信模式较复杂,但通信次数比Ring 算法少,静态时延带来的开销小,因此对于小字节的通信效果更佳。然而,无论是Ring 还是HD,都是针对完全同构的系统设计的,集合通信的每个Rank 行为一致,收发流量也一致。 在长距拉远场景下,网络不再同构,跨长距的 GPU 通信时延要显著高于DC内的 GPU 通信时延,因此传统算法将不再最优。下表总结了Ring 算法和HD算法在拉远场景下的跨长距通信次数和通信量。其中 S 是集合通信数据量,N是参与集合通信的 GPU 数量。

理想情况下,跨长距只需要进行一次通信,并且传输的数据量为S 即可。基于该思路,设计出针对长距异构组网的集合通信算法框架,如图3-3 所示。新算法具体步骤如下: (1)将拉远 DC 当做两个独立的子系统,在每个DC 内先进行集合通信操作,集合通信算法可选用 Ring 或者 HD。 (2)DC 内同步后,在每个 DC 中选取一个或者多个代表主机,然后对应的代表主机之间同步数据。例如选取 K 个代表主机(K < N/2),则每个主机需传输S/K 的数据。这一步的通信在网络上就是 K 个点对点双向通信。(3)每个代表主机接收到对方的数据后,进行本地加和,再将加和后的结果在本 DC 内广播/All Gather 分发出去。这样就实现了两个DC 之间的AllReduce操作。

3.2 网络级负载均衡技术

网络级负载均衡主要解决智算业务场景下非故障、同构网络的拥塞丢包问题。其中智算业务限定了网络的流量模型是集合通信。同构主要指网络设备的带宽、时延具有对称性和同步性,非故障场景指网络设备不存在光模块损坏、链路闪断、慢节点等故障问题,此时网络级负载均衡技术可以完美的将流量均衡分配到不同的网络路径,从而避免流量冲突。

智算业务流具有同步性高、流量大、周期性出现等特点。同一时刻,网络里每条等价路径上都有流经过,传统基于 ECMP 哈希的负载均衡技术无法做到所有路径的完美均衡。就像把 8 个小球随机放到 8 个盒子中,每个盒子恰好有一个小球的概率是很低的,总会有一些盒子里被放入多个小球(即链路拥塞),有些盒子没有小球(即链路闲置)。

网络级负载均衡技术可以通过统一规划整网流量,让所有路径之间完美均衡无冲突,避免拥塞丢包。具体来说,首先网络设备会收集业务的流量信息,并将其发给网络控制器。控制器根据拓扑、流量信息,运行全局选路算法,给每条流都选择合适的路径,做到整网完美均衡无拥塞。最后,控制器将路径信息再下发给网络设备,由网络设备作出路径调节。

3.3 精准流控技术

精准流控技术包含两种方案,一种是仅在交换机网络中使能的精准流控1.0方案,另一种是在跨多个智算中心时,由交换机+路由器端到端协同的精准流控2.0 增强方案。

(1)精准流控 1.0 方案 交换机精准流控技术主要解决智算业务场景下故障丢包引起的业务性能下降问题。网络级负载均衡可以在网络正常的情况下做到整网无拥塞、无丢包。但在实际业务部署时,会出现一些异常场景,如光模块闪断、长距链路误码丢包、服务器侧拥塞导致接收数据能力下降等等。这些异常都会产生负载均衡技术难以解决的拥塞问题,进而带来异常丢包,影响训练业务性能。

在出现网络故障后,无论是链路故障还是服务器接收数据速率降低,网络有效吞吐都会下降,必然产生拥塞。但是,拥塞发生的位置不同,带来的结果也不同。如果拥塞发生在数据中心内部,因为反馈时间较短,利用流控或者拥塞控制都可以很快抑制拥塞;而如果拥塞发生在跨长距链路上,此时反馈时间变长,设备缓存不足以接纳链路在途数据包,从而发生丢包。

交换机精准流控的思想就是当拥塞不可避免时,将原本在长距链路上的拥塞“转移”至网络第一跳设备上。具体来说,网络设备通过检查网络状态,例如端口队列堆积信息、端口反压情况,来判断是否出现拥塞。如果出现拥塞,并且该设备不是拥塞流量的第一跳设备,那么就把拥塞信息通告给拥塞流量的第一跳设备,也就是源 Leaf 交换机。随后,源 Leaf 交换机根据拥塞程度运行算法,决定以多大比例对拥塞流量进行限速。最后,源 Leaf 交换机通过发送PFC/CNP/其它流控协议报文,实现对流量的控速。

大模型训练的流量具有周期性的特点,即同一条流如果在前一个周期出现拥塞,无论是链路故障导致的流量冲突,还是目的主机接收能力下降,这个拥塞在下一个周期还会出现。基于这一特征,源 Leaf 交换机需要维护一张信息表,用于记录哪些流会发生拥塞。这样,当拥塞流后续周期性出现时,可以第一时间进行控速,而不必再通过远端拥塞点通告后进行控速。因此,利用精准流控技术在第一周期获取到整网拥塞信息后,后面所有周期都可以做到流量无损。

(2)精准流控 2.0 增强方案 在多智算中心协同进行模型训练时,拥塞和故障可能发生在网络的任意节点或链路上,智算中心间距离的拉远会导致传输时延增加,影响网络状态反馈的及时性。路由器与交换机通过精准流控技术相互配合,不仅能够应对网络中突发的拥塞挑战,还能够在长周期故障下保障业务性能不下降。同时基于流的反压机制可以有效遏制拥塞和故障导致的反压扩散,显著提升整体网络吞吐率。相较于传统的 PFC 机制,路由器精准流控技术解决了PFC 的头阻、反压风暴和死锁问题,实现了从端口级流控到数据流级流控的飞跃,其基于IP 数据报文的五元组作为流识别粒度,实现了对网络中每一条流的独立监控与动态调整,将拥塞和故障带来的影响最小化。

在跨 DC 场景下,网络环境更加复杂多变,路由器精准流控技术通过以数据流为单位的精准流量控制和精细化缓存调度,实现长距网络环境下数据的无损传输,确保数据传输的连续性和完整性。对于长周期的故障情况,路由器精准流控技术的优势更为显著。它不仅能够在故障期间通过精准流量控制,避免丢包现象,还能在限速策略上实现高度精准,包括数据流限速的开始与解除时间、限速速率的精确设定。从而确保网络吞吐能力在故障期间仍能逼近极限物理带宽,避免因限速不准导致的欠吞吐问题。 面对数据中心内高度动态的业务负载变化,路由器精准流控技术展现出极高的灵活性与智能性。其能够根据实时网络状况动态调整流控策略,实现流量峰值速率的流级别的独立控制和精准反压,有效应对网络中的突发流量,保障整体网络的平稳运行,实现故障的有效隔离不扩散。此外,路由器精准流控技术引入的弹性级联降速机制,进一步增强了网络对突发情况的适应能力,提升了网络的韧性。

参考报告REPORT

中国电信:分布式智算中心无损网络技术白皮书.pdf

2024年3月,政府工作报告中首次提出开展“人工智能+”行动,打造具有国际竞争力的数字产业集群。这意味国家将加强顶层设计,加快形成以人工智能为引擎的新质生产力。随着这一行动的深入推进,人工智能将在推动产业升级、促进新质生产力加快形成等方面发挥重要作用。随着人工智能的浪潮来袭,以大模型为代表的AI方案逐步深入千行百业,算力需求日益攀升,智算基础设施的重要性进一步凸显。然而,在智算基础设施建设过程中尚面临组网、通信、能耗、成本等多重挑战,行业要“以网强算”,通过无处不在的网络资源,补齐单点算力规模不足的差距,夯实智算业务发展基础。本白皮书聚焦AI大模...

我来回答
分享至