超节点架构中Scale-Up与Scale-Out网络如何分工,主流互联协议有哪些差异?

在研究大规模AI算力集群建设时,发现超节点架构被频繁提及。报告指出智算网络围绕Scale-Up、Scale-Out、Scale-Across三大模式协同演进。

请问在实际的大模型训推场景中,Scale-Up和Scale-Out网络各自承担怎样的分工?两者在时延目标和物理层设计上有什么具体区别?此外,目前行业内除了英伟达的NVLink,还有哪些主流的Scale-Up互联协议,它们在技术路线和开放程度上有何不同?

最佳答案 匿名用户编辑于2026/09/19 09:53

在超节点架构中,Scale-Up与Scale-Out网络有着明确的分工与不同的技术指标要求。

从分工与时延目标来看,Scale-Up的主要目标是在高带宽域内聚合更多加速器与显存,负责承载张量并行(TP)和专家并行(EP)这类强耦合通信,将其尽量收敛在超节点内。其典型规模通常在千卡级以内,时延目标极为苛刻,要求达到百纳秒(ns)到亚微秒(us)级。Scale-Out的主要目标则是将多个节点或多个超节点继续横向扩展,处理流水并行(PP)和数据并行(DP)这类相对松耦合的通信,将其释放到更大规模的集群网络中。其典型规模为万卡以上的集群级到园区级,时延目标为数微秒到数十微秒级。

在物理层与传输机制上,Scale-Up的物理层包含但不限于以太网PHY,更注重延时与编码复杂度的平衡;数据链路层基于ID查表路由,优化帧头开销(6–16B)或自定义格式,且无链路层重传;传输层则没有复杂的控制协议。相比之下,Scale-Out采用标准以太网物理层,基于地址学习转发,标准帧头开销大,依赖复杂传输控制协议(TCP/IP)并由网卡完成重排序。

关于主流的Scale-Up互联协议,当前技术路线沿总线类、以太类、专有互联等多个维度并行发展:

第一类是私有域总线型协议。最典型的代表是英伟达的NVLink,采用私有SerDes和自定义Flit,支持内存语义,单层组网规模最高可达576卡。此外还有AMD主导的Infinity Fabric以及华为的UB灵衢协议,华为灵衢支持内存/消息语义,能够实现多层万卡级组网。

第二类是基于开放标准的协议。例如UALink,由AMD、Intel、AWS、谷歌等共同推进,可使用以太网PHY或PCIe PHY,支持内存语义,单层组网规模最高1024卡。阿里云与信通院推进的ALS协议同样兼容UALink,但支持多层2000卡规模。

第三类是开放以太协议。博通提出的SUE(Scale Up Ethernet)旨在利用以太网生态构建Scale-Up互联,支持端到端重传;腾讯与信通院推进的Eth-X、字节跳动的Ether-Link等也属于此类,它们主要基于标准以太网PHY进行定制优化,以满足超节点内部的高带宽需求。

参考报告REPORT

计算机行业超节点OEM系列专题:超节点研究框架.pdf

大模型参数规模的急剧扩张使传统服务器集群在训练与推理环节遭遇严重的通信与显存瓶颈,超节点架构由此成为重构智算底座的关键技术路径。国海证券本篇专题报告系统性拆解了超节点的技术解决路径、海外标杆平台的全栈架构,并对国产超节点的产业周期与市场空间进行了深度研判。核心技术路径与网络架构训练端MoE模型的高频All-to-All通信与推理端KVCache的膨胀,导致传统集群算力利用率偏低。超节点通过高速互联协议将数十至数百个AI芯片整合为逻辑上统一编址的协同计算系统。智算网络正围绕Scale-Up、Scale-Out、Scale-Across三大模式协同演进。其中Scale-Up聚焦柜内百纳秒级低时延互...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至