国产算力集群在Scale-up和Scale-out两个维度分别有哪些代表性的自主互联技术方案?

在海外高端互联产品供应受限的背景下,国内算力基础设施建设对自主互联技术的需求日益迫切。针对AI集群内部的Scale-up互联以及跨节点的Scale-out互联,国内主流芯片厂商和网络设备厂商分别推出了哪些具体的互联协议或网络架构?这些国产方案在技术指标和实际落地应用上取得了哪些进展?

最佳答案 匿名用户编辑于2026/09/09 11:21

在高端AI互联领域,国内厂商围绕自主算力体系加快互联布局,逐步形成覆盖芯片互联、超节点扩展和集群组网的多层次方案。

在Scale-up方向,国内厂商围绕多芯协同和超节点架构展开探索。华为面向AI超节点发布了灵衢(UnifiedBus,UB)全栈自研互联协议,将内存访问、I/O交互、异构芯片通信统一纳入单一协议栈。UB Link物理链路支持百纳秒级同步内存访问,并支持多UB Domain跨域组网,为10万卡规模超大规模集群提供互联基础,已成为昇腾Atlas超节点系列的标配底层总线。海光信息推出了HSL高速互联协议,面向CPU与DCU异构计算场景,提升处理器与加速器之间的数据交换效率。阿里云自研了ICN Switch互联芯片,面向AI超节点架构实现多加速芯片高速互联。中国移动牵头推进OISA全向智感互联协议体系,支持AI芯片之间及AI芯片与CPU之间的高速互联。寒武纪则推出了MLU-Link多芯互联技术,实现多MLU芯片之间高速互联,提升多芯多卡训练和推理任务的通信效率。

在Scale-out方向,国内厂商围绕AI智算网络持续布局。中科曙光推出了scaleFabric智算网络体系,这是首款国产InfiniBand原生无损RDMA高速网络。该方案自研核心SerDes IP、交换与网卡芯片等,实现单端口带宽400Gbps,整机双向交换容量64Tbps,转发时延260纳秒。实测数据显示,搭载scaleFabric的AI集群训练效率提升40%以上,端口密度与综合性能较同类产品提升25%,可支撑十万卡级超大规模集群稳定组网。华为推出了星河AI Fabric 2.0方案,基于AI大脑、AI联接、AI网元三层架构打造数据中心网络。新华三基于DDC架构推出无损网络解决方案,采用信元交换机制优化流量均衡。锐捷网络推出了AI-Fabric及AI-FlexiForce智算中心网络解决方案,针对大数据处理、机器学习等多类AI业务场景进行网络优化,提升AI算力集群的互联效率。

参考报告REPORT

计算机行业超节点:大集群算力之基,国产互联启新篇.pdf

全球AI大模型参数规模的指数级增长正驱动算力基础设施发生深刻变革,计算模式已由单芯片计算全面转向多芯片协同计算,互联效率取代单点算力成为决定集群性能的核心变量。研究背景与核心痛点随着AI基础设施由单机、单柜向机架级超节点和跨机架集群演进,GPU之间需要持续进行参数同步、梯度交换以及中间数据传输。在千卡以上AI训练集群中,GPU高达32%的运算周期用于跨节点通信,拥塞场景下模型浮点利用率(MFU)仅为35%至40%。互联带宽、通信时延以及网络调度能力已成为影响集群算力利用率的关键瓶颈。分层互联架构与技术路线报告系统梳理了AI集群的分层互联架构。Scale-up层面,主要通过PCIe、CXL、NV...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至