计算机行业超节点:大集群算力之基,国产互联启新篇
- 来源:兴业证券
- 发布时间:2026/09/09
- 浏览次数:19
- 举报
计算机行业超节点:大集群算力之基,国产互联启新篇.pdf
全球AI大模型参数规模的指数级增长正驱动算力基础设施发生深刻变革,计算模式已由单芯片计算全面转向多芯片协同计算,互联效率取代单点算力成为决定集群性能的核心变量。研究背景与核心痛点随着AI基础设施由单机、单柜向机架级超节点和跨机架集群演进,GPU之间需要持续进行参数同步、梯度交换以及中间数据传输。在千卡以上AI训练集群中,GPU高达32%的运算周期用于跨节点通信,拥塞场景下模型浮点利用率(MFU)仅为35%至40%。互联带宽、通信时延以及网络调度能力已成为影响集群算力利用率的关键瓶颈。分层互联架构与技术路线报告系统梳理了AI集群的分层互联架构。Scale-up层面,主要通过PCIe、CXL、NV...
随着大模型参数规模持续增长以及训练推理任务复杂度不断提升,AI基础设施正经历由单机、单柜向超节点和大规模集群的结构性演进。计算模式逐步由单芯片计算转向多芯片协同计算,在大规模AI集群中,GPU之间需要持续进行参数同步、梯度交换以及中间数据传输。计算节点数量的增加使通信开销占比不断提升,互联带宽、通信时延以及网络调度能力已成为影响集群算力利用率的重要因素。AI基础设施的竞争焦点正由单芯片性能竞争全面转向系统级协同效率竞争。
集群规模扩张与互联效率的核心变量
当前,AI模型及相关工作负载的规模和复杂度持续提升,单一计算节点的算力、内存容量和数据吞吐成为大规模训推的关键约束。随着集群规模扩大,模型参数与梯度在加速芯片与计算节点间频繁传输,通信量随并行规模呈指数级增长。在千卡以上的AI训练集群中,GPU高达32%的运算周期用于跨节点通信,拥塞场景下模型浮点利用率(MFU)仅为35%至40%。在大集群场景下,互联通信效率已成为决定实际性能表现的关键变量。
面向不同计算扩展需求,AI集群形成了Scale-up与Scale-out相结合的分层互联架构。Scale-up主要解决服务器或机柜内部计算资源扩展问题,通过PCIe、CXL、NVLink、Infinity Fabric等技术实现CPU、GPU及AI加速芯片之间的高速互联,提升多芯协同计算能力;Scale-out则面向跨服务器、跨机柜集群扩展,通过InfiniBand、RoCE等网络技术连接大规模计算节点,实现计算资源的横向扩展。不同互联技术围绕通用I/O、异构资源共享、多芯协同以及集群通信等场景形成互补,共同支撑大规模AI训练与推理任务。
Scale-up互联:单节点内部多类型技术破解拥塞瓶颈
当前AI服务器和超节点架构中的Scale-up互联已形成多条技术路线,包括PCIe、CXL、NVLink/NVSwitch、Infinity Fabric(AMD)以及国产UB、HSL、MLU-Link等方案。不同方案并非简单替代关系,而是针对不同层级计算需求形成互补。
PCIe作为服务器内部广泛应用的通用I/O互联技术,主要用于连接主板与GPU、网卡、SSD等各种高速设备。当前新一代AI服务器普遍采用PCIe 5.0接口,单通道带宽32GB/s;PCIe 6.0提至64GT/s并引入PAM4与Flit编码。2025年6月,PCI-SIG发布PCIe 7.0规范,数据传输速率提升至128GT/s,在x16配置下双向带宽最高达到512GB/s。然而,随着GPU计算需求和多GPU协同规模持续提升,数据交换规模快速增长,PCIe在多GPU场景下面临带宽竞争和通信延迟增加等问题,逐渐难以满足大模型训练场景下GPU间高频数据交换需求。
CXL基于PCIe物理层构建,在PCIe协议基础上引入缓存一致性功能,通过CXL.io、CXL.cache和CXL.memory实现设备I/O访问、缓存一致性通信和内存扩展等能力。CXL 3.0引入多点对多点fabric能力,支持多个CPU共享同一个内存池;CXL 4.0于2025年发布,接口速率由64GT/s提升至128GT/s,新增捆绑端口功能并增强内存RAS特性。目前CXL已逐步进入服务器和云计算基础设施应用阶段。
NVLink是NVIDIA为GPU设计的高速互连技术,用于解决多GPU以及GPU与CPU通信中的PCIe带宽限制。目前第六代NVLink为单颗GPU提供3.6TB/s带宽,是PCIe Gen6的14倍以上;由NVSwitch连接后,72颗GPU组成的机柜级互联域可实现约260TB/s聚合带宽。该网络主要服务于张量并行、专家并行等需要频繁交换参数和中间结果的场景,并推动Scale-up由服务器内多卡扩展至机柜级系统。
Scale-out互联:节点间高速网络支撑集群横向扩展
Scale-out连接不同服务器、机柜以及数据中心内的多个计算节点,将分散的GPU资源扩展为统一计算集群。当集群规模扩容至十万级GPU时,单次训练迭代的数据传输量可达PB级别。目前,AI集群Scale-out网络主要基于RDMA技术实现,形成以InfiniBand为代表的专用高性能网络,以及基于开放以太网体系演进的RoCE方案。RDMA通过绕过CPU实现服务器间直接内存访问,降低数据传输开销,凭借高吞吐、低时延特点成为大规模AI训练集群的重要互联技术。
InfiniBand原生支持RDMA,专为高性能计算和低延迟通信场景设计,具有极高的吞吐量和极低的延迟。TOP500高性能计算系统中约60%采用InfiniBand网络架构。英伟达InfiniBand产品正由NDR 400Gb/s向800Gb/s持续演进,下一代Quantum-X800平台支持端到端800Gb/s网络连接,通过自适应路由、拥塞控制和遥测等机制优化大规模集群通信,面向万亿参数规模AI模型训练与推理场景设计。
RoCE在传统以太网基础上引入RDMA能力,允许应用通过以太网实现远程内存访问。相较于InfiniBand,RoCE可兼容现有数据中心网络设备和运维体系,具备更强的部署灵活性,其单位带宽成本及交换机成本整体更低。但以太网本身并非为高性能计算设计,在超大规模集群场景下,拥塞控制、无损传输和扩展性仍存在一定短板。
国产化生态:构筑自主互联体系与多路线并行精进
在高端AI互联领域,InfiniBand长期主要由NVIDIA旗下Mellanox主导,形成了从网卡、交换机到软件生态的完整体系。受海外供应链限制影响,国内厂商获取高端InfiniBand产品和构建完整生态存在一定约束。面对大规模AI基础设施建设需求,国内厂商一方面基于开放以太网体系发展RoCE方案,另一方面加快布局自主高速互联技术。
在Scale-up方向,华为面向AI超节点发布灵衢(UnifiedBus,UB)全栈自研互联协议,跳出PCIe、NVLink、以太网各自分立的传统技术路线,将内存访问、I/O交互、异构芯片通信统一纳入单一协议栈。UB Link物理链路支持百纳秒级同步内存访问,同时兼备UBoE跨域互通能力,可与传统以太网及现有数据中心网络兼容,并支持多UB Domain跨域组网,为10万卡规模超大规模集群提供互联基础。海光信息推出HSL高速互联协议,面向CPU与DCU异构计算场景;阿里云自研ICN Switch互联芯片;中国移动牵头推进OISA全向智感互联协议体系;寒武纪推出MLU-Link多芯互联技术,实现多MLU芯片之间高速互联。
在Scale-out方向,中科曙光推出了scaleFabric智算网络体系,这是首款国产InfiniBand原生无损RDMA高速网络。scaleFabric自研核心SerDes IP、交换与网卡芯片、硬件设备及管理软件,实现单端口带宽400Gbps,整机双向交换容量64Tbps,转发时延260纳秒。实测数据显示,搭载scaleFabric的AI集群训练效率提升40%以上,端口密度与综合性能较同类产品提升25%,可支撑十万卡级超大规模集群稳定组网。此外,华为推出星河AI Fabric 2.0方案,新华三基于DDC架构推出无损网络解决方案,锐捷网络推出AI-Fabric及AI-FlexiForce智算中心网络解决方案,共同推动国产智算集群互联方案的发展。
产业链投资逻辑梳理
伴随着AI集群的扩容,Scale-up和Scale-out的互联同步发展,产业链相关环节迎来重要发展机遇。建议关注具备自研互联协议的GPU公司的超额发展能力,互联结构中的核心增量Switch芯片,提供超节点代工的服务器厂商以及算力服务商。具体标的方面,GPU环节涵盖海光信息、寒武纪、摩尔线程、沐曦股份、壁仞科技、天数智芯、英伟达、AMD;互联环节涵盖博通、盛科通信、澜起科技;服务器环节涵盖浪潮信息、紫光股份、中科曙光、工业富联;算力服务环节涵盖宝信软件、神州数码、软通动力、优刻得、金山云等企业。随着国产AI芯片、服务器及智算中心建设加速,互联环节有望成为算力基础设施升级的重要方向。
编辑:流星雨- 相关标签
- 相关专题
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 5 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 9 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 10 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 1 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 2 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 3 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 4 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 5 房地产行业专题报告:城市更新推动高质量发展.pdf
- 6 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 7 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 8 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 9 中国汽车工业协会-汽车行业:2025中国汽车后市场年度发展报告.pdf
- 10 育娲人口智库:中国百年历史人口报告2026.pdf
- 1 育娲人口智库:中国百年历史人口报告2026.pdf
- 2 九思行研:2026年中国液流电池行业发展现状与前景分析报告.pdf
- 3 全国OPC发展观察报告2026-新华社中国经济信息社.pdf
- 4 消费再卷县域烟火气里掘金-2026县域经济消费报告-尼尔森IQ.pdf
- 5 2026抗体偶联药物行业图谱-清华五道口.pdf
- 6 清华大学:2026算法推动下新大众文艺发展研究报告.pdf
- 7 九思行研:2026年中国商业航天发展现状与趋势展望报告.pdf
- 8 高聘人才智库抢占AI新生代-2026年名校生求职招聘洞察报告-陌陌.pdf
- 9 绿色算力发展研究报告2026-中国信通院.pdf
- 10 Token技术产业链经济-从本质到出海的深度研究报告2026-模智空间.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 6 2026年春季港股及海外中资股投资策略:分化与回归
- 7 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 1 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 2 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 3 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 4 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 5 2026年7月A股回调归因与底部布局策略分析
- 6 恒生科技指数2026年6月复盘及7月走势展望
- 7 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 8 2026年上半年小红书六大热门行业消费趋势洞察
- 9 2026上半年小红书六大热门行业消费数据洞察
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
