中科曙光在超大规模AI集群中的核心技术壁垒有哪些?

在当前AI大模型训练对算力集群规模要求日益提高的背景下,单纯依靠增加加速卡数量已无法满足性能需求,系统级的互联、存储及散热成为关键瓶颈。投资者关注中科曙光如何在十万卡级集群中保持高效稳定运行。

请结合报告内容,分析中科曙光在超节点互联、高速网络架构以及液冷散热等方面的具体技术布局,以及这些技术如何共同构成其在国产算力基础设施领域的竞争壁垒?特别是ScaleX640和scaleFabric技术在解决大规模集群通信延迟和带宽限制方面发挥了什么作用?

最佳答案 匿名用户编辑于2026/08/14 17:15

中科曙光在超大规模AI集群中的核心技术壁垒主要体现在“两光”协同下的全栈系统能力,具体涵盖超节点互联、高速网络架构及液冷散热三大维度。

首先,在超节点互联方面,公司推出的ScaleX640超节点通过超高速互联技术,将单机柜内的640张加速卡整合为一个高带宽、低时延的统一通信域。这种架构打破了传统服务器节点间的通信瓶颈,使得机柜内加速器能够像单一大芯片一样协同工作,显著提升了大规模模型训练中的并行效率和算力利用率。双ScaleX640超节点还可组成1280卡计算单元,配合液体冷凝换热装置,实现了高密度的紧耦合计算。

其次,在高速网络架构方面,公司自主研发的scaleFabric原生RDMA高速网络承担了超节点间的Scale-Out互联任务。该技术提供400Gb/s的端口带宽,端侧通信时延低于1微秒,并支持集群向十万卡以上规模线性扩展。配套的智能调度引擎能够管理万级节点和服务十万级用户,结合数字孪生和故障恢复机制,确保了超大规模集群在复杂负载下的稳定运行和高效资源调度。

最后,在液冷散热方面,随着机柜功率密度提升至数百千瓦,传统风冷已无法满足需求。中科曙光通过子公司曙光数创提供了冷板式、相变间接式和浸没相变式等全链条液冷解决方案。其C8000浸没液冷整机柜最高可支持单机柜功率超过900kW,相较传统风冷节能超过30%。液冷技术不仅解决了高热密度带来的散热难题,还降低了数据中心整体能耗,成为支撑高密度算力部署的基础设施刚需。

综上所述,中科曙光通过将ScaleX640超节点、scaleFabric高速网络与先进液冷技术深度融合,构建了从芯片到集群的全栈技术闭环。这种系统级协同能力使其能够有效解决万卡乃至十万卡集群中的通信、散热和调度难题,形成了区别于单一硬件供应商的显著竞争壁垒,为其承接国家级超大规模智算基础设施项目提供了坚实的技术支撑。

参考报告REPORT

中科曙光-603019-从高端计算到AI超集群,国产算力龙头加速进阶.pdf

全球人工智能大模型参数的指数级增长,正驱动算力基础设施从单点芯片突破向超大规模智算集群演进。在此背景下,中科曙光作为国产算力龙头,依托“曙光+海光”协同机制,构建了覆盖芯片、服务器、超节点、高速网络、存储及液冷的全栈产品体系,成为推动国产算力基础设施升级的核心力量。全栈协同与系统升级报告指出,国产算力已进入万卡级集群规模化部署阶段,系统性能约束扩展至卡间互联、存储带宽及散热管理。中科曙光通过与海光信息的深度协同,夯实了自主计算的芯片底座,并围绕处理器构建了服务器、超节点及集群管理平台。同时,子公司曙光数创提供的液冷基础设施,有效解决了高功率密度机柜的热管理难题,形成了“芯片-整机-集群-液冷”...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至