英伟达GB200产品介绍

英伟达GB200产品介绍

最佳答案 匿名用户编辑于2024/07/18 16:13

以下内容都是根据相关报告总结的,如果有兴趣了解更多相关的内容,请下载原报告阅读。

单个 rack 内部包括 18 个 Compute tray(上 10 下 8)和 9 个 Switch tray,机柜内 Compute tray 和 Switch tray 之间通过 Copper Cable Cartridge 相连。通过液冷冷却 体系,相较 H100 的风冷基础设施,在相同的功耗下可以实现 25 倍的性能。

单个 Compute tray 包括 2 颗 GB200 Grace Blackwell Superchip、4 颗 Connectx800G Infiniband Supernic 及 1 颗 Bluefield-3 DPU。 1) GB200 Grace Blackwell Superchip 包含两颗 Blackwell GPU 和一颗 Grace CPU。 其中,单颗 Blackwell GPU 架构尺寸是上一代 Hopper GPU 的两倍,但 AI 性能 (FP4)是 Hopper 的 5 倍(单颗 Blackwell GPU AI 性能(FP8)约为 20petaFLOPS,8X24GB 的 HBM3e,8TB/s 的内存带宽),有 18 个 NVlink 端口 连接 18 颗 NVlink switch chip,实现 1.8TB/s 双向连接速度。 2) Connectx-800G Infiniband Supernic 可以实现端到端 800Gb/s 的网络连接和性 能隔离,专为高效管理多租户生成式 AI 云而设计,通过 PCIe 6.0 提供 800Gb/s 的数据吞吐量。ConnectX-8 Supernic 支持单端口 OSFP 224 和双端口 QSFP 112 连接器,支持 NVIDIA Socket Direct 16 通道辅助卡扩展。 3) Bluefield-3 DPU 可以通过 400Gb/s 以太网或 NDR 400Gb/s InfiniBand 网络 连接,以实现卸载、加速和隔离软件定义的网络、存储、安全和管理功能,从而 显著提高数据中心的性能、效率和安全性。

单个 Switch tray 包括 2 颗 NVlink Switch 芯片,单颗 Switch 芯片单颗芯片支持 4 接口、单接口 1.8TB/s 的传输速率。 每个 Switch tray 盘可提供 144 个 NVlink 端口(100GB),14.4TB/s 的总带宽。9 个 Switch tray 盘,可以提供 9*144=1296 个端口,完全连接 72 个 Blackwell GPU 上单 颗 18 个,共 72*18=1296 个 NVlink 端口。

机柜内连接方面,Compute tray 和 Switch tray 之间通过五代 NVlink 相连,五代 NVlink 双向带宽为 1.8 TB/s,是上一代的 2 倍,是 PCIe Gen5 带宽的 14 倍以上。 1.8TB/s 的 GPU-to-GPU 间通信,使得 AI 及高性能计算中 GPU 的扩展成为可能。 Compute tray 中 Superchip 内部 GPU 及 CPU 间通过 NVlink Chip-to-Chip 连接(双 向带宽 900GB/s)。

GPU=72 在现有硬件配置下,单台机柜内部通过 NVlink 即可实现 L1 层 switch tray 连接: 1) 铜缆为GB200机柜内首推方案。虽然GB200通过充分提升单芯片的算力密度、 应用散热效率更高的液冷方式,实现了在更小的空间内部署更多的 GPU 卡,使铜缆连接成为机柜内连接更具性价比的方案。但基于高速率长距离的传输损耗 问题,未来迭代节奏与应用的持续性仍有待观察。 GPU>72 在现有硬件配置下,单层网络已无法满足要求,需升级至更高层数网络结 构。有单一 NVlink、IB 组网: 1)当所需连接的 GPU 数量大于 72 小于 576 时,在 NVlink 单一组网的方案中,可 以使用架构为全 NVlink 连接的集群,GPU 和光模块的数量比例为 1:9。单机 柜的 NVL72 方案中的交换机已没有额外的接口进行更大规模的互联,根据推荐, 可扩展集群多采用双机柜 NVL72 方案,单个机柜有 18 个 Compute Tray、9 个 Switch Tray。与单机柜版本不同的是,双机柜版本 Computer Tray 仅一颗 Grace Blackwell Superchip(2 Blackwell GPU+1 Grace CPU)。Switch Tray 内容单双 机柜版本保持一致。36 颗 Blackwell GPU 充分连接 18 颗 NVswitch chip 共有 36*18=648 个 ports,构成 576 集群的为双排的 16 个机柜,则累计需连接的端 口为 648*16=10368 个 ports,单口单向速率为 50GB/s(双向速率 100GB/s)。

假设 L1 至 L2 层网络通过光模块且采用 1.6T 光模块(200GB/s),则共需要 10368*50/200*2=5184 个 1.6T 光模块,GPU:1.6T 光模块=576:5184=1:9。 2)当所需链接的GPU数量大于72时,在IB组网的方案中,若使用最新一代NVIDIA Quantum-X800 Q3400 交换机互联,根据端口数的不同,同样网络层数所能承 载的最多 GPU 数量不同,GPU 和光模块的比例略有区别。相较 NVIDIA Quantum-2 QM9700 仅有的 64 个 400G 的 ports 而言,最新一代 NVIDIA Quantum-X800 Q3400 交换机有 144 个 800G 的 ports,最多可以实现 (144^2)/2=10368 张 GPU 的互联。根据 SemiAnalysis 的预测,2 层网络架 构的 1.6t 光模块/GPU 的比例在 2.5 左右,3 层网络架构的 1.6t 光模块 /GPU 的比例在 3.5 左右。

参考报告REPORT

交换机行业研究:IB性能占优,以太网开放占优.pdf

交换机行业研究:IB性能占优,以太网开放占优。Scalinglaw下算力需求持续扩张,基础硬件端将充分受益。OpenAI的ScalingLaw下,模型有效性和计算约束正相关。因此在GPU能力一定的情况下,如何提高集群的线性加速比,满足低时延、大带宽、无阻塞的机间通信,从而降低多机多卡间数据同步的通信耗时,成为模型训练侧新的核心议题。根据英伟达的财报后电话会,黄仁勋认为推理需求在当下被极大低估。当下大模型企业把更多的精力都花在提升大模型智能水平,因此绝大部分算力都被用在于训练。但随着模型迭代逐步放缓及更多AI应用的落地,推理侧的需要也在快速增加。IB胜在性能、以太网优在开放,看好AI推动的量、速...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至