GB200 NVL72的优势在哪?

GB200 NVL72的优势在哪?

最佳答案 匿名用户编辑于2024/07/04 14:34

GB200 NVL72系统推理性能大幅提升30倍。

英伟达在2024 GTC大会发布的GB200 NVL72系统展现出较强的推理性能;参考公司官网,GPT-MoE-1.8T模型推理, NVL72的单卡每秒吞吐量可以达到HGX H100的30倍。我们在此前发布报告《AI的 裂变时刻系列报告3:为什么H20的推理性价比高》中搭建了一个用于理论推算算力 系统推理能力的框架,并在《AI的裂变时刻系列报告6:为什么GB200 NVL72推理 性能相较于HGX H100提高30倍?》中进一步分析为何NVL72系统的推理能力有如 此显著的提升。 高速、支持互联GPU数量更多的第五代NvLink可以大幅缩减超大模型推理的跨服务 器通信时间。

NVL72中72张B200 GPU通过第五代NVLink互联,双向带宽可达 1800GB/s。对于万亿参数量模型,其参数所需显存空间可达1000GB以上(FP8精 度),叠加推理过程中KV Cache所需显存空间,会超出单台8卡AI服务器显存容量; 因此万亿参数量模型的推理通常要在多台服务器组成的算力系统中进行。多卡/多服 务器的算力系统中进行推理会涉及各类并行方式,如张量并行、流水线并行、专家 并行、数据并行等;其中张量并行、专家并行会带来较多的卡间通信需求;对于传 统的英伟达DGX服务器集群,服务器间GPU通过InfiniBand网络互联,带宽明显低 于NvLink网络带宽,使得服务器间通信耗时较长、明显影响推理效率。基于NvLink 全互联的NVL72在执行万亿参数量模型推理时卡间通信时间大幅缩减,提高了算力 利用率。

Blackwell GPU引入新的数据精度FP6/FP4,可提供更快的算力速度。Balckwell GPU配置的第二代Transformer引擎将新的微张量缩放支持和先进的动态范围管理算法 与TensorRT-LLM和NeMo Megatron框架结合,使Blackwell具备在FP4精度的AI推 理能力;在全新FP4精度下,Blackwell GPU的Tensor Core算力是其本身FP8精度 的算力的2倍,AI性能达到Hopper的5倍。同时,使用4位精度相较于8位精度,GPU 从HBM读取模型参数、KV Cache的速率大幅提升,提高了Decode阶段的速率。

其他关键升级点在于显存带宽/容量提升、更适合MoE并行的架构升级等。单颗B200 GPU配有8颗HBM3E显存,显存容量达到192GB,显存带宽达到8TB/s;升级后的 显存配置一方面加速Decode阶段显存读取效率;另一方面可以支持系统进行更大 Batch Size的推理,提高算力利用率。Blackwell GPU引入的第二代Transformer引 擎可以加速混合专家模型的推理,通过使用MoE模式有效降低了计算阶段的浮点运 算次数,缩短Prefill阶段的计算时间。

TCO是CSP等厂商的重要考虑因素。从提供云服务的CSP厂商的角度来讲,考虑整 体集群系统的计算效率、能耗关系,因此对产品和解决方案能否提供更好的TCO(总 体拥有成本;Total Cost of Ownership)较为关注。TCO结合算力租赁价格,计算 得出的ROI是数据中心的TCO问题是考虑是否建设新集群和建设集群大小的重要考 虑因素。复盘英伟达的产品升级思路来看,公司产品系列从单GPU芯片性能升级到 推出系统级解决方案平台,产品线也在朝着为客户降低数据中心的TCO的角度而升 级。

GB200 NVL72有利于降低AI集群功耗和TCO。根据2024 GTC大会,液冷GB200 NVL72机架可减少数据中心的碳足迹和能源消耗。液冷增加了计算密度,减少了占 地面积,并促进了与大型NVLink域架构的高带宽、低延迟GPU通信。与同规模H100 相比,GB200 NVL72的成本和能耗最多可降低25倍。过去,训练一个1.8万亿参数 的模型,需要8000个Hopper GPU和15MW的电力,在2万个Blackwell GPU(使用 GB200 NVL72,约278个Rack)就能完成这项工作,耗电量仅为4MW,即约为原有 功耗的1/4。

参考报告REPORT

电子行业2024年中期策略:AI的裂变时刻,算、连、存踏浪而行.pdf

电子行业2024年中期策略:AI的裂变时刻,算、连、存踏浪而行。AI的裂变时刻,英伟达GB200新产品周期开启。全球AI的裂变时刻,产业链日新月异百花齐放。ScalingLaw规模定律下,大模型参数量、数据、算力呈现指数级增长。英伟达的GPU产品为算力核心,在AI加速芯片市场一马当先。服务器ODM、PCB、网络交换机、存储等产业链核心环节龙头厂商踏浪而行,伴随大客户和终端需求共同成长。北美云厂商CAPEX持续上修,训练、推理需求驱动算力持续高增长。英伟达发布全新Blackwell架构GPU,GB200超级芯片大幅提升性能及能耗表现,开启新一轮产品周期。算力:GB200NVL72的TCO优势突出...

我来回答
分享至