2025年CXL技术AI应用分析:内存扩展方案性能提升达4倍

  • 来源:其他
  • 发布时间:2025/10/11
  • 浏览次数:473
  • 举报
相关深度报告REPORTS

ODCC开放数据中心委员会:2025年基于CXL方案的AI应用优化与研究.pdf

ODCC开放数据中心委员会:2025年基于CXL方案的AI应用优化与研究。CXL(ComputeExpressLink)作为一种面向数据中心的高速互连技术标准,正在为AI应用的算力及存储瓶颈提供突破性解决方案。该技术基于PCIExpress5.0物理层构建,为AI计算提供高性能,高可靠性的数据传输。在AI训练与推理场景中,CXL技术能够显著降低跨设备数据传输延迟,通过统一内存池化管理解决GPU/TPU集群中的内存碎片问题,并为分布式模型训练提供高效的缓存一致性机制。当前,随着生成式AI、大语言模型等前沿技术的爆发式发展,AI应用对存储资源的需求呈现出指数级增长。以三星CMM-D、海力士CXLD...

CXL(Compute Express Link)作为新一代高速互连技术标准,正在重塑AI数据中心的架构范式。该技术基于PCIe 5.0物理层构建,通过内存扩展、内存共享和缓存一致性三大核心能力,为AI训练与推理场景提供突破性解决方案。随着生成式AI、大语言模型等技术的爆发式发展,AI应用对存储资源的需求呈现指数级增长,而CXL技术恰好能够解决GPU/TPU集群中的内存碎片问题,并为分布式模型训练提供高效的缓存一致性机制。当前,以三星CMM-D、海力士CXL DRAM为代表的CXL设备,正在成为构建高带宽、低延迟AI数据中心互连架构的关键组件。

一、CXL技术的核心优势与性能突破

CXL协议通过重构计算-存储互联范式,为下一代数据中心带来三大核心价值:性能突破、成本优化和架构弹性。在物理层,CXL基于PCIe 5.0技术构建,支持最高128 GT/s的传输速率,其带宽可达PCIe 4.0的两倍,有效缓解了传统I/O总线的传输瓶颈。更为重要的是,CXL通过直接互联架构消除传统I/O总线的时延瓶颈,结合CXL.cache协议实现跨设备缓存一致性,在典型AI推理场景中,其延迟可降低30%-50%,显著提升异构计算架构的响应效率。

CXL协议体系包含三个核心子协议:CXL.io作为基础协议层,支持CPU通过PCIe总线访问CXL设备;CXL.cache通过缓存一致性机制,允许外部设备维护与CPU缓存同步的本地副本;CXL.mem实现CPU对CXL设备内存的直接寻址,将外部设备内存扩展为系统主内存的逻辑延伸。这三种子协议的组合使得CXL能够定义三种设备模式,分别面向不同应用场景的需求。Type1模式适用于通过PCIe插槽连接的加速卡或扩展卡;Type2模式在Type1基础上集成CXL.cache协议,适用于高密度计算场景;Type3模式则专为内存扩展场景设计,通过CXL.mem将外部设备内存作为主内存扩展。

在实际性能表现方面,研究数据显示,当使用DMA(直接内存访问)时,CXL到GPU的性能与DRAM到GPU相当,而CXL到GPU结合DMA的性能明显优于DRAM到GPU未使用DMA的场景,性能提升达到1.6倍。在数据量超过16MB时,GPU到CXL结合DMA的内存带宽比GPU到DRAM结合DMA低8%,但比GPU到DRAM未使用DMA低6%。这些数据表明,在CXL与GPU之间传输数据时,CXL结合DMA能够提供低延迟的主机-设备通信,并显著扩展内存容量。

CXL技术的另一个重要优势体现在内存资源池化管理方面。借助CXL.mem协议,系统可将多台服务器的本地内存与CXL设备内存统一池化,通过智能调度算法实现动态内存分配。在多租户云计算环境或大规模AI训练集群中,该特性可将内存利用率提升至80%以上,较传统架构提升40%。这种内存池化技术不仅降低了硬件冗余配置需求,还支持从边缘计算到云端的多层级扩展,为构建高效、可扩展的下一代数据中心基础设施提供了关键技术路径。

二、CXL在MoE模型中的创新应用与性能验证

混合专家模型(Mixture of Experts, MoE)作为一种先进的神经网络架构,通过整合多个子模型的结果来提升整体模型性能。MoE将输入符元动态地路由到专家的子集,以选择最相关的专家来处理输入数据,从而提高计算效率和模型容量。然而,MoE模型面临严重的内存墙瓶颈,例如拥有2360亿个参数的DeepSeek-V2需要至少七个最先进的GPU(H100,每个具有80GB内存)才能进行推理,这限制了大型模型在资源受限环境中的部署。

针对这一挑战,研究人员提出了基于CXL的MoE卸载框架——MoE offload。该方案利用CMM-D的大容量来存储海量的模型卸载参数,并利用CMM-D的高带宽特性为MoE参数的传输提供高效的数据访问。MoE offload架构将专家模型参数存储在CXL中,并在GPU上进行推理计算,通过四种核心技术大幅提升性能:计算次序优化、I/O管理、流水线算法和基于预测的预取。其中,计算次序优化将共享专家的计算和路由专家的计算进行重新排序,在不增加计算时间的基础上增加传输时间;I/O管理通过设置不同的流处理计算和传输,使计算和传输在互不干扰的情况下进行;流水线算法确保不同传输流和计算流之间实现流水线式运行;基于预测的预取则通过预测算法提前预取下一层所需的专家模型参数。

在性能验证方面,实验使用配备两个Intel Xeon Platinum 8452Y处理器、128GB DRAM、128GB CMM-D和具有40GB内存的Nvidia A100 GPU的服务器,在WikiText数据集上进行测试。结果显示,MoE offload方案可以节省82%的GPU内存使用量(最大),并且当GPU内存减少55%时,性能损失仅为31%。这一成果表明,基于CXL的MoE卸载方案能够有效解决内存墙瓶颈问题,为大规模MoE模型在资源受限环境中的部署提供了可行路径。

DeepSeekMoE架构的创新之处在于引入了细粒度专家分割和共享专家隔离两种策略。细粒度专家分割在保持参数数量不变的情况下,通过分割FFN中间隐藏维度来将专家细粒度地分割,相应地在保持恒定计算成本的情况下激活更多细粒度的专家;共享专家隔离则隔离某些专家作为共享专家,这些专家始终处于激活状态,旨在捕获和巩固不同上下文中的通用知识。这些架构创新为训练参数高效的MoE语言模型提供了机会,其中每个专家都高度专业化,进一步提升了模型性能。

三、CXL在大型语言模型推理中的关键作用

大型语言模型(LLM)采用Transformer解码器架构,包括嵌入层、一系列顺序的Transformer层以及预测头。在推理过程中,LLM分为预填充阶段和解码阶段两个部分。预填充阶段以提示序列作为输入,为每个Transformer层生成键值缓存(Key-Value Cache, KV Cache);解码阶段则使用先前准备的KV缓存,并逐步生成标记。然而,KV缓存引入了线性复杂度的内存开销,当使用批次大小为1运行OPT-30B模型时,随着序列长度从1K增加到512K,KV张量所需的内存需求从1GB增加到672GB,甚至超过了模型权重的大小(约55GB)。

为了应对KV缓存日益增长的内存需求并降低数据传输延迟,研究人员提出了一种基于CXL的多层KV缓存系统。该系统利用CXL内存模块-DRAM(CMM-D)扩展GPU的高带宽内存(HBM)和CPU的动态随机存取内存(DRAM),用于存储不断增长的KV缓存。这一方案不仅提供了大容量内存,还显著降低了数据传输延迟。系统通过GPU直接内存访问(DMA)与CXL协议减少延迟,分配亲和性DRAM内存以保留当前层和下一层的KV缓存,并采用逐层预加载和异步卸载KV缓存,实现数据传输与计算的重叠。

KV选择模块是该方案的核心创新之一,通过驱逐不重要的KV缓存缓解数据传输和计算压力。该模块利用三类token参与注意力计算:近期token(输入序列中最近生成的token)、注意力沉点(保留初始token的KV缓存)和高注意力分数token(通过在每个解码步骤中统计并累加先前token的注意力分数计算得出)。实验数据显示,所有注意力块内的token累计注意力分数遵循幂律分布,这解释了生成过程中少数token具有关键性作用的现象。

在性能验证方面,使用LLaMA-7b模型和NVIDIA A100 40GB GPU在OpenBookQA数据集上进行测试。结果显示,即使减少标记使用量,准确性仍优于全缓存的基线。通过KV选择,能够使用更少的键值缓存实现更高的准确性,即使减少标记使用量,准确性仍优于全缓存(full cache)的基线。在吞吐量测试中,使用OPT-13B模型评估生成吞吐量,包括预填充阶段和生成阶段的所有加速结果。最终,该优化方法实现了21%的性能提升,并成功弥合了CMM-D与DRAM之间的性能差距,与基于旧DRAM的方案相比仍有7%的性能提升。

四、CXL在图神经网络训练中的革命性影响

图神经网络(GNN)是深度学习领域针对图结构数据设计的一类模型,旨在处理节点和边构成的非欧几里得数据。GNN通过信息聚合和特征变换实现模型训练,已在社交网络分析、化学与生物信息学、推荐系统、交通预测和知识图谱等多个领域取得突破性成果。然而,对于超大规模图数据,GPU显存无法完全存储所有的图数据,尤其是特征向量数据,这成为制约GNN训练效率的关键瓶颈。

基于CXL的GNN解决方案以三星CMM-D为依托,通过CMM-D来扩展内存,并结合针对CMM-D的方案优化,加速GNN的训练。该方案将图结构和Feature数据都放置到CMM-D上,由于CMM-D的访问延迟接近内存,在采样得到子图后,相应的Feature检索过程性能相比SSD有显著提升。更为重要的是,该方案结合UVA(Unified Virtual Addressing)技术,将CPU内存、CXL内存以及GPU内存统一起来让GPU可以直接访问所有地址,无需连续地址的copy,而是将内存地址映射为GPU可见的统一地址,使检索到的Feature数据可以直接预取到GPU。

基于DGL开发的GraphSAGE GNN模型的CMM-D方案包含多个核心模块:DGL Dataloader负责将每个batch的特征数据准备好;Fetch Features模块执行采样和聚合任务;Mem. Allocation模块在CMM-D内存中分配空间保存全部图的结构数据和特征数据;Index Select模块从大量特征数据中找出下一个batch所需要的数据索引;NUMA Allocation模块修改Pytorch框架的内存分配策略。这些模块的协同工作使得CMM-D GNN方案能够实现高效的数据预处理和传输。

在性能测试中,使用配备两个Intel Xeon Gold 6430处理器、256 GB DRAM、128GB CMM-D和具有80GB内存的NVIDIA A100 GPU的服务器,在ogbn-papers100M数据集上进行评估。ogbn-papers100M包含约1.1亿个论文节点、约16亿条引用边,每个节点有768维的稠密向量特征。实验结果显示,CMM-D GNN方案相比原始DRAM方案提升了约2.5倍的效率,相比SSD方案提升了约4倍的效率,大大减少了GNN训练所需的时间。

进一步分析训练过程的子任务细分时间发现,在取数据的部分中,CMM-D GNN方案相比DRAM方案提升了约1.38倍的效率,相比SSD方案提升了约8倍的效率。这一数据充分证明了CXL技术在优化GNN训练数据访问效率方面的显著优势,通过降低GPU等待时间,大幅提升训练效率。这种性能提升对于处理超大规模图数据具有重要意义,为GNN在更复杂场景中的应用奠定了基础。

以上就是关于CXL技术AI应用的分析,从性能测试结果来看,CXL在MoE模型、大型语言模型和图神经网络等AI场景中均展现出显著优势。通过内存扩展、内存共享和缓存一致性三大核心能力,CXL技术有效解决了AI应用中的内存墙瓶颈和数据传输延迟问题。随着CXL 3.0等新一代协议的推进,CXL技术将在内存带宽扩展、分布式存储优化、AI算力调度等领域持续释放潜力,为构建下一代高效、弹性的数据中心基础设施提供关键技术支撑。未来,CXL与AI技术的深度融合将进一步推动计算架构从"设备中心"向"数据流中心"演进,为AI应用的发展开辟新的可能性。

编辑:666知识控
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至