CXL内存扩展技术如何解决AI推理中的KV Cache瓶颈?

AI大模型推理过程中,键值缓存(KV Cache)的内存需求极高,成为制约推理效率的关键瓶颈。传统方案依赖GPU上的HBM提供快速访问,但容量有限;扩展至CPU DRAM又受内存通道数量限制。CXL作为一种新兴的高速互连技术,被业界视为突破这一"内存墙"的重要路径。

请结合具体技术方案和实测数据,分析CXL内存扩展在AI推理KV Cache场景中的技术原理、性能表现及相较RDMA方案的优势。

最佳答案 匿名用户编辑于2026/07/30 10:26

CXL内存扩展通过PCIe/CXL链路为CPU系统额外增加可访问的内存带宽和容量,在内存带宽受限的HPC/AI负载中提升整体性能。据相关研究,利用八个CXL E3.S设备在Intel Xeon 6处理器上进行实验,通过软件页面级交错机制使DDR5与CXL内存节点协同工作,实验结果显示只读带宽提高24%,混合读/写带宽提高39%,HPC和AI工作负载性能加速的几何平均值为24%。

在AI推理KV Cache场景中,CXL技术具备多项突破性优势。Astera Labs提出的Leo CXL内存方案可实现高效的GPU卸载,CXL-CPU互连在数据传输方面表现与CPU-GPU相当,KV缓存可以高效地从GPU内存中卸载至CXL内存;同时实现吞吐量提升与稳定性能,显著降低基础设施成本,并使系统能够支持每台服务器多2倍并发LLM实例。

相较基于RDMA的分散内存池方案,CXL架构展现出明显优势。学术研究显示,当前系统采用RDMA方案面临高访问延迟、复杂通信协议和同步开销等挑战。Beluga内存架构使GPU和CPU能够通过CXL交换机访问共享的大规模内存池,通过支持CXL结构上的原生加载/存储访问语义,提供近乎本地的内存延迟,同时降低编程复杂度并最大限度减少同步开销。与基于RDMA的解决方案相比,该方案在vLLM中实现了首次令牌时间大幅减少,吞吐量提高超过7倍。

CXL 3.0进一步引入内存共享概念,使用硬件一致性使连接CXL的内存能够在主机之间实现一致共享,允许多个主机同时访问给定内存区域并确保每个主机看到最新数据,无需软件管理的协调,为构建通过共享内存结构解决大型问题的机器集群奠定基础。

参考报告REPORT

计算机行业深度报告:高速互联协议与硬件,从“配套件”到“第二算力”——AI算力“卖水人”专题系列(10).pdf

研究背景与目的本报告为AI算力"卖水人"专题系列第十篇,系统解决计算机高速互联的五个层级划分及不同企业所处层级定位问题,分析从"配套件"向"第二算力"演进的技术路径与市场机遇。核心内容框架报告构建五层互联体系:第一层片上网络NoC,解决芯片内部数据调度,涉及Arteris、Arm等IP厂商;第二层封装内Chiplet互联,涵盖台积电SoIC、英特尔Foveros/EMIB、UCIe协议及英伟达NV-HBI、AMDInfinityFabric等定制方案;第三层PCIe/CXL,PCIe作为服务器内部I/O底座,Retimer与Switch为关键组件,CXL面向内存扩展与资源组合;第四层Scale...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至