2026年电子行业:CXL方案优化AI存储架构,头部厂商有望加速应用

  • 来源:东方证券
  • 发布时间:2026/03/18
  • 浏览次数:254
  • 举报
相关深度报告REPORTS

电子行业:CXL方案优化AI存储架构,头部厂商有望加速应用.pdf

电子行业:CXL方案优化AI存储架构,头部厂商有望加速应用。CXL方案可优化存储系统效率,未来AI存储架构有望重塑。部分投资者仍然低估了AI推理对内存容量扩展及存储架构优化的需求。我们认为,CXL内存池化方案能显著优化存储系统效率,未来AI算力设施中的内存硬件构成有望重塑。CXL(ComputeExpressLink)内存池化方案支持跨CPU、GPU及其他计算加速器的内存资源进行统一寻址、统一调度与透明访问,实现内存资源的整合与统一调度,从而支撑更大规模、更高并发的大模型训练与推理任务。从容量需求来看,AI推理过程中上下文缓存、模型权重等数据存储需求不断提升,而当前服务器内存提升受到插槽数量与...

CXL 方案优化存储效率,适应 AI 推理需求

1.1 CXL 方案有助于扩展内存容量,优化存储架构

已有的 AI 算力设施内存架构存在容量有限、效率受限等问题。从容量需求来看,AI 推理过程中 上下文缓存、模型权重等数据存储需求不断提升,而当前服务器内存提升受到插槽数量与单根内 存条的容量制约。此外,当前存储架构存在调度低效等问题,模型参数和激活值需要频繁从 HBM 迁移到 DRAM 再到 SSD,由于带宽差异显著且缺乏统一内存语义的底层直连协议,容易导致延 迟放大、链路带宽浪费以及吞吐率下降;不同任务对计算资源与内存资源的侧重差异大,现有静 态分配资源的方案也可能会导致算力浪费或内存瓶颈问题。整体来看,已有的 AI 算力设施存储架 构存在容量有限、效率受限等问题。

CXL 内存池化方案可实现内存资源的整合与统一调度。CXL(Compute Express Link)内存池化 方案支持跨 CPU、GPU 及其他计算加速器的内存资源进行统一寻址、统一调度与透明访问,在 具体硬件实现上,企业级服务器可通过 PCIe 5.0/CXL 链路连接到 CXL Switch,进而与池化的内 存资源相连。这一方案可实现内存资源的整合与统一调度,从而支撑更大规模、更高并发的大模 型训练与推理任务。

CXL 方案有助于存储分层,优化存储架构。根据 Smart Modular ,CXL 内存的访问延迟约为 200ns,虽高于直接附载的 DRAM(约 100ns),但远低于最快的 NVMe SSD(微秒级)和 HDD (毫秒级)。从内存与存储的层级架构来看,CXL 内存池的引入,在 DRAM 与 SSD 之间创造了 一个新的性能层级,有望作为一种高性能、可扩展的容量层,优化存储架构。

CXL 内存池化技术进一步演进,可实现 GPU 对 CXL 内存池的直接访问。 目前,已有技术可实现 GPU 对 CXL 内存池的直接访问。根据 CXL 官网,XConn Technologies(于 2026 年 1 月被 Marvell 收购)介绍了其 Ultra IO Transformer 技术方案,使 GPU 和 DPU 能够绕过 CPU 直接访 问由 CXL 协议管理的池化内存资源。当前多数 GPU/加速器本身不支持 CXL 协议,而传统通过 CPU 间接访问的方式存在效率瓶颈。这一创新架构的核心价值在于,它使 GPU 直接、高效地利 用远端可扩展的 CXL 内存池,从而在硬件层面缓解 AI 算力面临的内存容量与带宽约束。

1.2 CXL 方案持续创新,进一步适配 AI 推理需求

三星推出 CMM-H 混合存储 CXL 模组,将 DRAM 内存和 NAND 闪存相结合。三星 CMM-H 作为 基于 CXL 协议的创新混合内存方案,将 DRAM 内存和 NAND 闪存相结合,利用 DRAM 提供内存 级的访问速度,保障关键数据与 KVCache 的高速存取,同时借助 NAND 显著扩展存储空间,以 更低成本承载海量模型参数与历史状态。展望未来,基于 CXL 协议的类似的混合内存设计有望为 AI 推理等场景进一步提供兼具大容量、高性能与数据持久性的灵活解决方案。

KIMI 提出 MoonCake Store 技术,借助分布式 KV Cache 存储池降低推理成本。AI 推理中 KV Cache 占据很大的存储空间。面向大规模线上推理场景中 KV Cache 复用、管理、调度的问题, KIMI 提出了 MoonCake Store 技术。MoonCake 借助分布式系统优化的手段,将基于 PD 分离架 构的 GPU 集群的 CPU、DRAM、SSD 和 RDMA 资源分组组成分布式 KV Cache 存储池,KV Cache 也是分块以 Page 方式管理。借助这种分布式 KV Cache 存储池,MoonCake 能够充分利 用计算集群的存储资源,在满足用户 SLO 的条件下,减少了 GPU 的显存负担,从而显著提升了 有效请求处理容积,降低了在线推理的 per token 的成本。

浪潮元脑服务器操作系统 KOS 推出 KV Cache 管理系统 MantaKV,提升模型推理效率。 MantaKV 基于 CXL 内存池化技术,采用 Prefill 阶段与 Decode 阶段解耦方式。该系统将 P 节点产 生的海量 KV Cache 集中存储在 CXL 池化共享内存中,既直接供 D 节点解码使用(无需再次传 输),又自然成为全局可用的持久缓存(无需卸载至 P 节点本地 SSD),将两次独立搬运合并为 单次写入,以解决传输冗余问题。

北大联合阿里云首次提出基于 CXL 的 Engram 内存池化架构。2026 年 3 月北京大学联合阿里云 等首次提出使用 CXL 内存池来存储 Engram。与 RDMA 相比,CXL 能够提供 Engram 所需的最 小化且离散的检索模式要求的细粒度和低延迟访问。研究团队将基于 CXL 的 Engram 内存池集成 到 SGLang 框架中,实现了接近本地 DRAM 的端到端性能。这为未来集成 Engram 的大型语言 模型提供了一种可扩展且具有成本效益的存储解决方案。

1.3 CXL 方案有望以存储效率优化提高经济效益

CXL 技术通过优化内存配置,有望显著降低数据中心系统总拥有成本(TCO)。CXL协会的报告 展示了以单路 4TB 内存配置为例传统方案与引入 CXL 方案的成本差异的量化对比。在具体配置上,传统方案需使用 16 条高成本的 256GB 大容量 DIMM,而 CXL 方案则采用“16 条 128GB 本 地 DIMM + 16 条 128GB CXL 附加 DIMM”的组合。从成本结构来看,256GB DIMM 因需要堆叠 更多 DRAM 芯片而存在较高的价格溢价,而 CXL 附加卡提供了更多的内存通道,使得系统能够 使用单价更低的 128GB DIMM 来达到相同的总容量。根据英特尔基于 2025 年预测价格的模型测 算,此 CXL 配置方案可带来约 16%的 TCO 节省。根据 ABI Research,在 8192GB 的 DRAM 配 置下,采用双路服务器+CXL DRAM 的方案,其总系统成本明显低于传统的四路服务器纯插槽 DRAM 方案。

CXL 相关软硬件逐步完善,头部厂商推进应用

2.1 CXL 相关软硬件逐步完善成熟

CXL 规范升级,传输性能持续提升。CXL 规范传输速率从初代的 32 GT/s 持续增长,至 2024 年 发布的 CXL 3.0 已达 64 GT/s,而 2025 年推出的 CXL 4.0 将进一步推高至 128 GT/s。同时其架 构与功能不断扩展,从早期支持设备直连,到 CXL 2.0 引入内存池化与交换能力,再到 CXL 3.0 实现基于 Fabric 的灵活组网,在 CXL 4.0 中演进为多级交换与动态设备管理。

SK 海力士已完成基于 CXL 2.0 的 DDR5 客户验证。SK 海力士成功完成 CMM(CXL Memory Module)- DDR5 96GB 产品的客户验证,是基于 CXL 2.0 标准的 DRAM 解决方案产品。SK 海力 士表示将此产品应用于服务器系统,相较于现有的 DDR5 模组,其容量增长了 50%,宽带扩展了 30%,可处理每秒最多 36GB 的数据。该产品有望显著降低客户在构建并运营数据中心时所需的 总体拥有成本。

2.2 头部厂商加速推进 CXL 方案布局

CXL 联盟参与者包括英伟达、谷歌、三星等众多科技巨头。 根据 CXL 协会,CXL 联盟参与者目 前已汇聚超过 280 家成员公司,构成极具影响力的产业联盟,核心成员涵盖了谷歌、微软、Meta、 阿里巴巴等云计算巨头、英伟达、英特尔、AMD 等核心芯片供应商以及三星、SK 海力士等头部 存储厂商。头部厂商的参与有望加速 CXL 技术从标准制定、产品研发到最终大规模商用的全过程。

英伟达收购Enfabrica的核心团队和技术授权,有望持续推动CXL技术生态布局。英伟达于2025 年 9 月宣布收购 AI 硬件公司 Enfabrica 的核心技术与团队,整合其内存池化技术。该公司的技术 核心是加速计算结构(ACF)与弹性内存架构,其 ACF-S 超级网卡芯片整合 PCIe/CXL 交换与以太网RDMA功能,支持10万级GPU互联;ACF-S 芯片的CXL内存池解决方案,通过共享 DDR5 内存缓解 GPU 高带宽内存(HBM)瓶颈。展望未来,英伟达有望持续推动 CXL 技术生态布局。 根据英伟达官网,英伟达 Vera CPU 支持 CXL 协议。

阿里云推出全球首款基于 CXL 2.0 Switch 技术的 PolarDB 数据库专用服务器。在 2025 年云栖 大会上,阿里云宣布推出全球首款基于 CXL 2.0 Switch 技术的 PolarDB 数据库专用服务器。该服 务器通过 CXL 高速互连技术构建分布式内存池,实现百纳秒级延迟、数 TB/s 带宽的远程内存访 问,使内存资源得以池化共享、按需调度。

浪潮信息推出元脑服务器 CXL内存扩展方案。2025年12月,浪潮信息推出 CXL内存扩展方案, 该方案结合元脑服务器操作系统 KOS 的池化内存优化策略,将本地 DRAM 与 CXL 扩展内存融合 为统一逻辑空间,通过智能冷热数据监控与动态迁移,使 CXL 内存访问延迟接近本地性能。基于 元脑服务器,通过创新性地内置 CXL 内存扩展卡,可实现内存容量 1TB-4TB 区间的灵活扩展, 从而为大模型推理场景提供高性价比的大内存解决方案。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至