AI推理时代KV Cache瓶颈如何影响存储与网络架构演进?

随着大模型从训练转向推理,尤其是Agentic AI和多轮对话场景的普及,KV Cache对显存和带宽的压力急剧增加。当缓存利用率超过95%时,系统由计算密集型转为I/O密集型。请问在ODX 2026大会上,各家厂商针对KV Cache带来的存储容量与传输难题提出了哪些具体解决方案?这些方案如何改变传统的内存层级架构和Scale Up网络设计?

最佳答案 匿名用户编辑于2026/09/09 09:36

在ODX 2026大会上,多家厂商针对KV Cache瓶颈提出了创新解决方案,主要集中在存储层级重构和网络互联优化两个维度。

首先,在存储层级方面,传统L1 HBM与L2 DRAM之间存在明显性能GAP。腾讯提出了L1.5解决方案,即在现有超节点架构中接入独立内存池,通过Scale up Switch直接连接专用DDR内存池。该方案可为单颗GPU提供约500GB访问容量及400-800GB/s访问带宽,显著提高Batch Size,带动TPS提升。腾讯还启动了Memory Switch Fabric项目,支持DRAM、NAND、HBF,计划明年推出Memory Connect芯片,将原Scale up网络从算力互连演进为内存互连。三星则推出了zNAND-O,基于V10 BV-NAND架构,采用TS硅通孔技术与NPU合封,通过UCIe标准接口实现芯片间连接,兼具高性能与低功耗,预计2028年深度赋能AI创新。

其次,在网络互联方面,华为指出AI推理场景中长序列、多轮对话带来KV Cache带宽需求暴涨近8倍,现有架构存在巨大带宽缺口。华为通过存算合一方向,实现存储直连参数面网络、GPU直通,使KV带宽提升8倍,并结合OpenCM算网协同主动侧控制,降低P99长尾时延20%。天翼云也提到,紫金超节点架构中,Scale Up网络同时承载GPU互联与KV Cache流量,旨在将算力、通算、内存和存储由资源孤岛转为统一资源池。

此外,壁仞科技分析了PD异构设计下的KV Cache传输策略,提出P2P直连、共享存储及混合路径三种方案,其中混合路径在生产环境中为主流,兼顾时延与解耦能力。通过这些技术演进,AI基础设施正从单纯的算力中心向存算网协同的Token工厂转变,以应对日益增长的推理负载需求。

参考报告REPORT

电子行业:ODX2026首届算博会跟踪报告—从大模型演进到Token工厂,AI产业链共筑基础设施升级.pdf

全球AI产业正经历从生成式AI向AgenticAI的关键跃迁,这一范式转换使得硬件升级的核心逻辑从理论峰值算力转向有效Token产出。ODX2026首届算博会显示,Token/s、Token/W及单Token成本已成为衡量基础设施价值的新标尺,驱动着算力、存储、网络及供电系统的全面重构。超节点与整机柜交付成为主流面对单芯片功耗迈向5kW、单机柜功率突破1MW的挑战,传统服务器设计模式失效。超节点以机柜为最小交付单元,整合CPU/GPU/XPU、内存、存储、交换及供电散热模块。超聚变、百度、新华三等厂商通过模块化、三总线盲插及全液冷设计,提升单柜密度与可维护性。整机价值评估体系随之改变,更关注有...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至