在Agentic AI负载下,CPU与GPU的协同瓶颈如何影响算力系统的整体效率?

随着智能体(Agent)应用的普及,算力系统的负载特征正在发生变化。传统的“CPU搬运、GPU推理”分工模式在实际运行中暴露出一定的协同瓶颈。

请问在Agentic AI负载场景下,CPU端的处理时延与能耗占比呈现怎样的变化趋势?国产算力厂商如海光信息等,针对这一系统级瓶颈提出了哪些底层的架构解决方案与软硬件协同策略?

最佳答案 匿名用户编辑于2026/09/10 08:45

在Agentic AI负载下,传统的“CPU搬运、GPU推理”分工模式存在显著的协同瓶颈,CPU调度效率已成为系统效率的关键变量。

根据佐治亚理工学院论文《A CPU-Centric Perspective on Agentic AI》对典型智能体负载的实测显示,CPU侧工具处理时延在整体负载中占比偏高,导致GPU长期处于等待状态。具体数据表明,批大小从64提升至128时,LangChain负载CPU端摘要任务时延由2.9秒升至6.3秒;在批大小128场景下,CPU动态能耗占总动态能耗比例可达44%。这意味着推理阶段的关键指标已从峰值算力转向单位Token成本、并发吞吐与功耗。

针对这一系统级瓶颈,国产算力厂商正积极推进架构创新。海光信息在2026数博会首发了“Agent to Token开放计算架构”,依托CPU与DCU双芯协同,贯通Agent任务执行与词元生产的完整计算周期。这种双芯协同的产业背景正是为了应对Agentic AI负载下CPU价值的系统性重估。

在软件生态层面,完全开源的异构AI芯片系统软件栈FlagOS形成了“核心库—插件—领域项目—工具与服务”多层开源组件体系。其中,FlagGems通用算子库与FlagTree统一编译器提供计算支撑,FlagScale覆盖训练到部署全流程,FlagCX解决跨芯片通信,允许AI模型一次开发即可移植到广泛的AI硬件平台,从而在系统级优化整体Token生产效率。

参考报告REPORT

计算机行业动态报告:昇腾、寒武纪、浪潮与超节点.pdf

大模型参数规模迈向万亿级叠加MoE架构的普及,单卡算力已触及物理与架构天花板,超节点集群与模算协同正成为AI算力基础设施演进的核心主线。核心研究与技术演进报告重点剖析了华为昇腾、寒武纪等国产算力龙头的技术路径。华为提出“韬定律”,通过逻辑折叠等技术在器件、电路、芯片、系统四个层级协同优化以降低系统时间常数,并推出了搭载8192颗Ascend950DT芯片的Atlas950超节点,FP8总算力达8EFLOPS,配合灵衢2.0协议实现16.3PB/s总互联带宽。同时,CANN推出PyPTO编程范式,将模型算子开发周期缩短至天级。在模型端,DeepSeekV4与智谱GLM-5.3-Flash通过稀疏...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至