2026年第13周全球产业趋势跟踪周报(0330):Arm正式发布AGICPU,存储行业迎来巨震

  • 来源:招商证券
  • 发布时间:2026/04/03
  • 浏览次数:78
  • 举报
相关深度报告REPORTS

全球产业趋势跟踪周报(0330):Arm正式发布AGICPU,存储行业迎来巨震.pdf

全球产业趋势跟踪周报(0330):Arm正式发布AGICPU,存储行业迎来巨震。本周产业集中在芯片半导体和人工智能。2026年3月24日,Arm在旧金山举办了名为“ArmEverywhere”的全球发布会,正式发布了ArmAGICPU,这是Arm历史上首款自行设计、并直接向客户销售的生产级高性能计算芯片。从发布定位看,Arm并没有把AGICPU打造成传统意义上的通用服务器CPU替代品,而是把它定义为“agenticAIcloudera”的硅基础设施,也就是为代理式AI、多代理系统、大规模推理编排、加速器管理和数据平面/网络平面支撑计算而生的CPU...

核心关注

市场交易热点

上周,A 股涨幅居前的重要主题指数为锂矿、锂电电解液、盐湖提锂。

主题与产业趋势变化:Arm 正式发布 AGI CPU;存储行业迎来巨震:英伟达推出 BlueField-4 STX 存储架构,谷歌发布 TurboQuant AI 内存压缩技术

(1)Arm 正式发布 AGI CPU

2026 年 3 月 24 日,Arm 在旧金山举办了名为“Arm Everywhere”的全球发布会,正式发布了 Arm AGI CPU,这 是 Arm 历史上首款自行设计、并直接向客户销售的生产级高性能计算芯片。过去三十多年,Arm 的核心商业模式一 直是提供 CPU 架构、内核设计和配套 IP,由 Qualcomm、Nvidia、Apple、AWS、Ampere 等伙伴将其整合进 SoC 或服务器芯片;而这一次,Arm 不是只卖“蓝图”,而是第一次把自身的 Arm 计算平台直接推进到量产级数据中心 硅产品,也就是自己主导推出真正可下单、可部署的服务器 CPU。 从发布定位看,Arm 并没有把 AGI CPU 打造成传统意义上的通用服务器 CPU 替代品,而是把它定义为“agentic AI cloud era”的硅基础设施,也就是为代理式 AI、多代理系统、大规模推理编排、加速器管理和数据平面/网络平面 支撑计算而生的 CPU。Arm 此次发布的 AGI CPU,重新定义 CPU 在 AI 集群中的角色:它不只是喂数据给 GPU, 而是承担越来越复杂的调度、内存组织、网络交互、任务拆分和长尾服务运行职责。根据 Arm 的估算,数据中心对 每 GW 功耗提供的 CPU 算力需求将增长至当前的 4 倍以上,在相同功耗范围内,以前需要 3000 万 CPU 核心,现在 需要塞入约 4 倍的 1.2 亿个 CPU 核心,而 Arm AGI CPU 则旨在解决当前数据中心中 CPU 往往沦为 GPU“保姆” 的瓶颈问题。 与此同时,Arm 商业系统已经可以向 ASRockRack、Lenovo、Supermicro 下单,还推出了符合 OCP DC-MHS 标准 的 1OU Dual Node 参考服务器设计。Arm 还披露了后续产品规划,AGI CPU 与 Arm Neoverse CSS 产品路线图将并 行推进,计划 2027 年发布 Arm AGI CPU 2 和 CSS V4,未来发布 Arm AGI CPU 3 和 CSS V5,确保所有 Arm 数据 中心客户在平台架构与软件兼容性方面实现协同发展。

核心看点:围绕“机架级密度、持续负载效率、AI 集群协同”进行的整体设计

Arm AGI CPU 的核心看点并不是单一频率或跑分,而是围绕“机架级密度、持续负载效率、AI 集群协同”进行的 整体设计。官方规格显示,该芯片基于 Armv9.2 架构,采用 Arm Neoverse V3 核心,单颗最高 136 核,支持 2×128-bit SVE,每核配备 2MB L2,系统级缓存为 128MB,主频 3.2GHz,TDP 300W。内存方面提供 12 通道 DDR5,最高到 8800 MT/s,有着每核 6GB/s 内存吞吐;I/O 方面提供 96 条 PCIe Gen6 通道,并支持 CXL 3.0 Type 3,还有面向加 速器互联的扩展链路。这些参数组合到一起,有效解决了 AI 集群里最常见的几个痛点:高并发线程下的内存争用、 CPU 到加速器之间的数据搬运瓶颈、以及在高密度部署条件下每瓦性能和机柜空间利用率不足的问题。 Arm 的参考服务器采用 1OU、双节点设计,每台 1U 服务器内放两颗 AGI CPU,总计 272 核;在标准 36kW 风冷机架里,可以放 30 台 1U 服务器,也就是一柜 8160 核。Arm 还联合 Supermicro 给出了 200kW 液冷部署思路,可 容纳 336 颗 AGI CPU、总核心数超过 4.5 万。在这一类配置下,相比“最新 x86 系统”可实现超过 2 倍的每机架性 能。Arm 认为,AI 数据中心下一阶段的最优解不是盲目提升单插槽峰值,而是让 CPU 的线程、内存、I/O 和机架功 耗预算更均衡,从而让整柜在长时间高利用率下保持更好的“有效吞吐”。 生态方面,Arm AGI CPU 并不是另起炉灶,而是建立在 Neoverse CSS V3 体系之上。这意味着它继承的是 Arm 已 经在云端逐步成熟的软件兼容性与开发工具链,而不是让客户面对一个全新的孤岛平台。Arm 官方特别强调,AGI CPU 会与其现有 Neoverse CSS 路线并行推进,让现有数据中心客户在平台架构和软件兼容性上“共同前进”。

市场影响:重新分配半导体“蛋糕”

Arm 直接下场做芯片,无异于向市场投下了一枚重磅炸弹,这不仅改变了它与老盟友(如高通、英伟达)的关系, 更直接威胁到了英特尔和 AMD 的 CPU 业务大本营。过去,Arm 本质是一个高毛利、轻资产、偏平台授权的公司, 现在 Arm 在保留平台授权的基础上,同时下场设计芯片以构建数据中心业务,公司将从“平台授权费”转向“平台+ 硅产品双轮驱动”。传统上,购买 Arm IP 的厂商需要庞大的研发团队进行二次设计,现在中型云服务商甚至大型企 业可以直接从 Arm 购买现成的 AGI CPU,不再需要数亿美金的自研芯片预算,这种“即插即用”的高性能 Arm 硅片 将极大地加速 Arm 架构在服务器市场的占有率,预计到 2027 年,Arm 在数据中心 CPU 的份额将突破 35%。 对于服务器 CPU 市场本身,Arm AGI CPU 将推动行业更高效发展。长期以来,x86 架构在单线程性能和生态兼容 上占据优势,但 Arm AGI CPU 的 Neoverse V3 核心在特定 AI 编排负载下表现出了更优的能效比,对于追求机架密 度的巨头公司来说,x86 的高功耗正成为扩张的绊脚石,很多公司都希望拥有一个比传统 x86 更适合 AI 数据中心的 新底座。AGI CPU 的发布,给那些没有能力或没有时间自己做 CPU 的 AI 基础设施客户,提供一条更快上车的路 径,同时意味着在 AI 算力竞赛中,CPU 不再是 GPU 的附庸,而是一个独立的、具有高利润空间的战略节点。

产业趋势:CPU 在数据中心建设中的价值重估

AI 基础设施正在进入一个新阶段,从以 GPU 为中心的训练时代转向以整套系统效率为中心的时代。在过去的 AI 基 础建设中,GPU 是绝对的主角,CPU 往往只有单纯为加速器输送数据的作用。然而随着代理式 AI 的崛起,系统不再 只是进行单纯的矩阵乘法计算,而是需要处理极其复杂的任务调度、工具调用和多模型协同,这就要求基础设施必须 拥有一个极其强大的编排层,Arm AGI CPU 的出现,证明在解决大规模并发和逻辑调度上,专用的高性能 CPU 不可 或缺。未来 AI 数据中心的胜负,也不只是看谁训练出更强模型,还要看谁能把推理、编排、代理执行和周边服务层 做得更便宜、更稳定、更节能。 算力竞争会更强地与电力竞争绑定,能耗比成为下一代 AI 模型的黄金标准。数据中心现在最紧缺的不再只是芯片, 而是同时包括机架功率、散热能力和可扩展电力配额,谁能在同样功耗预算下提供更高的“有效 AI 服务吞吐”,谁 就更接近下一阶段的基础设施赢家。随着各家头部公司对 AI 数据中心的电力要求日益剧增,规模正在向效率妥协, 而 Arm AGI CPU 的设计逻辑深刻反映了这一点,不盲目追求单线程的绝对极速,而是将资源全部倾斜给在既定功耗 墙内,实现最大规模的并发吞吐。

(2)存储行业迎来巨震:英伟达推出 BlueField-4 STX 存储架构,谷歌发布 TurboQuant AI 内存压 缩技术

2026 年一季度之前,资本市场和产业链对存储的主流叙事仍然偏向需求单边上行,伴随 AI 训练和推理规模扩大、 HBM 紧缺、SSD 需求上升,存储厂商未来会有多年的景气扩张期。然而,随着英伟达新一代网络与存储计算核心 BlueField-4 STX 架构的发布以及谷歌 TurboQuant 算法的横空出世,市场不再只讨论 AI 需要更多存储,而开始同 时讨论 AI 是否能用更少存储完成同样甚至更多的工作,整个存储产业的底层逻辑受到一定挑战,行业随之迎来巨震。

英伟达发布 BlueField-4 STX 存储架构

2026 年 3 月 16 日,英伟达于 GTC 2026 期间正式发布 BlueField-4 STX 存储架构,英伟达对它的定义不是一台单 独的存储设备,也不是一颗新的 SSD 或存储芯片,而是一套面向 agentic AI 和长上下文推理的模块化 AI 原生存储 参考架构。STX 相对传统存储方式可实现最高 5 倍 token 吞吐、最高 4 倍能效,以及 2 倍更快的数据摄取速度,此 次发布并不只是给现有 AI 服务器多加一层存储,而是在英伟达 AI 工厂叙事里,把存储正式提升为和 GPU、网络同 等重要的基础设施。 英伟达同时宣布,STX 的首个机架级实现是 NVIDIA CMX 上下文内存存储平台,它本质上是一层专门为 KV Cache 服务的高性能上下文层,用来扩展 GPU 可用内存,并改善大规模推理和智能体系统的响应能力。首批计划把 STX 用 于上下文内存存储的云和 AI 服务提供商包括 CoreWeave、Crusoe、IREN、Lambda、Mistral AI、Nebius、OCI、 Vultr,而且英伟达明确表示 STX-based platforms 将在 2026 年下半年由合作伙伴提供。

技术焦点:BlueField-4 数据处理器

STX 架构是建立在英伟达最新的 Vera Rubin 平台之上的,其核心是一颗专为存储优化的全新 BlueField-4 数据处理 器,这颗处理器将多核的 NVIDIA Vera CPU、NVIDIA ConnectX-9 SuperNIC 整合在了一起,配合 NVIDIA Spectrum-X 以太网网络,这套硬件矩阵为存储系统提供了可预测的、极低延迟和超高带宽的 RDMA 连接。这意味 着在这个架构下,数据在跨节点共享 KV Cache 时,几乎感受不到网络的抖动和延迟,成千上万个 GPU 仿佛在共享 同一块巨大的本地内存,利用 BlueField-4 的加密、CRC 保护、KV I/O 加速和协议终止能力,减少对主机 CPU 的依 赖、减少内存拷贝和串行路径。 BlueField-4 STX 架构彻底绕过 CPU,实现存储处理器和 GPU 显存的直接对话。在传统的服务器中,数据从 NVMe SSD 读出,必须经过系统的主 CPU 进行处理和路由,然后再通过 PCIe 总线发给 GPU,主 CPU 就像一个极其拥堵 的收费站。BlueField-4 STX 通过硬件级的直通技术,完全接管了存储的 I/O 控制权,能够直接管理后端的 NVMe 固 态硬盘,在以太网上高效地终结 NVMe-oF 协议,数据直接从存储处理器(BlueField-4)高速传输到 GPU 的显存中, 完全不需要 CPU 的介入,这不仅释放了宝贵的 CPU 算力,更将数据访问延迟压榨到了物理极限。

谷歌 TurboQuant 打破 AI 行业内存瓶颈

2026 年 3 月 24 日,Google Research 通过其官方博客正式向外界公开了 TurboQuant 的全新 AI 内存压缩技术, 该算法的完整论文将在 2026 年 4 月的国际学习表征会议(ICLR 2026)上作为重磅议题进行展示。TurboQuant 的 横空出世,其核心使命只有一个:彻底解决大型语言模型(LLM)和超大规模向量搜索引擎在推理阶段面临的致命“内 存瓶颈”问题。从核心内容看,TurboQuant 真正要解决的,不只是“把数值存小一点”,而是要在压缩率、失真率、 内积估计偏差、在线可用性和硬件友好性之间同时找到平衡。TurboQuant 的发布标志着人类在不依赖底层硬件材质 升级的前提下,仅靠纯软件算法层面的数学突破,粉碎这堵“内存之墙”。 在以 Transformer 架构为基础的大语言模型(如 ChatGPT、Gemini、Claude)中,当大模型在生成一段长文本时, 为了避免每次吐出一个新词都要把前面的上下文重新计算一遍,KV Cache 会将之前处理过的信息转化为高维向量并 暂时存储在显存中,类似人类的短期记忆。然而,随着目前大模型内卷的上下文窗口越来越大,这种“短期记忆”所 占用的内存容量呈指数级爆炸,对于普通的 AI 服务器甚至消费级显卡来说,往往计算核心 GPU 算力还没跑满,内存 空间就已经被 KV Cache 完全占据,导致系统严重卡顿甚至直接崩溃,业界将这种现象无奈地称为 AI 发展的“内存 之墙”。而根据谷歌公布的官方测试数据,TurboQuant 技术能够在零精度损失的前提下,将大模型的 KV Cache 内 存占用极度压缩至原本的六分之一,即把传统的 16-bit 浮点数精度直接压缩到极限的 3-bit。更令人惊叹的是,在搭载 英伟达 H100 加速器的实际硬件测试中,基于 4-bit 配置的 TurboQuant 在计算注意力逻辑得分时,相比未量化的基准 线,实现了高达 8 倍的性能提速。

TurboQuant 核心技术点

在 TurboQuant 出现之前,业界并非没有尝试过对 KV Cache 进行压缩。传统的向量量化技术,如乘积量化(PQ)、 优化乘积量化(OPQ)或者近期的 KIVI 算法,虽然也能在一定程度上减小内存体积,但一旦将数据压缩到 4-bit 及以 下,模型就会产生严重的“幻觉”和记忆丢失。此外,传统方法往往需要昂贵的离线校准,如果实际应用中的数据分 布发生了偏移,压缩质量就会剧烈下降。TurboQuant 革命性创新在于,它是一种数据无感且免训练的即时压缩算法, 不需要任何密码本,也不需要离线微调,只要数据流进来,就能在瞬间完成高质量压缩。 TurboQuant 的核心算法是两阶段,第一阶段是利用 PolarQuant 对向量做高质量压缩,第二阶段是 QJL 残差修正。 在第一阶段,先对输入向量做随机旋转,把高维数据的几何结构变得更规整,从而更容易对每个坐标分别使用接近最 优的标量量化器,理顺了高维空间的几何结构,随后将绝大多数的比 bits 分配给这个阶段,利用极其标准的量化器去 捕捉向量。在第一阶段的大幅压缩后,必然会不可避免地产生细微的残差,如果放任不管,这些误差在大模型成千上 万次的循环计算中会被无限放大,此时 TurboQuant 会动用 1-bit 的冗余算力去执行 QJL 算法,用很低的额外代价把 内积估计拉回到无偏、低失真的状态。第二阶段的创新性在于 TurboQuant 不试图去完美重建那个被压缩的原始向量, 算法只在乎内积的准确性,QJL 通过引入高斯随机投影,消除了第一阶段产生的数学偏差,使得即便在极端压缩下, 最终计算出的注意力得分也是无偏估计,其方差小到几乎可以忽略不计。

编辑:火腿肠
  • 相关标签
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至