电子行业深度报告:国产算力芯片链深度跟踪。华为全联接2026展示系统级实力,960进展和NPO超预期

  • 来源:招商证券
  • 发布时间:2026/09/19
  • 浏览次数:9
  • 举报
相关深度报告REPORTS

电子行业深度报告:国产算力芯片链深度跟踪。华为全联接2026展示系统级实力,960进展和NPO超预期.pdf

随着大模型参数量快速向十万亿级别演进,十万卡算力集群已成为训练前沿模型的标准配置,但传统8卡服务器架构面临通信开销占比超40%、实际有效算力大幅折损的严峻挑战。在此背景下,超节点架构成为突破算力瓶颈的核心路径。核心内容与技术突破招商证券本篇深度报告跟踪了华为全联接大会2026的最新进展。华为正式发布基于灵衢UnifiedBus打造的11颗关键芯片家族,涵盖计算(鲲鹏、昇腾)、互联(交换芯片、NPO光引擎)、存储及管理四大维度。其中,昇腾960DT芯片FP8算力达2PFLOPS,访存带宽9.6TB/s,产品就绪时间点由原计划的2027年四季度大幅提前至2027年一季度;昇腾960PR亦提前至20...

2026年9月17日,华为全联接大会2026在上海启幕。本次大会聚焦AI基础设施建设,围绕“超节点+集群”推进系统架构创新,发布基于灵衢UnifiedBus打造的11颗关键芯片、Hi-ONE NPO光引擎及昇腾960超节点等核心产品。国产算力正加速迈向“算、联、存、管”系统级协同阶段,为十万亿参数大模型训练与推理提供底层支撑。

智能世界加速到来,超节点成为必然选择

AI技术变革速度超过历史上历次技术革命。2020年主流大模型参数量为1750亿,当前模型参数量正快速向10万亿规模演进,预计2030年有望达到100万亿以上,接近人脑神经突触的数量级别。智能体能力也在快速迭代,2024年智能体仅可以完成分钟级任务,如今已经能够实现小时级连续工作;预计2030年,智能体可以按月度乃至更长周期执行任务,成为能够独立完成复杂任务的数字员工。

AI应用呈现爆发式增长。2024年中国每日推理Token消耗规模约千亿级别,当前中国每日推理Token消耗量达到500万亿。端侧智能能力同步快速提升,手机端大模型参数量由2024年的30亿发展至当前300亿,未来将进一步向1000亿规模演进。自动驾驶技术由L2向L3迭代,预计2030年前后实现L4级别规模商用。未来通信网络的连接主体,将从当前全球83亿人口,拓展至万亿级别的各类智能体。

上述变化对AI基础设施的规模、性能、可靠性提出更高要求。当前全球万亿级MoE模型迭代速度快,10万卡算力集群即将成为训练SOTA前沿模型的标准配置。但建设10万卡算力集群会面临多重技术挑战,一套10万卡集群的实际有效算力,远小于1.2万套8卡标准服务器的算力之和。提升集群MFU模型浮点算力利用率是世界级技术难题。MFU每提升一个百分点,模型迭代周期就可以提前约3天。

主流MoE模型训练过程中,数十万颗芯片之间需要完成数百亿次通信,实现各层计算中间结果对齐。仿真测算显示,由8卡服务器搭建而成的10万卡集群,芯片间通信开销占全部训练总时长的40%以上。传统计算架构下,服务器之间通信时延相比服务器内部会提升数个数量级,如单次通信时延由百纳秒级别上升至几十微秒级别。因此,围绕降低通信开销占比、优化计算系统架构是建设高效率AI基础设施的合理技术路径。

华为超节点设计理念为:采用一套协议平等连接超节点内部全部组件,支持跨物理服务器统一内存编址,采用“近铜远光”互联方案,数万颗芯片之间通信有近线性的带宽、时延,像一台计算机一样工作,能够有效提升MFU。根据马尔可夫实验室仿真结果,同等集群规模条件下,采用4K规格超节点搭建的10万卡集群,对比8卡服务器构建的同等规模集群,MFU可以实现2.75倍提升。超节点已成为建设超大规模AI基础设施的必然选择。

灵衢11颗关键芯片协同,昇腾960研发进度超预期

建设超节点大规模集群,首先需要一套可以平等连接集群全部组件的互联协议,即灵衢UnifiedBus。华为面向超节点集群打造系列化芯片,分为三大类别:第一类为计算芯片,包含鲲鹏CPU、昇腾NPU,承担核心计算任务;第二类为互联芯片,包含Scale Out平面大容量交换芯片、Scale Up平面低时延交换芯片,同时配套面向跨机柜高速互联的芯片;第三类为存储芯片,除通用介质控制器芯片以外,专门面向AI的KV缓存业务,研发Smart Storage Unit智能存储单元,实现平等的、一跳直达的缓存系统。除此之外,还配置各类管理功能的套片来实现复杂系统中各方面的协调与管理。以上合计11颗关键芯片,共同支撑面向Agent AI场景的高性能超节点与集群。

昇腾960芯片研发进度超预期,性能实现倍增。昇腾960DT支持2P FLOPS的FP8算力、4P FLOPS的FP4算力,片上HBM最大容量288GB,访存带宽最高9.6TB/s,推出时间相比原定路标提前三个季度,2027年一季度完成产品就绪。昇腾960PR,FP4算力最高可达8P FLOPS,相比原计划提前一个季度,2027年三季度完成就绪。后续昇腾芯片将保持一年一代迭代节奏,计划2028年、2029年依次推出昇腾970、昇腾980,依托韬定律创新,持续实现算力规格翻倍,仿真带宽、存储容量、互联带宽同步大幅提升。

Hi-ONE NPO光引擎量产,单引擎传输容量达7.2T

当SerDes速率达到224G及以上,铜缆传输性能会快速衰减;当更多的NPO需要互联带宽时,传统的可插拔光模块也无法满足密度要求。华为研发新一代NPO形态的光互联产品Hi-ONE。不管是CPO还是NPO,其核心的理念是缩短高速电信号的传输距离,让电信号尽早的转换为光信号。CPO技术尝试将光和电的部件集中封装在一起,但是光器件和电芯片在材料体系、热与力的敏感度等方面都有很大的差别,共封装会带来可靠性、可制造性、可维护性等一系列问题。而NPO技术既实现了光信号和电信号的近距离握手,又保留了光引擎的独立性,最大程度延续了客户的使用习惯和产业生态。

Hi-ONE产品基于华为自主创新,包括化合物光芯片、硅光芯片等,通过光、机、电、磁、热等要素的均衡设计,实现了单引擎7.2T的传输容量。这是业界首个量产的NPO产品,是目前行业最大传输能力的NPO产品,也是唯一实现内置光源的NPO产品。这款产品把高带宽和高可靠与低时延和低功耗融为一体,与灵衢总协议一起构建可规模扩展的超节点的互联系统。近期华为在全球的光互联标准组织OIF上提出了NPO的标准立项建议,得到众多行业伙伴的积极响应。

昇腾960扩展至4096卡,鲲鹏超节点全面升级

基于业界最大传输能力的Hi-ONE,华为打造了业界首个采用NPO技术的超级点,即昇腾960超节点。单个昇腾960超节点可实现4096卡规模,最大可提供8EFLOPS FP8的算力,实现高达1PB的HBM容量。昇腾960超节点用5500个Hi-ONE模块替代原本需要的48000颗的800G光模块,功耗降低超过550千瓦,系统无故障运行的时间提升一倍,系统可用度可以达到99.8%。昇腾960风冷超节点和液冷超节点分别将于2027年Q2和Q3陆续上市。

随着AI agent应用的深入,智算系统中CPU和NPU的计算负荷发生了较大的变化。一方面,多AI agent的交互需要秒级启动数十万个沙箱,需要毫秒级的沙箱拉起的速度。同时,多agent的海量信息检索也需要与之匹配的向量检索性能,单服务器需要数十万TPS。传统服务器由于其以CPU为核心的通信架构,时延和性能都无法满足上述业务的诉求。为此,华为将超节点的架构引入通算系统,通过超节点的内存统一编址,把多台通用算力的服务器内存形成一个统一的共享内存池。

鲲鹏超节点全面升级,基于灵衢全光网,最大支持4096节点,形成高达256TB的统一内存池。鲲鹏超节点可显著加速AI agent的性能:一是在AI agent的沙箱场景,10万级别的沙箱启动,相比传统服务器方案提升30倍,且沙箱密度可以进一步再提升25%;二是在AI agent的向量检索场景,在百亿千维复杂的向量检索场景下,实现检索效率比传统服务器性能倍增。

Agentic超节点集群统一计算与KV缓存

超节点集群是由多个超节点通过Scale Out网络交换机互联形成的一个大集群。华为昇腾960超节点最大规格为4096张NPU卡,多个NPU超节点通过灵衢网络或者RoCE连接在一起,构建更大规模的超节点集群。超节点集群支持多种组网模式:一是采用两层CLOS或者单平面组网,可以实现3.2万张昇腾960卡的高效互联;二是采用两层CLOS多平面组网,凭借交换机1024 Radix的大扇出能力,通过四平面组网,最大集群规模可达到51.2万张960卡,再结合多轨道拓扑技术,最大可支持到100万张昇腾960无收敛的集群互联。

华为采用Unified Bus打造的100T大容量UB和RoCE双模交换机,相比传统的RoCE交换机,在可靠性、低时延和高吞吐等方面有大幅度提升。针对跨楼栋远距离组网的超大规模集群,华为可以提供基于光交叉OCS的方案来降低光互联成本,实现最佳性价比。

在推理系统中还要部署PB级的KV缓存集群,华为发挥计算+通信的综合优势,为业界带来了全新的Agentic超节点集群。该集群具备三大特征:第一,以灵衢Unified Bus统一互联,把多种互联协议统一为灵衢协议,大幅度减少协议的转换开销;第二,将昇腾超节点、鲲鹏超节点以及KV缓存等子系统对等互联;第三,提供多层次、高带宽、大容量的存储系统,且各类KV缓存均可一跳直达,以满足系统中各类热、温、冷的KV缓存需求,最大化提升整个资源的利用效率。

面向10万亿大模型的训练场景,采用25个昇腾4096卡的超节点,构成一个10万卡的集群,采用两层CLOS四平面的扁平化组网,整个集群系统规模可提供200EFLOPS FP8的超大算力,可满足10万亿级别的大模型的训练的快速迭代需求。针对AI推理,面向10万亿大模型、5毫秒的极致低时延场景,可以组成352张昇腾960卡的超节点,采用一层灵衢交换,一跳直达以降低推理时延。

CANN进入常态化开源社区运作

截至目前,华为的鲲鹏生态全球开发者超过了416万,全球生态合作伙伴超过了7200家,支持了560多个全球的开源项目,openEuler的装机量也超过了2000万套,在中国服务器操作系统市场份额排名第一。

CANN作为昇腾生态的根基,自2018年发布首个版本以来,经过8年的技术积累,架构与能力已经逐步走向成熟与完善。目前,CANN已经进入了常态化的开源社区运作,从可用到易用,昇腾已经跨越生态拐点。CANN的外部开发者首次超越了内部开发者,占总开发者数量的61%,社区月活开发者突破5000多名,是中国最活跃的AI开源社区。基于昇腾和CANN的原生训练模型已经超过40多个,是国内唯一支持预训练的技术路线。主流社区与昇腾正在深度共建,目前华为的昇腾已经覆盖90多个主流的三方社区。在Linux基金会的大力支持下,昇腾已经正式成为继英伟达、AMD和Intel之后,在PyTorch官网可以直接安装的算力平台,并且是首个来自中国的算力平台。青禾超过200多个开源大模型,包括国内所有的开源大模型,实现了0day的适配及最新的开源版本。

多样性算力与算网融合协同推进

华为面向千行百业,通过算力基础设施和云服务两种方式、两套核心能力,以灵活的算力供给满足客户的智能化需求。华为提供系列化的超节点集群设备,支持客户高效训练和推理;也通过华为云提供高效弹性的云算力服务,在国内部署内蒙古乌兰察布、贵安和芜湖三大算力池,帮助行业客户降低智能化门槛。同时华为通过提供大、中、小、微的多样性算力和AI系统能力,加速AI入端、上车和物联的轻智能升级。

AI入端正在全面加速。以手机为例,端侧模型的参数从2026年到2030年将实现10倍的跃迁。端侧模型的参数从17B到30B,将很快提升到70-100B,端侧的算力也会从20-80 TOPS再提升到180甚至200以上的TOPS。华为将从四个方面构建能力:第一,通过麒麟+昇腾的组合实现端侧算力的自给自制;第二,通过盘古+三方大模型实现端侧智能好用、易用;第三,鸿蒙OS不仅是万物互联的操作系统,也将是智能无处不在的Agent OS;第四,丰富的AI生态是小艺系统智能体的枝繁叶茂的基础。华为将重点围绕AIPhone、AIPC、车和家庭场景打造四大端侧算力平台。

汽车产业正在从电动化全面迈入智能化。截止到2026年9月,华为乾坤智驾总搭载量已经突破200多万辆,累计辅助驾驶里程超过150亿公里。预计到2030年,L4级的自动驾驶的算力与规模都将产生10倍以上的增长跃迁。华为乾坤自动驾驶云端的训练算力将突破100EFLOPS,车端算力将突破3000 TFLOPS。未来5年,华为乾坤智驾将再投入超过700亿人民币,加速推动汽车产业从辅助驾驶迈向自动驾驶。

物联生态方面,华为开源鸿蒙生态规模已经超过13亿。华为将面向海量轻智能终端,打造轻量化的AI盒,提供丰富的中小微多样性算力,从小于1T的微算力,1-10T的小算力,到10-100T的中算力,同时构建基于生成式的统一的开放生态。当前华为星闪终端数量已累计突破3亿,华为将进一步完善星闪的生态,构建原生连接能力。

人工智能时代,从中心到边缘,再到终端,算力无处不在。华为通过打造新一代的通信网络,将算力连接在一起。新一代通信网络将围绕着用算,以5GA或6G、万兆光网、低时延的承载网为基础,从中心到边缘再到终端,面向不同用户按需提供网络的连接能力。在数据中心内部,光电融合的数据中心网络架构可支撑100万卡的超大规模超节点集群的扩展,保障集群网络带宽利用率大于95%。在数据中心互联和接入侧,构建1毫秒、5毫秒和20毫秒的时延圈,面向人、车、物、具身智能等多元主体提供智能全域的泛在连接,以支撑多云间的大流量、低时延的实时交互与推理需求。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至