计算机行业周报:华为960引领国产加速落地

  • 来源:华西证券
  • 发布时间:2026/09/21
  • 浏览次数:7
  • 举报
相关深度报告REPORTS

计算机行业周报:华为960引领国产加速落地.pdf

国产算力基础设施正经历从单点突破向系统级协同的关键跃迁,芯片互联技术与异构计算架构的双线演进正在重塑行业竞争格局。核心技术突破华为发布全球首个采用NPO(近封装光学)技术的昇腾960超节点,搭载自研Hi-ONE光引擎,单节点可扩展至4096卡并提供8EFLOPSFP8算力。通过5500个Hi-ONE替代4.8万颗800G光模块,功耗降低超550千瓦,系统可用度达99.8%。结合灵衢互联网络与多轨道拓扑技术,最大集群规模可支持100万卡。此外,移动云联合多方发布国内首个“国产GPU+类脑芯片”异构混合推理系统,在DeepSeekV4Flash上验证推理输出与能效提升1倍以上,运营成本降低40%以...

国产算力领域近期动作密集,企业层面与技术层面均呈现加速突破态势。京东云与摩尔线程达成十万卡全功能GPU集群合作,沐曦股份与魔形智能推动万卡集群投入Token工厂生产环境,国产GPU的规模化商用明显提速。技术层面,华为发布首个采用NPO技术的昇腾960超节点,移动云联合多家单位推出国内首个国产GPU+类脑芯片异构混合推理系统,系统级创新正成为竞争焦点。

华为昇腾960超节点:NPO技术引领百万卡集群扩展

在华为全联接大会2026上,华为正式发布全球首个采用NPO(近封装光学)技术的超节点——昇腾960超节点,面向十万亿参数规模大模型的训练与推理。该超节点采用华为自研NPO光引擎Hi-ONE,总容量达7.2T,是业界首个量产的NPO产品,也是唯一实现内置光源的NPO产品。

NPO的核心思路是将光模块中承担光电转换功能的光引擎,从交换机前面板的可插拔位置迁移到更靠近交换芯片的PCB区域。传统可插拔光模块的电信号要沿电路板走15至30厘米,NPO将这一距离缩短至交换芯片隔壁约5厘米以内。高速电信号的传输路径大幅缩短,功耗和延迟随之降低,同时光引擎仍保持独立封装、可单独更换。华为进一步把原本位于光模块内部的DSP功能集成进交换芯片,使链路时延从百纳秒级压缩至十纳秒级,互联功耗下降约60%,同时规避了CPO共封装光学良率难、维护成本高的痛点。

Hi-ONE单引擎传输容量达7.2T,内置36条光通道,单通道速率200Gbps。它基于华为自主创新技术,涵盖化合物光芯片与硅光芯片,通过光、机、电、磁、热等要素的均衡设计实现上述传输容量。凭借5500个Hi-ONE,昇腾960超节点替代了原本所需的4.8万颗800G光模块,功耗降低超过550千瓦,系统无故障运行时间提升一倍,可用度达到99.8%。

昇腾960超节点采用正交架构和全液冷设计,基于华为自研的灵衢互联协议实现内存统一编址,可扩展至4096卡规模,提供8EFLOPS FP8算力和16EFLOPS FP4算力。“超节点”的核心特征在于内存统一编址和跨物理节点的内存语义访问,意味着任何一个AI芯片可以访问超节点内的所有内存共享池,可以统一池化。华为马尔科夫实验室仿真数据显示,4K超节点组成的10万卡集群相比由8卡服务器组成的10万卡集群,模型算力利用率(MFU)提升了2.75倍。

在集群扩展方面,多个昇腾960超节点通过灵衢网络或RoCE连接,采用二层CLOS四平面组网,最大集群规模可达51.2万卡;在此基础上结合多轨道拓扑技术,最大可支持100万卡昇腾超节点集群。围绕灵衢互联,华为同步发布了覆盖柜内、跨柜与集群三级的分层分级互联设备,并推出基于灵衢的Agentic AI超节点集群,由鲲鹏950、昇腾960超节点、OceanStor M900记忆存储及星河UBG交换机组成,实现多样算力协同与分级资源池化。

目前,昇腾910C超节点已部署超过1000套,昇腾950超节点已实现规模商用。昇腾960芯片研发进度超出预期,960DT比原计划提前三个季度,将于2027年第一季度就绪;960PR比原计划提前一个季度,将于2027年第三季度就绪。生态层面,CANN已全面开源开放并进入常态化社区运营,外部开发者占比达到61%,社区月活开发者突破5200名,基于昇腾+CANN的原生训练模型已超过40个。

京东云携手摩尔线程:十万卡集群推动国产GPU入局核心体系

在2026京东全球科技探索者大会上,京东云宣布与摩尔线程达成深度合作,拟建设十万卡全功能GPU智算集群。该集群以摩尔线程全功能GPU为算力底座,聚焦大模型训练、推理及具身智能等领域,并向全行业开放算力服务。这标志着国产GPU首次进入头部AI云企业十万卡级核心智算集群,国产智算正从“可用”走向“规模化商用”。

双方将围绕芯片、云平台到模型训练开展全栈协同,支持京东JoyAI全系大模型迭代,加速模型训练、仿真与高质量数据生成,构建“数据—训练—仿真—部署”的完整闭环。京东云未来资源将重点倾斜供应链AI、具身智能、大模型训推一体与产业场景落地。京东正全面推进物理AI战略落地,高性能、高可靠的国产算力是核心支撑,选择与摩尔线程深度合作看重的是其国产训练级GPU能力和大规模集群交付经验。

摩尔线程作为国内极少数具备训练级GPU能力的企业,已实现单一网络下千卡级、万卡级大规模集群的商业化落地。其旗舰产品MTT S5000基于自研MUSA统一系统架构,在单芯片上同时集成AI计算加速、3D图形渲染、物理仿真等多元计算能力,完整支持从FP8到FP64的全精度计算。在具身智能领域,摩尔线程已打通从合成数据生成、大模型训练、仿真验证到端侧硬件部署的完整链路。

财务表现方面,2026年上半年摩尔线程实现营业收入17.36亿元,同比增长147.42%,已超过2025年全年收入。其中云端产品收入16.93亿元,占总收入约97.5%,是收入增长的核心来源。增长主要受益于人工智能产业快速发展、国产全功能GPU需求提升,以及MTT S5000和夸娥智算集群获得客户认可并实现稳定供货。公司表示,夸娥万卡级智算集群已完成部署并上线服务,正推进高性能国产GPU、先进互联网络、集群软件栈和算力调度平台的一体化布局。

沐曦万卡集群投产:国产算力迈入Token生产新阶段

沐曦股份与魔形智能宣布达成生态合作,双方将围绕国产算力集群探索Token工厂建设新范式,并加速超节点算力集群产品的应用落地。目前,基于沐曦股份国产GPGPU产品部署的万卡智算集群已正式投入魔形智能“Token超级工厂”的生产环境,成为支撑大规模Token生产的国产算力底座。

此次合作的核心突破在于算力价值锚点的转移。传统智算中心多以裸算力租赁为主要商业模式,客户按卡时或机时付费;而沐曦与魔形智能的合作则将国产算力的价值锚定在下游可验证的Token交付上,不按小时卖裸算力、按产出的模型调用量结算。这意味着国产GPGPU不再仅仅作为基础设施被使用,而是直接嵌入到Token生产链条中,成为可计量、可交付的生产工具。万卡集群投入实际生产环境,标志着国产GPU从集群建设、适配验证阶段正式跨入生产运营阶段。

技术基础来自沐曦股份在超节点产品和软件生态上的持续布局。沐曦于2026年WAIC期间发布的曦景S600超节点,实现单机柜64卡高密度部署,通过柜内全互连架构大幅降低数据交互时延,集群规模可灵活扩展至万卡级别,支持EP、TP等多维并行策略,全面覆盖大模型训练和推理场景。超节点是解决推理效率的关键,通过多卡互联形成高带宽域,可提升推理响应速度,满足大规模并发和长序列处理需求。在软件层面,MXMACA软件栈自2025年2月开源以来,已汇聚超过50万开发者用户。

沐曦2026年上半年营收13.24亿元,同比大增44.67%,毛利率升至57.2%,归母净利润扭亏为盈达6.12亿元,产品已在智算中心、运营商、金融、能源等六大行业规模化落地。魔形智能定位为面向通用人工智能产业的Token基础设施提供商,成立两年来已完成三轮融资。面向未来,双方将在超节点算力集群方向继续深化合作,吸引包括计算、互联、存储、液冷等关键子系统层面的合作伙伴共同构建超节点算力生态。

移动云异构混合推理系统:能效翻倍与运营成本大幅下降

在2026中国算力大会上,由移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、江苏移动、清华大学、北京大学共同打造的国内首个国产GPU+类脑芯片大模型异构混合推理系统正式发布。该系统通过全栈架构创新,让国产芯片高效支撑大模型推理,为国内大模型与多智能体应用提供了一条自主可控的新算力路径。

随着人工智能产业重心从模型训练转向规模化推理服务,推理算力已成为支撑Token工厂、AI智能体、文生视频等业务的新型数字基础设施。大模型并发服务对吞吐量和能耗成本提出极高要求,传统单一GPU推理架构日益吃力,数据频繁搬运带来“内存墙”和“功耗墙”,而国内先进芯片制程供给受限,单纯依靠硬件工艺升级提升算力的空间有限。行业需要跳出只追先进制程的思路,从系统架构层面寻找新解法。

项目团队首次将国产通用GPU与类脑芯片深度融合,创新实现Transformer模型AF分离推理模式:将Attention(注意力)计算与FFN(前馈网络)模块拆分,由不同特性的国产芯片分工处理。Attention计算交由国产GPU承载,FFN模块交由类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM的架构优势,突破传统GPU推理的固有瓶颈。同时,团队自研模型编译器、高速互联协议和统一推理引擎,实现两类算力的任务拆解、协同调度与结果聚合。

该系统采用灵汐科技类脑芯片与天数智芯GPU混合方案,对标英伟达Vera Rubin+Groq方案。项目已在DeepSeek V4 Flash大模型上完成完整调优验证,相较同类国产GPU算力集群,推理输出和能效均提升1倍以上,业务运营成本降低40%以上。依托国内成熟工艺的国产芯片,通过系统架构创新可以实现对标国际下一代推理架构的业务能力,为大模型推理国产化落地提供了可复制的技术范式。后续团队将持续迭代异构推理系统,面向Token工厂、AI代码开发、文生视频、多智能体协同等场景开展落地验证。

投资建议与市场表现

在受益标的方面,国产芯片领域重点关注寒武纪、海光信息、摩尔线程、沐曦股份、大胜达;国产AI基础建设领域关注盛科通信、华丰科技、航天电器、紫光股份、锐捷网络、中科曙光、杰华特、意华股份、网宿科技、光环新网、优刻得、首都在线、利通电子、神州数码、浪潮信息、华勤技术;晶圆代工领域关注中芯国际、华虹公司、晶合集成。

市场表现方面,本周沪深300指数下跌0.06%,申万计算机行业周涨幅1.58%,高于指数1.64个百分点,在申万一级行业中排名第10位。2026年初至今申万计算机行业累计下跌17.01%,跑输沪深300指数14.36个百分点。个股交投相对活跃,321只个股中184只上涨,上涨股票数占比57.32%。从估值情况来看,SW计算机行业PE(TTM)升至116.1160倍,高于2019-2025年历史均值150.46倍,行业估值高于历史中枢水平。需关注的风险包括国产算力芯片性能、生态与供应链仍存不确定性,集群落地、商用进度及能效数据或不及预期。

编辑:流星雨
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至