昇腾计算软硬件包括哪些部分?

昇腾计算软硬件包括哪些部分?

最佳答案 匿名用户编辑于2025/05/15 08:41

昇腾计算软硬件包括硬件系统、基础软件和应用使能三部分:

1. 硬件体系:从单卡到集群,矩阵完善

华为昇腾硬件体系作为全栈 AI 计算平台的核心底座,以达芬奇架构为技术基石,构建了 覆盖端边云全场景的完整产品矩阵,其从单卡到集群的垂直化布局充分展现了技术纵深 和生态协同能力。 当前国产高性能芯片发展迅速,在多个关键指标上展现出显著进步。目前国内自主研发 芯片的企业主要包括华为海思、寒武纪、海光信息等,其中华为 Ascend910 凭借自研 Da Vinci 架构和较高的能效比,成为国产高性能芯片的代表之一,尤其适用于 AI 训练和推 理场景。其运算能力达 512TOPS@INT8,位于国产芯片前列,仅次于平头哥含光 800 (825TOPS@INT8)。Ascend910 性能功耗比为 2TOPS/W,与英伟达 A100 持平,表明 其能耗控制能力达到国际主流水平。然而,国产芯片在显存带宽、架构等领域仍需持续 提升,以提高全球竞争力。

华为达芬奇架构(Da Vinci Architecture)是华为于 2018 年推出的自主研发 AI 计算架 构,专为人工智能(AI)计算任务设计,如矩阵计算、向量计算、张量计算。其核心目 标是以最小的计算代价增加矩阵乘的算力,实现更高的 AI 能效。

核心设计特点

1) 计算单元。昇腾 AI 处理器的计算核心主要由 AI Core 构成,包含三种基础计算资源:矩阵计算单元 (Cube Unit)、向量计算单元(Vector Unit)和标量计算单元(Scalar Unit),分别负责 执行张量、矢量、标量计算。

2) 存储系统。为了配合 AI Core 中数据的传输和搬运,围绕着三种计算资源还分布式的设置了一系列 的片上缓冲区,比如用来放置整体图像特征数据、网络参数以及中间结果的输入缓冲区 (Input Buffer,IB)和输出缓冲区(Output Buffer,OB),以及提供一些临时变量的高 速寄存器单元,这些寄存器单元位于各个计算单元中。输入缓冲区之后设置了一个存储 转换单元(Memory Transfer Unit,MTE)。这是达芬奇架构的特色之一,主要的目的是 为了以极高的效率实现数据格式的转换。

3) 控制单元。控制单元主要包括系统控制模块、标量指令处理队列、指令发射模块、矩阵运算队列、 向量运算队列、存储转换队列和事件同步模块。系统控制模块负责指挥和协调 AI Core 的整体运行模式,配置参数和实现功耗控制等。不同的执行单元可以并行的按照指令来 进行计算或处理数据,同一个指令队列中指令执行的流程被称作为指令流水线。事件同 步模块时刻控制每条流水线的执行状态,并分析不同流水线的依赖关系,从而解决数据 依赖和同步的问题。

1) 单卡级产品。华为昇腾加速卡系列是一组高性能的计算加速解决方案,为满足各种人工智能和大数据 处理需求而设计。该系列加速卡包括多款不同型号的产品,旨在提供灵活多样的计算能 力,以满足不同应用场景下的性能需求。 华为昇腾加速卡采用了先进的处理器架构和高速内存技术,确保了卓越的计算性能和数 据处理能力。其中,Ascend 系列处理器作为核心计算引擎,提供了强大的 AI 算力和 CPU 算力,支持多种算法和模型的高效运行。同时,这些加速卡还支持多种视频编解码格式 和 JPEG 图片编解码,进一步扩展了它们在多媒体处理领域的应用范围。在硬件规格方 面,华为昇腾加速卡提供了丰富的选择,包括不同数量的处理器核心、内存容量和存储 容量等配置。这些规格的选择旨在满足不同用户对计算性能和存储容量的需求,确保在 各种应用场景下都能获得最佳的性能表现。

华为昇腾 910

华为昇腾 910 是一款具有超高算力的 AI 处理器。它集成了多个基于达芬奇架构的 AI 核,以及 CPU、DVPP 和任务调度器等组件,形成了一个高集成度的片上系统(SOC), 从而具有自我管理能力,可以充分发挥其高算力的优势。在实际测试中,昇腾 910 的半 精度(FP16)算力达到 256 TeraFLOPS,整数精度(INT8)算力达到 512 TeraOPS,且 额定 TDP 仅为 300W,能效比表现出色。凭借其强大的算力和高效的能效比,昇腾 910 在 AI 训练等场景中展现出了卓越的性能,是华为在 AI 领域的一项重要技术成果。

华为昇腾 910B

华为昇腾 910B芯片最大功耗 400w,配备 64GB HBM2e,FP16性能达 320TFLOPS。 于 2023 年推出,采用 7+nm 制程工艺和华为自主研发的达芬奇架构,最大功耗为 400 瓦,配备 64GB HBM2e 高带宽内存。在计算性能方面,该芯片在 FP16 和 INT8 精度下表 现突出,分别达到 320 TFLOPS 和 640 TFLOPS,适合高吞吐量的人工智能推理和训练场景。整体来看,该芯片展现了华为在 AI 芯片领域的技术积累,尤其在低精度计算和能效 设计方面具备竞争力。

2) 服务器级产品。华为昇腾的服务器系列涵盖了高性能计算、训练和推理等多个领域,其中 Atlas800 系 列和 Atlas500Pro 系列是其中的重要代表。Atlas800 系列服务器专为高性能计算和大 规模数据处理而设计,包括多种型号以满足不同场景的需求。例如,Atlas800T 推理服务 器以其强大的处理能力和高效的资源利用率,在需要高性能推理的应用场景中表现出色。 Atlas500Pro 智能边缘服务器则专为边缘计算场景而设计。它紧凑的结构和高效的性能, 使得它能够在资源受限的边缘环境中提供强大的计算和推理能力。

3) AI 集群。Atlas 900 A2 PoD 支持高达 50.5kW 的最大功耗。其中 Atlas 900 A2 PoD 支持 256 个 DDR4 内存插槽,内存带宽最高可达 3200MT/s,确保了数据的高速读写和高效处理。而 Atlas 900 AI 集群则整合了 HCCS、PCIe 4.0 和 100G RoCE 三种高速连接接口,不仅提 供了高效的数据传输通道,还支持多种网络通信协议和存储协议,方便用户根据实际需 求进行灵活配置和扩展。在功耗和散热方面,华为昇腾 AI 集群系列采用了先进的液冷散 热技术,不仅有效降低了加速卡在工作过程中的温度,还提高了系统的稳定性和可靠性。 同时,Atlas 900 A2 PoD 还支持高达 50.5kW 的最大功耗,确保了在高负载情况下的稳 定运行。

2.软件:昇腾 CANN 提供高性能算子库

英伟达 CUDA((Compute Unified Device Architecture)将 GPU 从专用的图形处理 器转变为通用并行计算功能的平台。2006 年,英伟达推出了第一款支持通用运算的显卡 GeForce 8800 GTX,并在不久后推出了 CUDA。从此以后,原本只是图像渲染用的显卡 开始在其他领域大放异彩。CUDA 核心思想是将异构计算平台(如 CPU 和 GPU)抽象为 统一的编程模型,使得开发者能够使用熟悉的 C/C++语言来编写同时针对 CPU 和 GPU 的程序,而无需深入了解底层硬件的复杂细节。CUDA 通过提供一系列的 API 和库函数, 使得程序员可以轻松地将计算任务分配给最适合的设备,从而充分发挥异构计算系统的 性能优势。 CUDA 扩展 GPU 的并行计算能力,构建英伟达护城河。如 AI、深度学习、大数据分析、 科学计算等多个领域。例如,英伟达的 A100、V100 等 GPU 通过 CUDA 提供了巨大的计 算加速,成为 AI 训练、推理以及科学模拟等领域的核心计算引擎。像 GPT-3 等大规模语言模型的训练,就依赖于 CUDA 加速的英伟达 GPU 实现高效的并行计算。英伟达每款 GPU((如 Tesla、A100、RTX 系列等)都经过 CUDA 优化,使得它们能够在多个应用领域 中发挥卓越的性能。这种软硬件的深度集成是英伟达产品线能够保持市场领先的关键所 在,确保硬件和软件的无缝协作,增强了市场的依赖性和用户粘性,被称为英伟达的 “CUDA 护城河”。

华为昇腾 CANN 是针对 AI 场景推出的异构计算架构,对标英伟达 CUDA。通过提供多 层次的编程接口,CANN 能够支持用户快速构建基于昇腾平台的 AI 应用和业务。CANN 支持多种计算架构和计算框架,一套体系支持 CPU、NPU 等架构和多种 AI 计算框架, 包含了编程语言,编译及调试工具和编程模型,创造了基于昇腾系列处理器的一个编程 的框架,未来将持续演进。 CANN 的完整软件平台分为 4 层。Driver 实现硬件和操作系统的适配和支持。中间一层 提供了基础的服务,提供内存管理、算力分配和资源调动,内置硬件数字视觉解码器和 高性能算子库。同时,HCCL((Huawei Collective Communication Library,华为集合通信 库)提供了板间以及框间的通信能力,将昇腾训练处理器 100G 的 ROCE 接口宽带连接 能力发挥出来。上一层是图引擎,架构的核心模块,实现了大计算图的拆分、图融合, 最大化芯片算力利用率。

CANN 提供两种算子开发方式。相比业界主流的只有一种算子开发方式,CANN 实现了 效率和性能的最佳平衡。 1) TBE-DSL(Tensor Boost Engine-DomainSpecific Language)。基于 DSL 的语法规则 定义,可自动实现数据的切分和调度。对开发者来说,只需要关注计算的表达,写完 公式即可生成代码,相比业界,提升了 70%开发效率。 2) TBE-TIK((Tensor lterator Kernel)。该开发方式需要开发者提供指令级编程和调优的 能力,包括数据的编排、计算的表达,通过全过程人工干预,可以更好发挥芯片的极 致性能。 CANN 提供高性能算子库,预置超过 1000 个深度优化的硬件亲和算子,支持更优异的 运行性能。高性能算子库有以下主要特征。(1)统一算子中间表达:算子基于统一的中 间表达,支持多种不同的框架;同时,算子可以在多种框架中共享,相似算子无须重复 开发。(2)硬件解耦:算子和硬件解耦,实现异构计算架构在全场景的各种形式硬件中 的最佳运行性能。(3)动静结合:提供静态注册与动态执行相结合的方式,提高算子加 载的性能和执行效率。 开源框架 MindSpore 支持高效开发。同时,华为提供模型转换工具,支持主流模型便 捷地转换到 MindSpore。在架构层面,MindSpore 是面向端、边、云全场景的 AI 计算框 架,可以实现全场景自适应感知与协同。例如模型训练完成后,可以根据不同硬件形态 自适应生成相应大小的模型。MindSpore 还支持在端侧直接对模型进行轻量训练,更新 本地的推理参数。这样既保护了个人隐私,又提升了模型精度,实现模型“私人订制”。

MindSpore 致力于实现开发态友好、运行态高效、全场景按需协同三大目标。基于此, MindSpore 在动静态图转换、Auto Parallel((自动并行)以及端边云协同等方面出出了较 大的创新。 1) 动静态图转换。MindSpore 采用了基于 SCT(Source Code Transformation,源码翻 译)的 AD(Automatic differentiation,自动微分)机制,该机制可以将函数转换成 中间表达以及计算图,从静态图模式切换到动态图模式只需要一行代码,简化了动 态图和静态图之间的切换。 2) 自动并行。MindSpore 可以实现自动数据并行和模型并行的混合并行训练。用户只需 写串行单机模型,就能实现混合并行训练,兼顾易用和高性能。另外,MindSpore 可 以结合内存、计算和通信开销,为用户选择一个性能较优的并行切分策略实现大规 模网络的线性加速、自动扩展。 3) 端边云协同。MindSpore 针对“端、边、云”全场景提供了一致的开发和部署能力, 以及按需协同能力,让开发者能够实现 AI 应用在云、边缘和手机上的快速部署,全 场景互联互通,实现更好的资源利用和隐私保护,创造更加丰富的 AI 应用。 华为自主研发的深度学习开源框架 MindSpore,具有易用性强、性能优异等特点,并在 开源计算框架、数据框架和模型格式中支撑主流开源架构,构建生态基础。在开源开放 的生态环境中,开发者可与华为共同优化计算框架,从而应用于更多的场景,挖掘潜在 可能性。

3. 应用使能:2+1+X 助力开发

MindX 昇腾应用使能由 2 个组件((深度学习组件 MindX DL、智能边缘组件 MindX Edge)、 1 个模型库(优选模型库 Model Zoo)以及多个行业 SDK 组成,致力于让行业开发者以 最简单的方式开发应用。

MindX DL 提供参考架构,打造可用于开发商用版本的深度学习系统。MindX DL 通过增 强插件的方式部署在现有集群的控制节点,以支持 NPU 资源的调度,增强插件包括用于 设备发现的 Ascend Device Plugin、华为集合通信控制器 HCCL-Controller、用于集群亲 和性调度的 Volcano、以及设备监控 cAdvisor for Ascend。

MindX Edge 旨在让边缘 AI 应用触手可及。MindX Edge 是一个原生支持边云协同的中 间件 Agent,可实现快速将云端模型推送至边缘端部署,同时将边缘侧未识别数据上传 至云端进行增量训练。MindX Edge 支持多样化设备形态,可以统一支持摄像头、工控机、 机器人、无人机、边缘推理服务器等边缘设备。同时,MindX Edge 秉承极致轻量化部署 原则,内存开销小于 256M,CPU 资源占用率小于 3%。基于以上特点,MindX Edge 可 以帮助合作伙伴高效开发支持边云协同的边缘推理 AI 应用。

Edge Agent 边云协同中间件是由用于底层 docker 资源调度的 Edge Core、用于本地接 入管理及消息面转发的 Edge Site、用于对接设备管理系统及云端的 Edge Hub 三个组件 组成。通过 Edge Site,可对接更多功能如容器故障检测、双机备份、数据存储及高性能 消息总线等。 ModelZoo 将 AI 开发所需模型提前调优,确保精度性能,为解决开发者模型选型难、 模型训练难,数据获取难等问题而设计。深度神经网络模型是深度学习最核心的生产资 料。众多型如何选择,在不同的场景中如何针对性增量训练调优,开发者都要花费大量 的时间和精力反复尝试。ModelZoo 提供各类框架如 MindSpore、TensorFlow、PyTorch、 Caffe 等和多种场景如图像分类、推荐排序、目标检索、自然语言等网络模型。开发者仅 需进入昇腾开发者社区,即可快速下载所需模型。 SDK 凝聚行业知识,是结合 AI 最佳实践的软件开发套件。以制造业 AI 应用为例,开发 者须了解针对制造业的算法,了解训练过程、数据采集、数据预处理、数据增强,反复 调参,并进行多次推理验证。制造业 SDK 已提前为开发者完成上述工作,针对制造业端 到端的完整业务流程已提前预制好,开发者无需再写繁杂的训练脚本和模型算子。整个 的业务流程自动化完成,开发者仅需关注制造业的特殊业务流程。较未使用 SDK,使用 SDK 后仅需采集少量现场数据进行优化训练,优化时长由数月降至数周,万行的开发代 码甚至可降至百行代码。SDK 对整个过程进行预制化、二次封装和大量抽象,原本需消 耗 5 人·月的 AI 开发工作可缩短至 0.5 人·月,开发效率提升 10 倍。

参考报告REPORT

电子行业深度分析:国产算力佼佼者,昇腾产业链有望受益.pdf

电子行业深度分析:国产算力佼佼者,昇腾产业链有望受益。软硬件协同,构建昇腾强大生态体系。昇腾计算产业构建了涵盖多方的强大生态,其软硬件系统包含硬件体系、基础软件和应用使能。硬件体系以达芬奇架构为基石,从单卡到集群形成完善矩阵,Ascend910等芯片性能出色;软件方面,昇腾CANN对标英伟达CUDA,提供高性能算子库和多种开发方式,MindSpore开源框架助力高效开发;应用使能的MindX通过“2+1+X”模式,降低行业开发门槛,推动昇腾计算成为全场景AI基础设施。集群能力显著提升,CloudMatrix384规模上线。昇腾产品矩阵完善,能全面适配DeepSeekV3...

我来回答
分享至