海光信息DCU特点及商业落地情况如何?

海光信息DCU特点及商业落地情况如何?

最佳答案 匿名用户编辑于2024/05/22 14:13

 深算系列展现性能优势,商业落地进展显著。

海光信息 DCU 具备以下两大特点:(1)GPGPU 架构:运算协处理器的主流方案。GPGPU 是专注于通用计算的图形处理器。GPGPU 全称为通用计算图形处理单元,GPGPU 在 GPU(图形处理单元)的基础上增加了通用计算能力,这使得其用于图形渲染,还能够高效执行各种通用计算任务,包括科学计算、数据分析、深度学习等。 GPGPU 目前是最流行的 AI 算力芯片技术路线。运算协处理器基于不同的设计思想存在多条技术路线,包括 GPGPU、ASIC、FPGA 等。其中,ASIC性能优异,功耗比佳,但一种 ASIC 芯片只能单一地解决一种问题,因此缺乏灵活性。FGPA芯片功耗能效比高,灵活性强,但价格较高,计算能力和峰值性能不如GPU。综合考虑性能、能效比和编程灵活性等方面因素,GPGPU 在协处理器应用领域具有非常明显的优势,也是目前最流行的技术路线,广泛应用于商业计算、人工智能和泛人工智能等领域。

(2)类 CUDA 生态:兼容性好。CUDA 架构是适合大规模数据密集型计算的并行计算架构。CUDA(ComputeUnified Device Architecture,统一计算设备架构)诞生于2006 年,是一种由NVIDIA推出的通用并行计算架构,包含了应用于 NVIDIA GPU 的指令集(ISA)以及GPU内部并行计算引擎。CUDA 程序构架分为两部分:Host 和Device。一般而言,Host指的是 CPU,Device 指的是 GPU。在 CUDA 程序构架中,主程序还是由CPU来执行,而当遇到数据并行处理的部分,CUDA 就会将程序编译成GPU能执行的程序,并传送到 GPU。它让 GPU 不仅能够处理图形任务,还能够处理科学计算、机器学习、密码学等领域的复杂和耗时的计算任务。 CUDA 生态成熟,软硬件深度绑定。与其他架构相比,CUDA的显著优势在于其完备的生态。经过英伟达持续的更新和维护,CUDA 已经具备丰富成熟的软件生态:CUDA 能够支持多种编程语言和第三方工具链、可快速部署多领域常用库、应用程序更易加速。

CUDA 的竞争者:OpenCL 与其余厂商推出的类CUDA 生态。OpenCL(OpenComputing Langugae,开放运算语言),是面向异构系统( CPU、GPU及其它处理器)的并行编程的开放式标准,由苹果于 2008 年协同多家厂商共同推出。与只能够在NVIDIA 设备上运行的 CUDA 框架不同,OpenCL 是跨平台的,也是开源的,可以在大多数类型的硬件上(包括 FPGA 和 ASIC)运行,Intel、NVIDIA、ARM、AMD、Apple 都有其对应的 OpenCL 实现。ROCm 全称为Radeon Open Computingplatform,是基于 AMD GPU 系列开源设计的计算生态,目标是建立与NVIDIACUDA生态可替代的平台。为了实现对 CUDA 平台的可替代性,ROCm 复制了CUDA的技术栈,这使得其能够较好地兼容 CUDA 平台上的功能。

海光 DCU 基于 ROCm 架构,能够兼容 CUDA 生态。海光DCU协处理器全面兼容 ROCm GPU 计算生态,由于 ROCm 和 CUDA 在生态、编程环境等方面具有高度的相似性,CUDA 用户可以以较低代价快速迁移至ROCm平台,ROCm也被称为“类 CUDA”。因此,海光 DCU 协处理器能够较好地适配、适应国际主流商业计算软件和人工智能软件,软硬件生态丰富,可广泛应用于大数据处理、人工智能、商业计算等计算密集类应用领域,主要部署在服务器集群或数据中心,为应用程序提供高性能、高能效比的算力,支撑高复杂度和高吞吐量的数据处理任务。

深算一号基本达到同类型产品水平。海光 DCU 基于大规模并行计算微结构进行设计,在双精度浮点计算、单精度、半精度、整型计算方面表现同样优异,是一款计算性能强大、能效比较高的通用协处理器。此外,海光DCU集成片上高带宽内存芯片,可以在大规模数据计算过程中提供优异的数据处理能力。与英伟达、AMD高端 CPU 产品相比,DCU 的第一代产品海光“深算一号”生产工艺同为7nm制程,内存频率和显存位宽与 A100 基本相当,显存容量、显存带宽和显存频率相当于A100的 50%左右,差距比较大的是多卡协同的交互速率,只有A100 的30%。总体来讲,海光深算一号的性能预计能达到英伟达 A100 的 40%以上的水平。

DCU 系列产品不断迭代,深算二号、三号进程加速。深算二号已于2023三季度正式发布,实现了在大数据、人工智能、商业计算等领域的应用。深算二号具有全精度浮点数据和各种常见的整型数据计算能力,性能相比深算一号提升100%。此外,深算三号也在加紧研发中。 海光 DCU 适配性良好,商业应用得到认证。海光DCU 主要部署在服务器集群或数据中心,为应用程序提供性能高、能效比高的算力,支撑高复杂度和高吞吐量的数据处理任务。在 AIGC 持续快速发展的时代背景下,海光DCU能够支持全精度模型训练,实现 LLaMa、GPT、Bloom、ChatGLM、悟道、紫东太初等为代表的大模型的全面应用,与国内包括文心一言等大模型全面适配。此外,百度飞桨与海光 DCU 已经完成互证。百度飞桨深度学习框架与海光人工智能加速卡DCU系列进行了安装部署测试、基本功能测试和稳定性兼容性测试,联合测试结果显示百度飞桨深度学习框架在海光 DCU 系列以及海光 3000、5000、7000 系列CPU环境上均能顺利安装,可以可靠、稳定、高性能地运行,满足用户的关键性应用需求。PaddleROCm版当前可以支持在海光 CPU 与海光 DCU 上进行模型训练与预测。当前PaddleROCm 版同样支持海光 DCUToolKit 工具包(DTK)。

参考报告REPORT

海光信息研究报告:国产CPU+DCU龙头,AI算力国产化势不可逆.pdf

海光信息研究报告:国产CPU+DCU龙头,AI算力国产化势不可逆。国产CPU及DCU龙头企业,经营状况持续向好。海光信息成立于2014年,主要从事高端处理器、加速器等计算芯片产品和系统的研究与开发。目前,公司在通用处理器(CPU)和协处理器(DCU)方向已经具备海光系列、深算系列两大成熟产品线并持续迭代升级。公司经营状况持续向好,公司已于2021年净利润扭亏为盈,2018-2023年公司营收与归母净利润持续保持增长势头。CPU性能领先,信创需求扩大市场空间海光信息消化吸收AMD授权技术,目前已具备产品自主迭代能力。截至2023年底,公司根据不同应用场景陆续推出海光7000、海光5000、海光3...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

用户解答榜
分享至