2024年英伟达公司研究:超级工厂是怎样炼成的

  • 来源:浙商证券
  • 发布时间:2024/04/12
  • 浏览次数:849
  • 举报
相关深度报告REPORTS

英伟达公司研究:超级工厂是怎样炼成的.pdf

英伟达公司研究:超级工厂是怎样炼成的。公司成立自1993年,早期专注图形计算芯片,针对游戏机、PC市场,2006年推出CUDA进军通用计算,逐步形成GPU+CPU+DPU的三芯布局,应用领域也从游戏拓展至数据中心、专业可视化、自动驾驶等,目标客户涵盖CSP、商业企业、消费者;公司上市以来,收入成长超160倍,市值增长超2700倍,在全球AI芯片市场的市占率最高已经达到90%。历史复盘:强自研+前瞻并购丰富产品矩阵,通用生态形成坚实护城河(1)2000年前,从“狂野西部”通用图形计算起步,凭借更加高效的研发模式、绑定大客户微软胜出并定义世界首款GPU:研发上,公司采用了&...

1 英伟达:全球算力王者,加速计算时代的 AI 超级工厂

1.1 上市以来收入成长超 160 倍,市值增长超 2700 倍

公司是全球领先的 GPU 算力龙头。公司于 1993 年由 Jenson Huang(黄仁勋)及来自 于 Sun Microsystem 的两位工程师 Chris Malachowsky 和 Curtis Priem 创立,专注图形计算 芯片的设计与研发,公司经历了起步积累、困境反转、转型升级和快速成长四个阶段,并 成长为全球 AI 算力领军,根据 Gartner 预计,公司在全球 AI 芯片市场的市占率最高已经 达到 90%。

1.2 三芯片四领域,构筑全面产品矩阵

基础芯片层面,公司基于 GPU 技术路线,通过自研+并购形成 GPU+CPU+DPU 的三 芯布局: (1)2000 年推出全球首款 GPU 以来不断进行迭代升级,目前 GPU 领域产品涵盖消 费级、工作站级、移动级到高性能计算的多种类型,即将在 2024Q2 出货的 H200 Tensor Core GPU 基于 NVIDIA Hopper™ 架构,FP16 下算力达到 989TFLOPS,同时是首款提供 HBM3e 的 GPU,以每秒 4.8 TB 的速度提供 141GB 内存,与前身 A100 相比容量几乎翻 倍,带宽增加 2.4 倍,针对 GPT-3 模型的推理性能是 A100 的 18 倍; (2)2020 年收购 Mellanox 后推出的 BlueField DCU 能够有效减少 CPU 负荷,提升整 体系统性能,BlueField-3 DPU 与上一代相比,具备 2 倍的网络带宽、4 倍的计算能力和几 乎 5 倍的内存带宽,能够以高达 8 倍的速度运行工作负载,同时降低 TCO 并提高数据中心 能效; (3)2021 年推出的自研 Grace 系列 CPU 超级芯片基于 ARM v9 架构设计,相较于现 有数据中心使用的 x86 CPU,运行微服务的速度快 2.3 倍,内存密集型数据处理性能快 2倍,在多个技术计算应用上运行流体力学计算工作时速度快 1.9 倍;为了进一步满足巨型 人工智能和高性能计算工作负载的需求,公司还发布了将 Grace CPU 和 Hopper GPU 封装 在一起的 Grace Hopper Superchip,以及将两个 Grace CPU 在同一款 PCB 上互联的 Grace Superchip;

行业客户层面,公司布局了游戏、数据中心、专业可视化、自动驾驶市场四大领域: (1)数据中心:公司 2016 年至今以及未来长期的增长点。公司为云厂商(CSP)、企 业、公共部门的数据中心、智算中心、超算中心提供基于 CPU+GPU+DPU 芯片、IB+以太 网等网络设备的硬件系统,以及 AI 加速库、开发工具、应用等软硬件一体的解决方案;随 着云端数据中心需求的爆发以及公司三芯布局的形成,公司数据中心业务近五年收入复合 增速高达 74.56%、近三年复合增速高达 92.18%,2023 年全年实现收入 475.25 亿美元,同 比+216.73%,其中 2023Q4 实现收入 184.04 亿美元,同比+409%; 公司自 2011 年的 Tesla M2090 开始不断更新迭代数据中心产品,下一代 B100 采用 Blackwell 架构,将使用台积电的 4nm 工艺,与现有采用 Hopper 架构的 H200 系列相比, 性能提升超过 100%。

(2)游戏业务:公司的起家业务和基本盘,以先进技术引领行业发展。公司提供分 别面向 PC 和笔记本的 GeForce 系列 RTX 和 GTX 显卡硬件、可在性能不足的设备上玩 PC 游戏的 GeForce NOW 云游戏服务、在电视上播放高质量流媒体的 SHIELD 服务以及用于 游戏机的平台和开发服务;随着挖矿浪潮的兴起以及公司光追系列显卡的推出,公司游戏 业务近五年复合增长率达到 10.91%,2023 年全年实现收入 104.82 亿美元,同比+15.61%, 其中 2023Q4 实现收入 29 亿美元,同比+56%,为其他业务提供了稳定的现金流; 游戏业务见证了公司的成长史,每一代微架构的升级都带来了性能的显著提升:2018 年公司推出的首款支持实时光线追踪的 Turing 架构 GeForce RTX 2080 显卡,可以在游戏中通过模拟光线的物理行为,实现电影级质量的实时渲染,引领了 3A 大作发展的方向;公 司推出的 DLSS(深度学习超级采样抗锯齿)技术在不影响游戏性能的同时,能提供与 TAA 抗锯齿技术几乎相同的画质,根据快科技测试,RTX 2080 DLSS 的性能领先上一代 GTX 1080 TAA 达到了 80%。

(3)专业可视化:专业图形领域领导者。公司为独立软件供应商(ISV)合作,为在 设计与制造环节与数字内容创作环节的 3D 艺术家、建筑师和产品设计师等提供从桌面到 云端的 RTX 和 Quadro 解决方案;随着大模型的兴起,企业工作站也开始进行更新迭代, 2023 年全年实现收入 12.72 亿美元,同比-3.56%,其中 2023Q4 实现收入 4.63 亿美元,同 比+105%。

(4)自动驾驶:前瞻布局的中长期增长业务。公司通过 DRIVE 系列品牌,为交通运 输业构建出软件定义的端到端平台及解决方案,客户可以基于该平台快速高效地开发自动 驾驶产品;硬件端包括 Orin、Atlan、以及将于 2025 年投入生产的 Thor SOC,软件端包括 针对车载加速计算率先推出的安全操作系统 OS,针对自动驾驶汽车开发的 DriveWorks 中 间件,包含感知、地图构建和规划层的 AV 软件栈,AI 辅助驾驶平台 Chauffeur,为 AI 驾 驶舱创新解决方案提供舱内感知的开放软件平台 IX,实现实时对话式 AI 的 Concierge,使 用准确的真值地图和可扩展的车队来源地图来创建和更新自动驾驶汽车地图 Map 等产品; 2023 年全年实现收入 10.90 亿美元,同比-17.36%,其中 2023Q4 实现收入 2.81 亿美元,同 比+24.34%。

1.3 三十年专注的高研发投入,奠定高业绩成长基石

与 Intel、AMD 相比,CUDA 软件生态带来的毛利率、净利率优势明显。公司上市以 来毛利率及净利率随行业及业务的变化经历了三个阶段: 1)上市前至 2003 年,受公司与微软就 Xbox 降价问题的影响,公司毛利率从 2001 年 的 37.92%下跌至 2003 年的 29.01%、利润率则从 12.92%下降至 4.08%,后续随着公司与 Intel、索尼签单,毛利率、净利率逐步回升;2)2004-2008 年,受全球经济危机、研发 CUDA 初期的技术不成熟影响,当时的 G84/G86 核心产品出现了过热而导致花屏的“显卡门”事件,公司毛利率从 2007 年的 45.62%下跌至 2008 年的 34.29%,利润率则从 19.46%转负为-0.88%,后续随着 2009 年 Fermi 架构的 GPU 推出,毛利率、净利率实现了快速修复; 3)2009 年至今,在全球经济复苏以及 CUDA 带来的软件生态优势拉动下,与 Intel、 AMD 相比,公司毛利率、利润率开始呈现明显领先的上升态势,毛利率持续上行从 2008 年的 34.29%提升至 2023 年的 72.7%、净利率也同步从-0.88%大幅提升至 48.85%。

公司常年专注投入研发,研发费用处于高位水平。上市以来,公司通过“三团队-两季 度”的研发模式以及聚焦 GPU 研发,实现了在单一领域与友商相比更高的研发投入: 1)在 1999-2005 年与 ATI 的竞争中,公司的研发费用从 1999 年的 0.32 亿美元快速提 升至 2005 年的 3.52 亿美元,CAGR 达到 61.54%; 2)在 2006 至今与 AMD 的竞争中,公司的研发费用从 2005 年的 3.6 亿美元快速提升 至 2023 年的 86.75 亿美元,CAGR 达到 19.34%;与 AMD 相比,2005 年公司研发投入为 AMD 的 32.73%,而 18 年后的 2023 年,公司研发投入已是 AMD 的 1.47 倍;同时由于公 司聚焦 GPU 的研发而 AMD 则需要同时对 CPU 进行投入并于 Intel 展开竞争,我们估计 2023 年在 GPU 领域的研发投入倍数将大于 1.47。

凭借超强的研发投入实现了强大的产品力,销售及管理费用率从常年的 10%逐步下 降。公司上市以来销售费用率稳定在 10%并呈逐步下降趋势;2021 年销售及管理费用率从 10.01%提升至 11.63%,主要原因是收购 Mellanox;2023 年,由于公司数据中心业务的爆 发,公司销售及管理费用率下降至 4.36%。

2 历史复盘:用产品定义算力发展史

2.1 2000 年前:从“狂野西部”通用图形计算起步,凭借更加高效的研发模 式、绑定大客户微软胜出并定义世界首款 GPU

“Pre GPU”时期,图形计算芯片技术快速迭代,百家争鸣:上世纪 90 年代初,高性 能图像主要用于图形工作站和视频游戏机中,1995 年微软推出的 Windows 95 具备音视频 等多媒体功能、大量 3D 渲染游戏登录 PC 平台、图形芯片集成度提升推动了 3D 图像市场 的发展;因而“Pre GPU”时期的图形计算芯片技术路线经历了单纯辅助 CPU 进行图形显 示、可进行 2D 加速计算、可进行 3D 加速计算、具备固定的渲染管线四个阶段,S3、 ATI、AMD、英伟达、3DFX 等众多大小玩家展开激烈竞争,一度形成“百家争鸣”局面,激 烈的市场竞争带来的是图形处理芯片的快速迭代和演进。

英伟达成立初期专注图形计算芯片的 PC 消费市场:1993 年,Jenson Huang(黄仁 勋)及来自于 Sun Microsystem 的两位工程师 Chris Malachowsky 和 Curtis Priem 认为个人 电脑将会成为游戏、多媒体的主流消费设备,因而共同创立了英伟达(Nvidia),专注于图 形计算芯片的设计与研发。 1994-2000 年公司完成了技术和产品积累:1994 年,公司与意法半导体首次开展战略 合作,意法半导体为公司制造单芯片图形用户界面加速器;1995 年,公司发布首款产品 NV1;1997 年,公司推出 RIVA 128 系列产品,凭借高性能+低结构成本而广受市场好评, 出货量超过 100 万台,在性能方面甚至优于英特尔于下一年推出的 i740,而 Intel 则逐步退 出了独立显卡市场;1998 年,公司与台积电建立合作伙伴关系,自此 OEM 成为公司重要 的销售模式;1999 年,公司推出了世界第一款 GPU——GeForce 256,整合了关键的硬件 变换和光照(T&L)、立方环境材质贴图和顶点混合、纹理压缩和凹凸映射贴图、双重纹理 四像素 256 位渲染引擎等功能,并且兼容 DirectX 和 OpenGL 两大通用 API;2000 年,公 司成功收购曾在 1995 年推出消费领域史上第一款 3D 图形加速卡 Voodoo 的图形显卡先驱 3dfx。

在图形市场发展初期,面对技术及标准不成熟、行业迭代速度快且竞争激烈等难题, 公司凭借“三团队-两季度”的更快速高效的研发运营模式比竞争对手更加快速地响应下游 需求的变化、推出全面的产品矩阵、果断绑定大客户微软实现了份额的快速提升,从而在 竞争中胜出: (1)研发上,公司采用了“三团队-两季度”的高效研发模式实现了技术和产品的快速 迭代:图形市场产品研发周期包括短周期(6-9 个月)和长周期(12-18 个月)两类,公司 则采用“三团队-两季度”的研发模式,即采用三个并行开发团队专注于第一年秋季、第二 年春季、第二年秋季这三个独立的分阶段产品开发,这使得公司可以每 6 个月推出一次新 产品,领先市场 1-2 个研发周期,能够更快满足下游需求的变化; (2)产品上,公司不断丰富产品矩阵:公司在 GeForce 256 时代便通过 DDR、SDR 和 TNT 三个系列实现了高中低端的全面布局; (3)战略上,公司绑定大客户微软:NV1 由于不兼容竞争 3dfx 的 GLIDE 3D 主流技 术标准、成本高、无性能优势因而市场表现平平,公司一度陷入破产的边缘;此时公司做 出了重大决定:支持当时微软刚刚推出的 Direct 3D 标准与 GLIDE 进行竞争,依靠着 Windows 95 操作系统的高占有率,英伟达 Riva 128 显卡出货量逐渐上升并超越 3dfx,后续 凭借 GeForce 256 扩大优势并最终收购 3dfx。

2.2 2000-2005:客户多元化,通过性能优势掌握 PC 独显龙头地位

GPU 时代初期,大客户微软引领图形硬件标准,图形显卡双雄局面形成:2001 年, 微软发布了包含全新 Shader Model(优化渲染引擎模式)1.0 标准的 DirectX 8.0,由于遵循 这一接口标准的 GPU 具备顶点和像素的可编程性,微软开始引领图形硬件标准,图形显卡 领域呈现英伟达、ATI(后被 AMD 收购)双寡头的局面。 2001-2005 年,与微软合作失败后,公司积极寻求多元客户支持,并通过产品性能再 度占据 PC 独显龙头地位: (1)2000 年公司为微软首款 Xbox 游戏机提供图形处理器,但因交付价格问题产生矛 盾而失去了订单(改为竞争对手 ATI 供应),这使得公司 2003 年营收减少,错过了微软 DirectX9 规格确立的重要消息,直接导致当年推出的 GeForce FX 由于兼容性问题败给 ATI 的 Radeon9700; (2)面对困境,公司积极寻求多元客户支持:1)主动与微软和解,争取再次合作; 2)和 Intel 达成了专利交叉许可协议;3)争取到为索尼 PS3 游戏机开发处理器的订单、与 暴雪娱乐合作发布基于 3D 图形世界的全球大型多人在线游戏《魔兽世界》; (3)持续迭代:2004 年,公司汲取以往教训推出全新的 GeFroce 6800Ultra,并凭借 优异的产品性能再次夺回 GPU 老大的地位;至 2006 年,ATI 被 AMD 斥资达 54 亿美元收 购,后续专向中低端市场,自此公司牢牢掌控了 GPU 高端市场并重回增长轨道;

2.3 2006-2015:以游戏业务筑基,培育以 CUDA 为核心的通用计算体系

因时机和定位失误,错失手机终端机遇:2006-2011 年,以智能手机为代表的移动终 端逐步兴起,2010 年功能与设计理念领先业界 3 年的划时代产品 iPhone 4 带来了全球智能 手机渗透率的二阶导拐点,2009-2015 年智能手机渗透率从 14.38%提升至 74.08%;公司早在 2003 年便开始通过收购布局移动端图像芯片,认为未来能实现通话和多媒体功能的手机 将成为重要市场,此后的 2008 年公司依靠平板和游戏机的优势推出了针对移动端的 Tegra,但由于高通凭借基带技术占据主流,而 Tegra 后续芯片未能及时整合基带技术而无 法及时占领市场,公司因而错失了移动时代机遇,此后公司果断放弃手机市场并将 Tegra 处理器运用在智能汽车、智慧城市和云端服务上。

超前推出 CUDA 进军 GPGPU,开始构建生态护城河:

(1)让只做 3D 渲染的 GPU 技术通用化:早期的 GPU 使用顶点着色单元和像素渲染 单元两种计算资源,两种处理器数量的最佳比例是随应用的变化而变化的,因此经常出现 一种处理器不够用、而另一种处理器闲置的情况,公司首席科学家 David Kirk 认为给 GPU 装备一组完全相同的、具有较强编程能力的内核,根据任务情况在顶点和片元处理任务之 间动态分配可以极大程度提升 PC 的计算性能,同时将丰富的并行运算资源分享给开发 者,便可具备重要的战略意义,因而公司开始投入大量研发资源。

(2)坚定方向铺长路:2006 年,公司推出了能够让 GPU 计算变得通用化的 CUDA (Compute Unified Device Architecture)编程技术,并让公司的每一颗 GPU 都支持 CUDA;2007 年,公司推出了不具备绘图能力的第一代大规模并行运算芯片 Tesla;CUDA 初期投入成本较高,并给公司带来了较大的业务压力: 1)在技术方面,芯片面积增大、散热增加、成本上升、故障率增高,直接导致后续 G84/G86 核心的产品出现了过热而导致花屏的“显卡门”事件,而公司也因此付出了近 2 亿 美元的一次性支出代价来解决产品质量问题; 2)在研发上,保证每款产品的软件驱动都支持 CUDA,会对公司的工程师带来巨大 的额外工作量; 3)在资金上,一旦项目启动,在当时每年公司预估要在核心业务关系并不紧密的 CUDA 平台上投资高达 5 亿美元,而 2006 年公司总收入 30.68 亿美金; 4)在外部环境上,2008 年 CPU 巨头 AMD 收购公司对手 ATI 并形成了 CPU 整合 GPU 的新解决方案;Intel 也终止了与英伟达的合作并在自家芯片组中集成了 3D 图形加速 器;2008 年经济危机也导致了全球 PC 和独显出货量同时出现了负增长;

(3)公司在内忧外困的情况下仍然坚持投入研发,研发费用逐年攀升:2009 年公司 推出 Fermi 架构的 GPU,因而经营得以快速恢复,再次夺回市场领先地位,此后公司通过 制程的进步及芯片设计的优化持续迭代引领行业;根据创事记,事后来看,公司在将 GPU 转化为更通用的计算工具上投入了将近 100 亿美元;

(4)通用计算价值初现,应用领域拓展:CUDA 拓展了 GPU 的应用领域,让只做 3D 渲染的 GPU 得以从游戏(图形渲染)向外扩展至高性能计算、自动驾驶等多个领域, 结合前期在游戏、移动领域的积累,公司逐步形成四大产品线:GeForce(PC、笔记本)、 Quadro(工作站)、Tesla(大型高性能计算)、Tegra(移动产品);

(5)2006 年以来,公司持续推进 CUDA 通用计算生态建设: 1)架构端,公司每 2 年推出一个微架构,并对四大产品线进行全面升级; 2)硬件端,公司 2019 年收购了网络芯片龙头 Mellanox,并形成了 CPU+GPU+DPU 三芯布局; 3)软件端,公司研发了大量的加速库、开发工具链,极大程度提升了易用性; 最终公司形成了快速迭代的硬件+深度捆绑的软硬件+大量外围的二次开发者和易用的 软件生态三位一体的生态飞轮。

终端多元化背景下,聚焦高端游戏卡稳定增长态势:2012 年,平板电脑、笔记本电脑 等终端的多元化使得 PC 出货开始呈下降趋势,同时集显性价比的逐步提升挤占了独显市 场空间,公司战略聚焦高端游戏卡,通过 GeForce 系列站稳脚跟;根据公司披露,2010- 2015 年公司游戏业务收入五年 CAGR 达到 21%,游戏显卡出货量五年 CAGR 为 9%、ASP五年 CAGR 为 11%,游戏业务实现了逆势增长,并为公司创造了确定的业绩增长与健康的 现金流,奠定了通用 GPU 和 AI 业务爆发的基石。

2.4 2016 至今:CUDA 开花结果,云端数据中心业务开启新一轮成长曲线

2016 年至今,算力需求侧经历了大数据及云服务(2016-2018)、云端办公和娱乐 (2020-2021)、云端 AI 训练(2023 至今)三大阶段,公司借助 CUDA 成长为全球算力龙 头。

2.4.1 2016-2019:大数据与云服务阶段,凭借 GPU 的通用性登上数据中心芯片王座

大数据催生数据上云需求。2016-2018 年,大数据的发展及移动互联网流量产生的海 量数据催生了数据上云的需求,同时分布式编程模式 MapReduce、分布存储和管理技术、 虚拟化技术等关键技术的成熟使得云服务能给客户带来的的经济价值提升,海外云厂商纷 纷自建大规模数据中心,2016-2017 年,亚马逊、微软、谷歌、Meta 四大云厂商 Capex 从 309.62 亿美元增长至 405.66 亿美元,资本支出同比增长 31%。 CUDA 积累的 GPU 通用能力直接带来公司数据中心业务爆发。海量数据带来的计算 需求激增,公司通过开发 CUDA 将 GPU 实现了通用化,2016 年推出的 Pascal 架构的 P100 具备 3840 个 CUDA 核,在海量数据的并行运算上具备显著优势,公司凭借 Tesla 系列 V100、T4、P100、P4 等产品拔得头筹。在 Liftr 与 2019 年进行的调查中显示,公司的 Tesla 系列产品在阿里云、亚马逊 AWS、微软 Azure、谷歌 GCP 四大云厂商中的专用加速 器占有率分别为 82%、89%、100%和 100%,呈现绝对龙头地位;根据海豚投研,公司在 TOP500 系统中的份额从 2016 年的 6%迅速增长至 2017 年的 24%,一年内增长了 3 倍。

2.4.2 2020-2022:云端办公和娱乐阶段,收购整合打造最强数据中心异构芯片+高速互联+ 网络安全解决方案体系护城河

卫生事件带来的云端办公和娱乐需求驱动了云厂商的第二轮数据中心建设周期,数据 处理及带宽互联是关键。2020 年,卫生事件导致全球生产经营和日常活动都受到了影响, 催生了企业上云、人民消费娱乐上云的需求,亚马逊、微软、谷歌、Meta 四大云厂商合计 Capex 从 2020Q1 至 2022Q4 连续 12 个季度保持同比 20%以上的高速增长,云厂商开启了 第二轮建设周期;同时,企业要求数据中心除了简单的存储以外,能够实现一定程度的数 据分析,虚拟机和容器(containers)等技术的流行也使得应用程序更多放在多台服务器上 进行分布式运行,这两大趋势要求未来的数据中心需要同时具备大规模数据处理能力和高 带宽互连技术。 收购整合构筑数据中心上下游一体的体系化护城河。公司于 2019 年斥资 69 亿美金收 购了 InfiniBand 和以太网领军 Mellanox,而 Mellanox 则在 2020 年收购了网络安全和智能 IP 提供商 Titan IC,该套娃式收购大大提升了公司云端 AI 产品体系的竞争力,将公司在单 机上的生态优势成功拓展到了分布式集群中:分布式训练对于数据交互的需求非常高,而Mellanox 的数据互联方案+英伟达的 GPU 底层接口可以成为完善的工程解决方案,Titan IC 提供的网络安全和内容智能又能够实现在硬件加速器中检测恶意入侵的网络流量并减少了 CPU 负载,最终公司构建起了包含人工智能芯片及生态+高速数据互联解决方案+网络安全 加速的横跨多个领域的完整方案。 DPU 专为减少 CPU 负荷、进一步提升大规模数据中心系统效率而生。数据大爆发的 时代,仍存在 CPU 处理效率低下、GPU 处理不了的负载,如网络虚拟化、硬件资源池化 等基础设施层服务,DPU 可作为 CPU 的卸载引擎,通过承担网络、存储、安全等业务, 提升整个计算系统的效率、降低整体系统的总体拥有成本(TCO)。

公司集成 CPU+GPU+DPU 形成三芯异构硬件布局,实现数据中心芯片体系的“降本 增效”。公司在 2020 年凭借 Mellanox 原有的 ConnectX 系列高速网卡技术,推出了 DPU (数据处理器)BlueField-2,并在 2021 年推出了匹配的 DOCA(Data-Center-InfrastructrueOn-A-Chip-Architectrue,即“线上数据中心基础设施体系结构”)生态,BlueField 系列 DPU 在支持网络处理、安全和存储功能的同时,实现网络虚拟化、硬件资源池化等基础设 施层服务,同时可释放高达 30%的 CPU 资源;而 DOCA 软件框架使开发者能够在 BlueField DPU 上快速创建应用程序和服务,为开发者构建软件定义、硬件加速网络、存 储、安全和其他基础设施应用程序提供了一个全面的开放平台。

2.4.3 2023 至今:大模型浪潮引爆公司数据中心业务成长

GPT 本质是基于 Transformer 架构的大模型。GPT,全称"Generative Pre-training Transformer",最初是一个由 OpenAI 开发的自然语言处理(NLP)的模型,通过预训练和 生成技术以及 Transformer 的自注意力机制,可以理解和生成人类的自然语言,比传统的 RNN、CNN 更快、更稳定、准确率更高、回答更富有逻辑性、并具备强大的泛化能力。

大模型对于算力的需求体现在模型训练和推理应用两个阶段:

(1)训练阶段:根据 OpenAI 的论文《Scaling Laws for Neural Language Models》 (2020 年发表),训练阶段算力需求=3×前向传递操作数×模型参数数量×训练集规模,训 练所需 GPU 数量=总算力需求/(每个 GPU 每秒运算能力×训练时间×有效算力比率),因此 我们可以得到,单次训练 GPT-4 需要约 2.65 万张 A100。

(2)推理阶段:同样根据 openAI 论文可以得到,单次 GPT-4 推理所需要的算力成本 约为 0.05 美分,按照 AIPRM 统计,截至 2023 年 12 月,ChatGPT 拥有约 1.8 亿用户,平 均每月产生 17 亿次网站浏览量,则平均每天访问次数为 567 万次,假设每次访问进行 10 轮推理对话,则平均每秒进行推理次数为 17/30*10/3600*10^8≈157407 次,对应 GPT-4 需 要 A100 为 27.7 万张。

大模型引爆算力需求。根据 IDC 预计,数据中心 GPU 市场预计将从 2022 年的 103 亿 美元增长至 2027 年的 654 亿美元,CAGR 达到 44.55%;AMD 报告显示,2023 年全球 AI 芯片市场规模会达 450 亿美元左右,预计 2027 年将增长到 4000 亿美元,2023 年-2027 年 复合增速超过 70%。

公司凭借数据中心产品和生态体系一飞冲天。公司 2023Q3-2023Q4,数据中心业务收 入分别达到 145.14、184.04 亿,同比增速达到 278.66%、408.96%;截至 2024 年 3 月 27 日,市值达到 2.3 万亿美元,较 2023 年初涨幅超过 530%。

顺势而为切入云端定制 ASIC。由于算力成本高企,云计算公司纷纷开始自研芯片以 部分替代英伟达产品,根据财联社,2 月 9 日消息人士透露,英伟达正在建立一个新的业 务部门,专注于为云计算等公司设计定制芯片以及先进的人工智能(AI)处理器; 我们认为公司此举既能减少客户自研芯片带来的替代压力,又能为长期芯片走向降本 化、定制化提前做好准备。我们认为,从 10 年维度下的长期视角来看,单位算力成本的下 降是确定的趋势,根据 CSET 报告《AI Chips: What They Are and Why They Matter》,与 GPU 相比,ASIC 芯片在训练上的效率平均约为 10 倍、推理上的效率约为 100 倍,因而随 着大模型的发展逐步进入成熟期,ASIC 的芯片市场规模有望逐步提升,根据研究公司 650 Group 的 Alan Weckel 的估计,数据中心定制芯片市场今年将增长到高达 100 亿美元,到 2025 年将翻一番。

前瞻布局移动基站,剑指边缘计算。根据新浪财经、财联社,英伟达正在与电信基础 设施建设者爱立信就一款包含芯片设计公司的图形处理单元(GPU)技术的无线芯片进行 谈判,同时软银和英伟达将联合成立一个新的行业协会“AI-RAN 联盟”,电信巨头爱立 信、诺基亚等全球约 10 家公司也将参加其中,致力于将利用移动通信基站分散 AI 处理的 技术实用化。 我们认为长期看,未来 AI 算力增量需求场景将逐步由云向边缘、端侧转移,公司有 望在边缘侧复制云端的成功经验。根据 TDIA 预计,2023 年底全球 5G 基站将突破 480 万 个,650 Group 的 Weckle 预计电信定制芯片市场每年约为 40 亿至 50 亿美元。

3 巨头成长之路总结:专注带来前瞻,通用诞生生态

3.1 专注计算芯片,带来前瞻战略思维

专注 GPU,保持高强度研发投入。英伟达以图形处理器起家,1999 年,英伟达发布 了世界上第一个正式的 GPU——GeForce 256。随后,公司持续加大研发投入,深耕 GPU 领域,无论是游戏显卡、数据中心加速卡、自动驾驶芯片、可视化领域,英伟达不断推展 产品终端用户群体的同时,始终保持 GPU 产品的研发和迭代。公司研发费用率常年保持在 20%-30%,同时随着营收规模的增长,研发人员以及研发金额也不断攀升。

“三团队两季度”驱动创新。英伟达成立伊始,为了应对图形芯片市场激烈的竞争, 采用“三团队两季度”的研发策略,将研发团队分为产品、硬件、软件三个团队,每个团 队专注于自身负责领域以保证产品创新性,同时两季度研发模式保证公司每六个月迭代一 次产品,领先市场研发周期的同时,充分满足下游市场需求。 产品端:专注游戏显卡领域竞争,迎合玩家需求快速迭代产品。2010 年后,英伟达和 AMD 逐渐抢占其他公司份额,成为独立显卡领域唯二的巨头。随后在游戏显卡领域,英 伟达加速产品迭代速度以及性价比的提升,逐步提升市场份额,截止 2023Q3,英伟达独立 显卡市场份额达到 81.50%。我们认为,正是公司专注于 GPU 研发,带来了游戏显卡的快 速迭代以及性价比的快速提升,牢牢抓住玩家需求,最终成长为市场龙头。

微架构创新,从底层突破 GPU 性能与效率。公司自 2006 年自研的 Tesla 架构开始。 不断更新 GPU 架构,平均两年迭代一次 GPU 架构。目前公司旗舰产品采用 Hopper 架构, 采用台积电 4nm 制程,下一代游戏显卡 RTX50 系产品以及数据中心产品 B100 将采用Blackwell 架构,将使用台积电的 4nm 工艺,与现有采用 Hopper 架构的 H200 系列相比, 性能提升超过 100%。公司 GPU 架构发展历程详见图 27。 前瞻性:预见 CUDA 生态的革命性。英伟达于 2006 年开发 CUDA,从今天的眼光来 看,这项决策领先了市场十年之久,对比另一家 GPU 巨头 AMD,AMD 于 2015 年为了对 标 CUDA 生态开发了 ROCm,落后英伟达 9 年。

3.2 注重技术复用性,让研发投入落到实处

决策高效干脆,放弃手机芯片市场。2008 年公司依靠平板和游戏机的优势推出了针对 移动端的 Tegra,但由于高通凭借基带技术占据主流,而 Tegra 后续芯片未能及时整合基带 技术而无法及时占领市场,公司因而错失了移动时代机遇,此后公司果断放弃手机市场并 将 Tegra 处理器运用在智能汽车、智慧城市和云端服务上。

技术复用,开辟汽车芯片市场。2015 年国际消费类电子产品展览会上,英伟达发布新 一代移动超级芯片 Tegra X1 处理器,该处理器在性能上是上一代产品 Tegra K1 的两倍。 该处理器适配 NVIDIA DRIVE PX 汽车自动驾驶计算平台,可处理来自 12 个车载摄像头的 视频,以实现环绕视觉 (Surround-Vision) 和自动代客泊车 (Auto-Valet) 等功能。虽然英伟 达在移动芯片领域折戟沉沙,但其技术上极强的复用性,最终使其成功转向至汽车芯片领 域。

3.3 重视通用性,引入生态共建

GPGPU:通用化漫漫长路。GPU 一开始只是为了图形加速,替 CPU 分担工作。其主 要用于显示图像、视频的编解码与显示、游戏渲染等工作,起初并不支持编程。在 1999 年 之前甚至没有 GPU 这一概念,只是称为图形加速卡。英伟达发现了 GPU 在并行计算方面 的优势,并且在科学、工程和人工智能领域,许多问题都可以通过并行计算来加速解决。

CUDA 出现之前,GPU 的编程面临多重挑战: 1)编程模型不足:没有一种通用的编程模型来利用 GPU 的计算能力。开发人员需要 使用低级别的图形 API(如 OpenGL 或 Direct3D)来执行计算任务。这些 API 并不专门用 于通用计算,因此编写代码变得复杂且容易出错。 2)数据传输成本高:将数据从 CPU 传输到 GPU 的成本很高。这涉及到数据的复制 和传输,而这些操作会降低性能。 3)无法发挥并行性:开发人员需要手动管理 GPU 并行性,这对于复杂的计算任务来 说是巨大的人力成本。 降低开发者门槛,让 GPU 真正意义上“可编程”。在经 GPU 加速的应用中,工作负 载的串行部分在 CPU 上运行,且 CPU 已针对单线程性能进行优化,而应用的计算密集 型部分则以并行方式在数千个 GPU 核心上运行。使用 CUDA 时,开发者使用主流语言 (如 C、C++、Fortran、Python 和 MATLAB)进行编程,并通过扩展程序以几个基本 关键字的形式来表示并行性。 英伟达的 CUDA 工具包提供了开发 GPU 加速应用所需的一切。TensorRT 基 于 CUDA 平台并行编程模型构建,使开发者能够在英伟达 GPU 产品上使用量化、层和张 量融合、内核调整等技术来优化推理。TensorRT 是英伟达基于 CUDA 一款用于高性能深度 学习推理的 SDK(Software Development Kit),使用门槛相对较低,可以运用 C++ 、 Python API 导入和加速模型。

TensorRT 在低门槛开发的同时,能够最大化挖掘 GPU 性能。NVIDIA TensorRT-LLM 是一个开源库,可加速和优化 NVIDIA AI 平台上最新大型语言模型 (LLM) 的推理性能, 而无需深入了解 C++ 或 CUDA。

CUDA 平台允许开发者利用英伟达的 GPU 来加速计算密集型任务。在全球范围内, 许多行业领军者采用 CUDA 平台最大化其 GPU 性能。

我们认为,正是公司 CUDA 低门槛的特性、GPU 过硬的性能,引入了大批开发者建 设 CUDA 生态社区,最终 CUDA 绑定了数百万 AI 开发者,当 CUDA 几乎与 AI 画等号的时候,会有大量的社区力量为其助力。这就是一种良性循环:好的性能带来好的生态, 好的生态会有助于更好的性能。最终帮助英伟达构建了强大的 CUDA 生态护城河。

4 国内相关公司:逐步追赶,国产化趋势已现

4.1 华为昇腾:对标英伟达,有望成为国内第二

AI 算力生态 昇腾处理器支持全场景。昇腾处理器是全球首个覆盖全场景 AI 芯片,基于统一的达芬 奇架构,可以支持端边云不同场景的差异化算力需求,并具备从几十毫瓦 IP 到几百瓦芯片 的平滑扩展,覆盖了端边云全场景部署的能力:

昇腾 910 训练处理器具有超高算力,FP16 下性能最高可达 320TFLOPS。昇腾 910 集 成了 CPU Core、DVPP 和任务调度器(Task Scheduler),可以减少和 Host CPU 的交互,充 分发挥其高算力的优势;还集成了 HCCS、PCle 4.0 和 ROCE v2 接口,为构建横向扩展 (Scale Out)和纵向扩展 (Scale Up)系统提供了灵活高效的方法,科大讯飞创始人、董事长刘 庆峰表示华为的 GPU 能力可以对标英伟达 A100;

华为昇腾 AI 产业生态包括昇腾 AI 基础软硬件平台,即 Atlas 系列硬件、异构计算架 构 CANN、全场景 AI 框架昇思 MindSpore、昇腾应用使能 MindX 以及一站式开发平台 ModelArts 等。基于昇腾 910 系列板卡,华为推出了 AI 训练集群 Atlas900、AI 训练服务器 Atlas800、智能小站 Atlas500、AI 推理与训练卡 Atlas300 和 AI 加速模块 Atlas200,完成了 Atlas 全系列产品布局,支持万亿参数大模型训练,同时覆盖云、边、端全场景。 华为提出了具备分层开放、体系协同、敏捷高效、安全可信等特征的,全行业通用的 行业智能化参考架构。其中智能底座提供大规模 AI 算力、海量存储及并行计算框架,支 撑大模型训练,提升训练效率,提供高性能的存算网协同。根据场景需求不同,提供系列 化的算力能力。适应不同场景,提供系列化、分层、友好的开放能力。另外,智能底座层 还包含品类多样的边缘计算设备,支撑边缘推理和数据分析等业务场景。

4.2 海光信息:类 CUDA 带来更好的生态兼容性

海光 DCU 属于 GPGPU 的一种。性能上,海光深算一号 DCU 内核频率、显存位宽已 逐步接近英伟达 A100,在显存容量、带宽、算力、互联性能上仍有一定的进步空间;深算 二号已于 2023 年 Q3 发布,实现了在大数据处理、人工智能、商业计算等领域的商业化应 用,具有全精度浮点数据和各种常见整型数据计算能力,性能相对于深算一号实现了翻倍 的增长;深算三号研发进展顺利。

在 AIGC 持续快速发展的时代背景下,海光 DCU 能够完整支持大模型训练,实现 LLaMa、GPT、Bloom、ChatGLM、悟道、紫东太初等为代表的大模型的全面应用,与国 内包括文心一言等大模型全面适配,达到国内领先水平。

DCU 产品具备完善的软件栈支持。海光 DCU 协处理器全面兼容 ROCm GPU 计算生 态,由于 ROCm 和 CUDA 在生态、编程环境等方面具有高度的相似性,CUDA 用户可以 以较低代价快速迁移至 ROCm 平台,因此 ROCm 也被称为“类 CUDA”。因此,海光 DCU 协处理器能够较好地适配、适应国际主流商业计算软件和人工智能软件,软硬件生态丰 富,可广泛应用于大数据处理、人工智能、商业计算等计算密集类应用领域,主要部署在 服务器集群或数据中心,为应用程序提供高性能、高能效比的算力,支撑高复杂度和高吞 吐量的数据处理任务。 海光 DCU 具备开放式生态和统一底层硬件驱动平台,支持常见计算框架、库和编程 模型层次化软件栈,适配不同 API 接口和编译器可最大限度利用已有的成熟 AI 算法和框 架。

4.3 寒武纪:云端芯片性能持续扩展,云边终端协同覆盖

云端 AI 推理,高能效比国产芯片。思元 270 集成了寒武纪在处理器架构领域的一系 列创新性技术,处理非稀疏人工智能模型的理论峰值性能提升至上一代思元 100 的 4 倍, 达到 128TOPS(INT8);同时兼容 INT4 和 INT16 运算,理论峰值分别达到 256TOPS 和 64TOPS;支持浮点运算和混合精度运算。思元 270 采用寒武纪 MLUv02 架构,可支持视 觉、语音、自然语言处理以及传统机器学习等多样化的人工智能应用,更为视觉应用集成 了充裕的视频和图像编解码硬件单元。 推理卡研发迭代,性能持续提升。思元 370 是寒武纪首款采用 chiplet(芯粒)技术的 AI 芯片,集成了 390 亿个晶体管,最大算力高达 256TOPS(INT8),是寒武纪第二代产品思 元 270 算力的 2 倍。凭借寒武纪最新智能芯片架构 MLUarch03,思元 370 实测性能表现更 为优秀。思元 370 也是国内第一款公开发布支持 LPDDR5 内存的云端 AI 芯片,内存带宽 是上一代产品的 3 倍,访存能效达 GDDR6 的 1.5 倍。搭载 MLU-Link™多芯互联技术,在 分布式训练或推理任务中为多颗思元 370 芯片提供高效协同能力。全新升级的寒武纪基础 软件平台,新增推理加速引擎 MagicMind,实现训推一体,大幅提升了开发部署的效率, 降低用户的学习成本、开发成本和运营成本。

先进工艺保障芯片制造。公司已掌握 7nm 等先进工艺下开展复杂芯片物理设计的一系 列关键技术,并且已将其成功应用于思元 100、思元 220、思元 270、思元 290、思元 370 等多款芯片的物理设计中。

4.4 景嘉微:发布景宏系列高性能计算产品,商业化布局有望加速

公司是国内首家成功研制国产 GPU 芯片并实现大规模工程应用的企业,掌握了包括 芯片底层逻辑/物理设计、超大规模电路集成验证、模拟接口设计、GPU 驱动程序设计等关 键技术,2010 年,公司自研 GPU 项目获得国家“核高基”专项支持。2014 年研发 JM5400,2018 年研发 JM7200。公司在 GPU 体系结构、图形绘制高效处理算法、高速浮点 运算器设计、可复用模块设计、快速大容量存储器接口设计、低功耗设计等方面有深厚的 技术积累,先后研制成功 JM5 系列、JM7 系列、JM9 系列等具有自主知识产权的高性能 GPU 芯片。 2024 年 3 月,公司披露景宏系列产品研发进展。景宏系列是公司推出的面向 AI 训 练、AI 推理、科学计算等应用领域的高性能智算模块及整机产品,支持 INT8、FP16、 FP32、FP64 等混合精度运算,支持全新的多卡互联技术进行算力扩展,适配国内外主流 CPU、操作系统及服务器厂商,能够支持当前主流的计算生态、深度学习框架和算法模型 库,大幅缩短用户适配验证周期。

编辑:火腿肠
  • 相关标签
  • 相关专题
  • 热门文档
  • 热门文章
  • 本年热门
  • 本季热门
  • 本月热门
  • 本年热门
  • 本季热门
  • 本月热门
分享至