深耕 GPU 算力领域,研发为导向不断提升产品竞争力。
采用主流 API,借助微软推广产品。从英伟达创立时,公司就以市场需 求为导向。通过匹配主流 API,不断技术更新逐渐减低产品价格,达到 消费者需求,以此来达到一家初创公司占领市场的目的。英伟达在设计 NV2 后的产品时,都将微软推出的 DirectX 作为匹配的 API。凭借着微 软 Windows 系列在操作系统市场占有大量份额,同时对 DirectX 和 OpenGL 加速优化,使得英伟达的产品广受欢迎。
压缩开发周期领先市场,为下游厂商提供更好的产品。英伟达把握住了 从 2D 到 3D 过渡的风潮,通过成熟的研发体系,用速度甩开 2D 图形厂 商。英伟达图形业务的快速产品周期得益于其运营模式。一般图形市场 产品有两个开发周期:6-9 个月和 12-18 个月,英伟达执行了“三团队两季度”的运营模式,具体方式包括三个并行开发团队,专注于三个独 立的分阶段产品开发。一个在第一年秋季,一个是在第二年春季以及第 二年秋季。这样的运行方式允许公司每 6 个月推出一次新产品,与图形 市场产品周期一致,并且领先市场 1-2 个研发周期。此外为解决芯片硬 件开发比软件开发慢的问题(软件可以快速测试并经过调试,通常是每天或每周一次;相比之下,芯片硬件就必须构建掩模并在进行电子测试 之前完成初步制造),英伟达大力投资了仿真技术,从而提升效率。
在产品布局多元化初期,用产品交叉服务市场。英伟达在经历了手机端 芯片市场开拓的失败之后,并没有停止 Tegra 处理器的研发,而是改变 产品定位,将 Tegra 处理器运用在智能汽车、智慧城市和云端服务上。 于是英伟达初步奠定了“两产品条线-四市场”的商业模式。两产品条线 包括了英伟达传统产品 GPU 和 Tegra 处理器,而四市场则包括了游戏、 企业级、移动端、云端。
英伟达的商业模式战略很好的应对了图像处理器市场的发展趋势。当时 的图像处理器市场产品细化,主要分布在游戏玩家、企业级、平板电脑 和移动端用户,不同客户的需求差异化明显,针对不同下游英伟达推出 了对应的产品方案: (1)游戏市场:玩家希望能够在不同的平台无缝的进行游戏体验,英 伟达为此推出了端到端的服务:游戏能够在云端运行,不需要玩家拥有 足够高性能的电脑。大大提高了玩家碎片时间的利用率和娱乐的灵活性。 (2)企业级:产品则是为汽车、电影、天然气等行业提供可视化解决 方案,目的是提高行业生产力。英伟达面向企业市场的产品包括用于工 作站的 Quadro,用于高性能计算服务器的 Tesla 和用于企业 VDI 应用 程序的 GRID。 (3)移动端:英伟达不再将移动端客户拘泥于手机端用户,而是将移 动端扩展到移动智能设备市场,比如智能汽车、智能家居行业。英伟达 的移动战略转变为了将 Tegra 应用到需要视觉设计的设备中。 (4)云端服务:伴随着计算机行业的发展也成为了可视化计算服务的 重要一环。凭借云端技术,英伟达将 GPU 的应用从 PC 端拓展到服务器 和数据中心,使得更多的用户可以使用。英伟达开发的 GRID 使 Adobe Photoshop 远程运行,并与应用程序交互。

英伟达 AMD 双寡头垄断显卡市场。在 2009 年 Intel 取消 Larrabee 图形 显卡项目之后,独立显卡市场逐渐成为了双寡头市场。相较于行业的潜 在新进入者,英伟达和 AMD 拥有更长的经营历史、更大的客户基础、 更全面的知识产权和专利保护,以及更多的融资、销售、营销和分销资 源,二者共同构筑了行业新进入者无法逾越的天堑。研发方面,2005 年,AMD 的研发费用为 11 亿美元,是英伟达的 3.2 倍左右,而到了 2022 年,英伟达的研发费用达到了 73.4 亿美元(对应 2023 财年),是 AMD 的 1.47 倍。由于性能、构建、价格的不同,二者逐步产生差异化,形成 了错位竞争。至 2022 年第三季度,英伟达基本占据 88%市场份额,AMD 则降低至 8%。
研发投入带给英伟达高回报,在主流游戏和显卡天梯测评上,AMD 落 后于英伟达。英伟达在 2018 年推出的 Titan RTX 和 RTX 2080 Ti 全面 超过当时的 Radeon VII,其采取的策略是推出比 AMD 稍高的性能和价 格。即使技术比 AMD 领先,也会等到 AMD 推出更高性能的产品之后, 才会推出,以此来获得比 AMD 更高的收益。
专利数量方面英伟达逐步反超 AMD。AMD 此前在专利数量上一直多于 英伟达,但申请的数量呈现下降趋势。英伟达在 2011 年之后申请专利 数量开始爆发,主要因其在 2007 年之后开始研发移动端 GPU 和深度学 习领域,最终给 GPU 市场带来了新的框架和更高性能的芯片。
CUDA 助力英伟达成长为 AI 产业龙头,构建强大生态护城河壁垒。 CUDA 是英伟达基于其生产的 GPUs 的一个并行计算平台和编程模型, 目的是便于更多的技术人员参与开发。开发人员可以通过 C/C++、 Fortran 等高级语言来调用 CUDA 的 API,来进行并行编程,达到高性 能计算目的。CUDA 平台的出现使得利用 GPU 来训练神经网络等高算 力模型的难度大大降低,将 GPU 的应用从 3D 游戏和图像处理拓展到科 学计算、大数据处理、机器学习等领域。这种生态系统的建立让很多开 发者依赖于 CUDA,进一步增加了英伟达的竞争优势。
CUDA 的低成本和兼容性成为其最重要的吸引点之一。英伟达的 CUDA 是一个免费、强大的并行计算平台和编程模型。安装过程简单且明确, 让开发者能够轻松快速地启动并行编程。CUDA 对新手极其友好,特别 是对 C 语言、C++和 Fortran 的开发者。同时为支持其他编程语言,如 Java、Python 等,CUDA 还提供第三方包装器进行扩展。为广大开发者 提供了极大的便利和高效的编程体验。操作系统方面,CUDA 在多种操 作系统上也都有良好的兼容性,包括 Windows、Linux 和 macOS。
CUDA 有着丰富的社区资源和代码库,为编程提供良好的支持。英伟达 的 CUDA 享有强大的社区资源,这个社区由专业的开发者和领域专家组 成,他们通过分享经验和解答疑难问题,为 CUDA 的学习和应用提供了 丰富的支持。另外,CUDA 的代码库资源涵盖各种计算应用,具有极高 的参考价值,为开发者在并行计算领域的创新和实践提供了宝贵的资源。 这两大特点共同推动了 CUDA 在并行计算领域的领先地位。
CUDA 借助燕尾服效应,搭配 GeForce 覆盖多元市场。CUDA 技术最 初是为了配合 GeForce 系列芯片而推出的,利用 GeForce 在游戏市场 的广泛覆盖率,作为一个技术杠杆,推动 CUDA 的普及和发展。作为一 项可以帮助 GeForce 拓展新的市场的重要技术,CUDA 极大地提高了视 频和图像应用(如 CyberLink、Motion DSP 和 Nero)的性能,实现了 多倍的效率提升。
创业公司的大量采用使得 CUDA 应用场景进一步得到拓展,游戏不再是 唯一应用领域。随着时间的推移,超过一百家创业公司开始利用 CUDA 的强大计算能力,使其应用领域得以扩展,不再局限于游戏方面。在视 频编码领域,英伟达与 Elemental 公司合作,利用并行计算技术加速了 高清视频的压缩、上传和存储速度。这一成功的合作不仅体现了 CUDA 在各种场景下的适用性,也进一步推动了 CUDA 技术的发展。当 Elemental 公司后被亚马逊收购,其基于 CUDA 的视频处理技术也成为 AWS 的服务组成部分,这一过程也让 CUDA 的使用场景得到了进一步 的丰富和拓宽。

CUDA 形成完整生态链,通过大学普及学习以推广 CUDA。英伟达将 CUDA 引入了大学的课堂中,从源头上扩大了 CUDA 的使用范围和受众 群体。早在 2010 年,已经有关于 CUDA 数千篇论文,超过 350 所大学 进行 CUDA 教学课程。在此基础之上,英伟达建立了 CUDA 认证计划、 研究中心、教学中心,不断完善 CUDA 的生态链。从结果看:2008 年 仅有 100 所大学教学 CUDA 课程,在 2010 年英伟达全球建立了 20 个 CUDA 研发中心后,2015 年已有 800 所大学开放 CUDA 课程。
对比 OpenCL,CUDA 是英伟达 GPU 编程的更优解。OpenCL 虽然具 有更广的兼容性,但 CUDA 由于与英伟达的硬件紧密结合,能更有效地 利用其 GPU 的性能。同时,CUDA 的编程模型相比 OpenCL 更加简洁, 易用,并提供完整的开发工具链。此外,CUDA 的社区资源丰富,代码 库多样,使得在科学计算、深度学习等领域的应用更为便捷。因此,对 英伟达 GPU 的开发者来说,CUDA 往往是更优的选择。
对比 ADM 的 CTM 编程模型,CUDA 拥有更广泛的应用和更高的操作 性。从操作性来说,由于 CTM 更接近硬件,因此开发者需要有更深入 的硬件知识才能进行开发,但是这也意味着 CTM 能够提供更精细的控 制和优化。对比之下,CUDA 提供了一套完整的开发工具链,包括编译 器、调试器和性能分析工具,以及丰富的库函数,为开发者提供了极大 的便利。从应用来说,CUDA 已经在各种领域获得了广泛的应用,尤其 是在科学计算和深度学习等领域,CUDA 拥有大量的优化库和开发工具。 而 CTM 的应用相对较少,但是由于它提供了对硬件的低级别控制,因 此在一些特定的应用场景中会具有优势。
对比微软的 DirectCompute, CUDA 胜 在配套设施的支持。 与 DirectCompute 相比,CUDA 由于其丰富的功能库,完善的开发工具和 广泛的应用支持,尤其在科学计算和深度学习领域,具有明显优势。 CUDA 在英伟达 GPU 上的性能优化也更为出色。而 DirectCompute 作 为跨平台工具,其优势在于与DirectX的兼容性以及对多种硬件的支持。 但从英伟达 GPU 的应用广泛度来看,使用 CUDA 才是开发者的首选。 总的来说,虽然 DirectCompute 的通用性更强,但英伟达的 CUDA 在功 能、性能和应用范围上提供了更强大的支持,对于使用英伟达硬件的开 发者来说是更优的选择。
CUDA 的开发提升了英伟达的品牌竞争力和影响力。CUDA 的开发使英 伟达的 GPU 超越了仅用于图形处理的传统角色,转变为通用的并行计 算设备,极大地提升了其在市场上的竞争力。英伟达因此能够满足广泛 的高性能计算和人工智能需求,使其产品得以进入新的市场领域。同时, 随着 CUDA 在各类高性能计算任务,特别是人工智能领域的广泛应用, 英伟达的品牌影响力得到了显著增强。越来越多的人开始认知和使用英 伟达的产品,这不仅加强了英伟达的市场地位,也为其未来的发展奠定 了坚实的基础。
CUDA 促进了英伟达的产品创新,激发更多可能性。CUDA 的开发推动 了英伟达在并行计算技术领域的创新,尤其在硬件架构方面。这不仅体 现在优化了的 GPU 架构上,例如将流多处理器(SM)配臵为处理并行 线程的方式,也在软件架构上如 CUDA 自身的持续更新和优化。为了更 有效地满足用户对于更高性能和更易用并行计算工具的需求,英伟达不 断创新,致力于提高 CUDA 的性能和用户体验。这一切不仅反映出英伟 达对创新的重视,也为其在并行计算技术领域的领导地位提供了坚实的 技术支撑。
英伟达的 CUDA 技术凭借其广泛应用和强大合作伙伴网络,巩固了英伟 达的领导地位。CUDA 技术在众多领域均有广泛应用,包括但不限于深 度学习、图像和自然语言处理、天气模拟、流体动力学、分子动力学、 量子化学以及天体物理模拟。因此,适配 CUDA 的应用程序数量繁多, 进而催生了对 CUDA 的广阔需求空间。英伟达与诸如 Dell、HP、联想 等知名 OEM 厂商,以及 Netapp、Pure Storage 等渠道合作伙伴和如埃 森哲等服务公司展开了深度合作。
CUDA 整合英伟达体系,培养了开发者和使用者的用户粘性。当开发者 融入 CUDA 的生态系统,他们往往会被其卓越的计算性能、充裕的库函 数和出色的易用性所吸引,因此更倾向于持续利用此技术。另一方面, 为 CUDA 优化的代码移植至其他平台通常需要消耗大量的精力和时间, 这进一步增强了客户的留存度。此外,英伟达不断推陈出新,发布新的 硬件产品及 CUDA 版本,从而维持用户对其技术的关注并持续使用。这 种深度使用使得用户在选购硬件产品时倾向于选择对 CUDA 有更好支 持的英伟达产品,进而建立起稳固的客户忠诚度。
根据 IDC 的测算,全球数据总量将以每年 50%的增速不断增长,在 2025 年数据量会增加到 334ZB,在 2035 年则将达到 19267ZB。随着 5G 落地, 应用方案更加具象化,未来随之出现的数据总量和数据分析需求将会持 续上升。增长的数据量主要来源于 IoT、移动互联网、智慧城市、自动 驾驶。大数据的应用将会从商业分析向工业、交通、政府管理、医疗、 教育等等行业渗透,并且成为产业供应链中不可或缺的一部分。
从目前的测算来看,智能驾驶将是算力要求最高的应用层面。一方面汽 车驾驶对于安全可靠性性要求最高,另一方面 L5 级别的汽车会携带的 传感器将达到 32 个,据麦肯锡估算一辆自动驾驶汽车的数据量将达到 4TB/h,Intel 测算出的一天数据量将达到 4000GB。而英伟达的 Xavier 目前只有 1.3TFlops,还达不到处理 L5 的数据能力,自动驾驶和 ADAS 市场在接下来的 10 年之间有望保持较高增长的态势,因此智能驾驶以 及 ADAS 存在着巨大的算力缺口。

人工智能产业将拉动 GPU 行业发展。根据 Tractica 的数据,2018 年全 球 AI 硬件市场的收入为 196 亿美元,其中 GPU 的收入占 36.2%为 71 亿美元。而在 2025 年将达到 2349 亿美元,其中 GPU 的收入占 23.2% 为 545 亿美元。尽管 GPU 市场占比出现下滑,但是全球 AI 硬件市场在 不断上升,将会给 GPU 市场带来更多的增长空间。
CPU 受到摩尔定律约束,应用性能增幅下降。人工智能的到来没有因为 摩尔定律的放缓而停止到来。登纳德定律是通过缩小晶体管的尺寸和电 压让设计师在保持功率密度时提高晶体管的密度和速度。但目前受到物 理条件的限制,CPU 架构师需要大量增加电路和能量,获得有限的 ILP(指令级并行)。因此,在后摩尔定律时代,CPU 晶体管需要消耗更多 的性能导致应用性能的小幅提高。最近几年 CPU 的性能仅以每年 10% 的速度增长,而过去是每年 50%。
GPU 凭借超高运算速度成为高性能计算的宠儿,相比 CPU 提高了数倍 的计算效率。在人工智能领域,图形处理器(GPU)凭借其卓越的并行 计算能力和大规模处理单元,成为大数据运算的主力。这在深度学习模 型的训练和推断等任务中表现得尤为明显。尽管中央处理器(CPU)在 顺序化任务处理方面具有优势,但其并行计算性能远不如 GPU。自 2006 年亚马逊在卷积神经网络(CNN)中首次使用 GPU,其效率就已显著 优于 CPU。如今,随着技术不断发展和更新,GPU 在运算效率上进一 步超越 CPU,坚定地确立了其在 AI 时代的算力核心地位。
尽管 FPGA 具有编程灵活性,但 GPU 的处理效率却更胜一筹。FPGA 是专用集成电路(ASIC)中的一种半定制电路,被称为现场可编程门阵 列,其性能介于定制电路和可编程器件之间。可以通过硬件描述语言 (HDL)按照特定任务或者应用程序的需求来搭配相应的 HDL。相比较 于 ASIC,FPGA 能够使用 OpenCL 快速编程,更加具有成本效益。微 软预测基于 FPGA 的 BrainWave 推理平台可以在达到每秒约传输 500 张图像。但是对比这两种硬件,GPU 从效率上更显优势,例如英伟达的 Tesla P4 就能够在 75w 的能耗上一秒传输 1676 张图像。
英伟达以其创新力和高市场份额,在全球 GPU 市场中居于领导地位。 英伟达 GPU 领域享有显著的市场份额,在 2022 年 Q3 英伟达市场占有 率达到了历史新高 88%。这一优势体现了其在行业中的龙头地位。其持 续的技术创新和强大的研发实力,尤其是 CUDA 并行计算平台的推出, 进一步巩固了其在市场中的优越地位。在人工智能和机器学习的加速应 用下,英伟达的 GPU 已成为行业内的首选解决方案,广泛应用于各个 领域,从游戏和专业视觉应用到数据中心和自动驾驶汽车。
回顾英伟达的发展历程,其成功的经验在于以下几点: (1)英伟达持续十几年深耕 GPU 高性能计算潜力,产品矩阵丰富,抓 住下游人工智能和 5G 浪潮,推动 GPU 市场从游戏显卡转变为 AI 计算 加速处理器; (2)搭建 CUDA 生态,提高自身产品附加值,构建强大的软件护城河 壁垒。通过大学、研究院加快 CUDA 开发,吸引人工智能行业人员加入 CUDA,将其打造成英伟达 GPU 核心竞争力; (3)加大研发投入,强大的研发能力使英伟达能够实施创新技术,不断 更新 GPU 架构拓展业务范围,扩大 GPU 市场,提高营收和利润率,达 成产业链的良性循环。
解析复盘英伟达,借鉴算力龙头发展路径。伴随生成式 AI 火热,大模型 持续发展对算力提出更高要求,英伟达进入快速发展时期。我们认为复 盘英伟达能够学习海外龙头的成长经验,为国产厂商提供发展思路。此 外,随国内算力行业国产替代进程持续推进,看好国产供应链厂商发展 机遇。