英伟达业务布局情况如何?

英伟达业务布局情况如何?

最佳答案 匿名用户编辑于2024/03/25 11:27

英伟达架构持续升级,升级迭代速度明显加快。

均两年架构升级,目的是维持在GPU霸主地位:根据CSDN数据,英伟达14年期 间发布8款芯片架构,我们判断芯片架构的持续升级有望维护其在GPU市场的龙头 地位。

英伟达架构升级速度明显加快:根据财联社以及SemiAnalysis消息,预计在H200 芯片架构后,B100将于2024年第三季度开始量产,部分早期样品将于明年第二季 度出货。而GH200和H200也是于2023年开始问世,同时,AMD也推出了MI300AI 算力芯片,谷歌直接表示要打造自己的人工智能基础设施,其TPUv5和TPUv5e可 用于内部培训和推理,还供苹果、Anthropic、CharacterAI等公司客户使用。我们 判断英伟达架构升级明显处于加速状态。

CUDA Core和Tensor Core 构成了英伟达AI的绝对护城河:在机器学习领域,训练一个机器学习模型需要对大型数据进行筛选。但是 随着数据集的数量、复杂度和交叉关系的增加,处理能力的需求呈指数级增长。机器学习经常通过内置的CUDA core和Tensor core 阵 列来完成机器学习任务(训练和推理)。

CUDA Core 是用于通用并行计算任务的计算核心:可以执行单精度和双精度浮点运算,以及整数运算。它在处理广泛的并行计算任务 方面非常高效。CUDA Cores是实时计算、计算密集型3D图形、游戏开发、密码散列、物理引擎和数据科学计算的主要硬件,在机器学 习和深度学习领域,以及TB级别数据训练上,GPU也是重要核心硬件。CUDA 的广泛应用造就了GPU计算专用 Tesla GPU的崛起。

Tensor Core专为AI而生:Tensor Core 是针对深度学习和 AI 工作负载而设计的专用核心,可以实现混合精度计算并加速矩阵运算,尤 其擅长处理半精度(FP16)和全精度(FP32)的矩阵乘法和累加操作。Tensor Core 在加速深度学习训练和推理中发挥着重要作用。 而Tensor Core的推出是在Volta架构上推出。

HPC面向超算市场,需要强大的计算功能:HPC通过聚合计算能力来提供比传统计算机或服务器更强大的计算性能。HPC面向的应用 领域为CAE 仿真、动漫渲染、物理化学、石油勘探、生命科学、气象环境,由于HPC应用领域面向的是更加“精细化”的市场,准确 度的要求明显超过速度要求,单精度和双精度浮点运算更加符合其要求。

生成式AI引燃算力需求,AI领域计算速度要求超过精度:由于生成式AI的应用目的为“成为释放生产力”的双手,面向的是模型训练和 模型推理,其目的是赋能千行百业的人工智能应用,应用场景相较于HPC更加“通用化”,因此其对计算性的要求能力更高,对精度要 求相较于HPC较低,因此低精度(相较于HPC)更符合AI的需求。

HPC与AI加速融合,英伟达Tensor Core持续升级,巩固其龙头地位:目前HPC与AI呈现加速融合的态势,我们判断支持单一类型精度 运算逐渐被市场淘汰,英伟达Volta架构Tensor Core只支持FP16精度,而Hopper架构支持FP64、TF32.bfloat16、FP16FP8、INT8等 精度的计算,更符合现在市场对于生成式AI与HPC加速融合的需求。

跨时代巅峰之作品Ampere架构,采用第三代Tensor Core技术:Ampere 架构于2020年5月发布,NVIDIA A100 Tensor Core GPU 可在各个规模下 为AI、数据分析和高性能计算(HPC)应用提供出色的加速性能。 NVIDIA A100 的深度学习运算性能可达 312 teraFLOPS(TFLOPS)。其深 度学习训练的Tensor 每秒浮点运算次数(FLOPS)和推理的Tensor 每秒万 亿次运算次数(TOPS) NVIDIA Volta™ GPU的20倍,其Tensor Core全面 支持FP64、TF32、FP16、INT8、INT4、INT1等精度。由于其出色的性 能与支持精度,因为我们认为其具有跨时代的意义。

Ampere同样采用NVlINK与高带宽显存来提高其性能:A100中采用的 NVIDIA NVLink可提供两倍于上一代的吞吐量。此技术可将多达 16 个 A100 GPU互连,并将速度提升至600GB/s。高带宽显存(HBM2E), A100 提供超过 2TB/s 的超快GPU显存带宽, 并将动态随机存取存储器 (DRAM)的利用效率提高至95%。

参考报告REPORT

AIGC行业专题报告:Sora算力倍增,国产架构+生态崛起.pdf

AIGC行业专题报告:Sora算力倍增,国产架构+生态崛起。全球算力架构升级战已打响。英伟达架构持续升级,升级迭代速度明显加快,平均两年架构升级,我们判断目的是维持在GPU霸主地位,根据新浪财经报道,B100将于2024年第三季度开始量产,部分早期样品将于明年第二季度出货。而我们认为英伟达TensorCore专为AI而生,目前其Hopper架构已经为第四代,Hopper架构超强性能,可加速所有精度,性能领先,应用广泛,我们判断其广泛应用于训练市场。AMD奋起直追,欲挑战英伟达龙头地位,第三代InstinctMI300系列性能优异,满足生成式AI强劲需求,相较于H100,MI300X性能优异,单...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至