2025年计算机行业专题研究:DeepSeek重构算力基建长期价值的认知
- 来源:国泰君安证券
- 发布时间:2025/03/17
- 浏览次数:565
- 举报
计算机行业专题研究:DeepSeek重构算力基建长期价值的认知.pdf
计算机行业专题研究:DeepSeek重构算力基建长期价值的认知。市场低估了DeepSeek生态对算力需求的放大效应,我们预计仅其推理端就将产生近百万PFLOPS的算力需求。精度支持及通信效率率先突破的国产AI芯片厂商将获得显著的发展机会。DeepSeek的低成本突破实际上通过降低准入门槛扩大了市场规模,进一步推动了AI民主化进程。DeepSeek-V3以557.6万美元的训练成本刷新了大语言模型的经济性基准,一度引发市场对高端AI芯片的必要性的质疑。然而,从DeepSeek技术创新的角度以及持续攀升的AI算力需求,我们重新认识到:降低单次训练成本的技术突破不仅没有减少市场对高性能AI芯片的需求...
1. 投资分析
DeepSeek 的技术突破虽然短期内引发市场对高端 AI 芯片需求 的担忧,但通过降低准大模型训练准入门槛扩大了整体市场规模。首先受益 的是国产算力芯片厂商,特别是华为昇腾等已经在推理性能上接近国际水 平的企业,将借助性价比优势在企业级部署市场获得突破。随着企业级部署 需求增长,算力租赁商将迎来增长,大量中小企业会选择更灵活的租赁方案 来降低初始投入。当大模型部署成本降低到一定水平后,终端设备推理算力 需求将显著提升,驱动端侧 AI 芯片市场扩容。
2. DeepSeek 重构市场对算力基建长期价值的认知
DeepSeek-V3 以 557.6 万美元的训练成本刷新了大语言模型的经济性基准, 引发市场对 AI 算力成本重新定价的思考。根据《DeepSeek-V3 Technical Report》,DeepSeek-V3 仅使用了 278.8 万 GPU 小时(H800)即完成了完整 训练,这一突破性成果一度引发市场震动。然而,随着市场对 DeepSeek 技 术创新的深入理解,以及持续攀升的 AI 算力需求,我们意识到:降低单次 训练成本的技术突破,不仅没有减少市场对高性能 AI 芯片的需求,反而通 过降低准入门槛扩大了市场规模,进一步推动了 AI 民主化的进程。
2.1. 训练:架构创新降低训练开销,强化学习路径减少数据依赖
DeepSeek V3 和 R1 全面突破了大模型训练成本的瓶颈。在 V3 系列中,通 过 MLA 机制、FP8 混合精度训练和 DualPipe 并行框架等技术创新,显著降 低了计算和内存开销;在 R1 系列中,通过强化学习和冷启动策略,大幅减 少了对昂贵监督数据的依赖。这些突破性进展为大模型的经济性训练开辟 了新途径。 DeepSeek-V3: DeepSeek-V3 通过 Multi-Head Latent Attention (MLA)机制实现了显著的 训练成本优化,核心在于低秩联合压缩技术。MLA 架构在注意力计算中采 用了创新的低秩联合压缩方法,将注意力的键值对压缩到更低维度的潜在 向量空间。MLA 的设计使得在生成过程中只需缓存压缩后的潜在向量,这 大幅减少了 KV 缓存需求。同时,DeepSeek-V3 对注意力查询也执行低秩压 缩,并通过 Rotary Positional Embedding (RoPE)进行处理。这种压缩方法在 保持与标准 Multi-Head Attention 相当性能的同时,显著降低了训练过程中 的内存占用和计算成本,使DeepSeek-V3在经济性训练方面具有明显优势。

创新的 Auxiliary-Loss-Free 负载均衡策略显著提升了 MoE 架构的训练效 率和计算资源利用率。DeepSeek-V3 对传统 MoE 架构进行了重要改进,引 入了更细粒度的专家分配机制。与传统依赖辅助损失函数来实现负载均衡 的方法不同,DeepSeek-V3 引入了动态偏置项机制,实时监控每个训练步骤 中专家的负载情况,自动调整偏置参数,既确保了计算负载的均衡分布,又 避免了额外的性能损失,使得模型在整个训练过程中都能保持 token 的完整 性,同时通过 Node-Limited Routing 机制限制了通信开销,实现了接近完整 的计算-通信重叠,从而在保证模型性能的同时显著提升了训练效率。 Multi-Token Prediction (MTP)机制实现了更密集的训练信号和更高效的数 据利用。DeepSeek-V3 的 MTP 设计采用了顺序预测机制,在每个位置同时 预测多个未来 token。MTP 通过若干个顺序模块实现,每个模块共享 embedding 层和输出层,显著节省了参数开销。与传统并行预测方法相比, MTP 保持了完整的因果链预测关系,帮助模型建立更好的长期依赖关系。 特别值得注意的是,这些 MTP 模块仅在训练阶段发挥作用,在实际推理时 可以直接移除,确保了推理阶段的轻量高效,同时又充分实现了训练阶段的 优化效果。
DualPipe 并行训练框架通过计算与通信的高效重叠显著提升了训练效率。 传统的跨节点专家并行训练面临计算与通信比例约为 1:1 的效率瓶颈。 DualPipe 通过将每个计算块分为 attention、all-to-all dispatch、MLP 和 all-to-all combine 四个组件,并对前向和反向计算块进行精细编排,有效消除了训 练 过 程 中 的 pipeline bubbles 。 与 传 统 的 1F1B (Harlap et al., 2018) 和 ZB1P (Qi et al., 2023b)方法相比,DualPipe 将 pipeline bubbles 减少了 3 倍, 同时仅增加 1/2 倍的峰值激活内存。更重要的是,DualPipe 具有出色的可扩 展性,其 bubbles 和激活内存不会随着 micro-batches 数量的增加而增长,这 使其在大规模训练场景下具有显著优势。
DeepSeek-V3 通过优化跨节点 all-to-all 通信机制,巧妙利用 IB 和 NVLink 双通道特性实现高效计算。研究团队针对集群架构特点,设计了专门的通信 内核,其中节点间通过 IB 互联(带宽 50GB/s),节点内则采用 NVLink 通 信(带宽 160GB/s,约为 IB 的 3.2 倍),充分利用硬件优势,并采用"IB 优 先传输+NVLink 即时转发"的策略,实现了 IB 和 NVLink 通信的完全重叠, 使得每个 token 在不增加 NVLink 额外开销的情况下,可以高效选择平均 3.2 个专家/节点,仅需 20 个 SMs 就能充分利用双通道带宽,且系统可以在保 持相同通信成本的前提下,将路由专家数从目前的 8 个扩展至 13 个。 三大关键技术实现训练过程中的极致内存优化。通过在反向传播时重新计 算 RMSNorm 和 MLA 上投影操作,避免持续存储这些激活输出,仅带来少 量计算开销就显著降低了内存需求;将模型参数的指数移动平均存储在 CPU 内存中,并在每个训练步骤后异步更新,实现了零额外开销的参数追 踪;在 DualPipe 策略下,将 embedding 层等浅层和输出层等深层部署在相 同 PP rank 上,实现了 MTP 模块与主模型间的参数和梯度物理共享,进一 步提升了内存使用效率。 DeepSeek 采用了 FP8 混合精度训练框架。DeepSeek 设计了细粒度的混合 精度方案,将大部分计算密集型操作(如 GEMM 运算)采用 FP8 格式执行, 同时对关键组件(如 embedding 模块、输出层、MoE 门控模块、归一化算 子和注意力算子)保持原始精度。团队引入了创新的分块量化策略,并通过 高精度累加过程降低量化误差,相比 BF16 基准,该方案在训练 1 万亿 token 后的相对损失误差保持在 0.25%内,同时显著降低了内存占用和通信开销。 精细化的量化策略和高精度累加机制,有效解决了 FP8 低精度训练中动态 范围受限的问题。DeepSeek 提出了细粒度量化方案:对激活值采用 1x128 的分块量化,对权重采用 128x128 的块状量化,显著提升了对离群值的适 应能力。同时,为解决低精度 GEMM 运算中的精度损失问题,团队设计了 基于 CUDA Cores 的高精度累加策略,每累积 128 个元素就提升到 FP32 进 行一次精确计算。实验验证表明,该方案在 K=4096 的大规模矩阵运算中, 将相对误差控制在 2%以内。
低精度存储和通信策略进一步优化训练资源消耗。DeepSeek 在优化器状态 追踪中采用 BF16 替代 FP32 格式,同时将激活值缓存转换为 FP8 格式以降 低内存占用。针对特定算子的精度敏感问题,团队采取了差异化处理策略: 对注意力算子后的线性层输入采用定制的 E5M6 格式并使用整数幂缩放, 而对 MoE 中的 SwiGLU 算子输入则采用 FP8 存储并在反向传播阶段重新 计算输出,在保证模型训练稳定性的同时,显著降低了内存和通信开销。
DeepSeek-R1: DeepSeek-R1 通过大规模强化学习替代监督数据,创新性地降低了训练成 本。DeepSeek 采用纯 RL 训练作为冷启动策略,仅在后期引入少量 CoT 数 据进行微调,有效避免了大规模监督数据收集和标注的高昂成本,同时保证 了模型的推理能力。 DeepSeek-R1 通过优化强化学习算法和设计高效的奖励机制,进一步降低 了训练成本。在算法层面,DeepSeek 采用 GRPO(Group Relative Policy Optimization)替代传统的 critic 模型,通过组内相对策略优化显著降低了计 算开销。在奖励机制设计上,系统采用基于规则的双重奖励体系,包括准确 性奖励和格式规范奖励,避免了使用需要额外训练资源的神经网络奖励模 型。这种基于规则的验证方法(如数学问题使用确定性结果验证,代码问题 使用编译器验证)既保证了训练效果,又降低了计算复杂度。

DeepSeek-R1 通过冷启动策略,在保持低成本优势的同时显著提升了训练 效率。与完全依赖 RL 训练的 R1-Zero 相比,R1 引入了少量高质量的 Chainof-Thought(CoT)数据作为冷启动 cold start 基础,有效避免了早期训练的 不稳定性。团队采用多层级数据收集策略,首先利用 R1-Zero 生成初始答 案,再通过人工后处理进行优化和验证,最终仅收集了数千条 CoT 数据用 于微调 DeepSeek-V3-Base 模型。这种方法既避免了大规模人工标注的高昂 成本,又保证了训练数据的质量,为后续的 RL 训练奠定了良好基础。相比 传统的全量监督学习方法,在保证模型性能的同时显著降低了数据采集和 标注成本,同时也加快了模型的收敛速度。
2.2. 推理:双阶段架构优化推理效率,蒸馏技术降低部署门槛
V3 和 R1 全面优化了推理阶段的成本效率。V3 系列采用双阶段推理架构和 多级并行策略降低大规模部署成本,R1 系列则通过模型蒸馏技术实现小型 化部署,共同构建了一套完整的低成本推理解决方案。
DeepSeek-V3: DeepSeek-V3 基于 H800 集群构建了双阶段推理架构,实现服务质量与吞 吐量的平衡。系统采用 NVLink 连接节点内 GPU,使用 IB 实现跨节点互联, 通过将推理过程分为 prefilling 和 decoding 两个阶段,有效平衡了在线服务 的响应时间(SLO)和整体吞吐量需求。 prefilling 阶段采用多级并行和动态专家调度策略,实现了推理性能的全面 优化。系统在4节点32 GPU的最小部署单元上,结合了4路张量并行(TP4)、 8 路数据并行(DP8)和 32 路专家并行(EP32)的混合架构,通过小规模 TP 和 节点内外差异化通信策略降低了通信开销。为解决 MoE 中的负载均衡问题, 引入了冗余专家机制,每个 GPU 除托管 8 个原始专家外,还额外部署 1 个 冗余专家,并通过 10 分钟一次的动态负载统计进行调整。同时,系统通过 同时处理两个计算负载相近的 micro-batch,实现了 attention 和 MoE 计算与 通信的有效重叠,进一步提升了整体吞吐量。 decoding 阶段采用大规模并行部署和精细化资源分配策略,平衡了延迟与 吞吐量。系统结合 TP4 和 DP80 的 attention 计算以及 EP320 的 MoE 架构, 其中 64 个 GPU 专门负责冗余专家和共享专家。为降低延迟,系统采用 IBGDA 技术实现 dispatch 和 combine 环节的点对点通信,并通过动态冗余 策略优化专家路由。考虑到 decoding 阶段 attention 占比较大的特点,系统 将一个 micro-batch 的 attention 计算与另一个的 dispatch+MoE+combine 重 叠处理。同时,由于每个专家的 batch size 较小(通常在 256 tokens 以内), 系统通过合理分配 SMs 资源,进一步优化了内存访问效率。
DeepSeek-R1: DeepSeek 通过蒸馏技术将大模型能力迁移到小模型,显著降低了推理部署成本。DeepSeek 选择 Qwen-1.5B、Llama-3.5B 等高性价比的开源小模型作 为蒸馏目标,直接使用 DeepSeek-R1 的训练样本进行微调,使小模型获得 了更强的推理能力,同时由于模型体积小、计算量低,大幅降低了实际部署 时的算力需求和运营成本。
2.3. 技术创新引发市场震荡,但长期算力需求未被动摇
DeepSeek 的低成本突破引发了市场对 AI 发展路径的重新思考。2025 年 1 月 27 日,英伟达股价大跌超 17%,市值蒸发超 5600 亿美元,创下历史最 大单日跌幅。我们认为这一暴跌主要源于 DeepSeek 的技术创新动摇了市场 对高算力依赖的固有认知:通过创新的架构设计和训练策略,DeepSeek 在 较低算力投入下也实现了强大的模型性能,挑战了 AI 发展必须依赖大规模 算力的传统观点,引发市场对 AI 芯片需求预期和估值体系的重新审视,产 生了大量对美国 Stargate 等大规模的算力投资项目的必要性的质疑。
情绪冲击消化后,市场开始重新理性看待算力需求的长期趋势。我们认为, 虽然 DeepSeek 证明了低成本训练的可能性,但这反而可能刺激大型科技公 司加速 AI 创新,进一步扩大算力投入以保持竞争优势。更重要的是, DeepSeek 的创新可能通过降低 AI 开发门槛,反而扩大了市场规模,长期看 反而有利于推动算力需求的增长。 DeepSeek 公布的训练成本仅反映了最终训练阶段的直接支出,大量隐性成 本易被忽视。在正式训练之前,企业需要投入大量资源进行前期研究,包括 算法理论研究、硬件性能探索和数据集分析等基础工作。特别是在消融实验 阶段,为了确定最优模型架构,研发团队往往需要反复验证不同组件的重要 性,这个反复试错的过程会产生大量计算开销。这些分散在数月乃至数年中 的研发投入,以及未被披露的失败尝试,都构成了难以量化的隐性成本。因 此,仅以最终训练阶段的直接成本来评估 DeepSeek 的技术突破,可能会低 估 AI 研发的实际投入门槛。 DeepSeek 的实际运营经历证实,即便降低了单次调用成本,算力供给仍然 面临严峻挑战。在上线仅 21 天后,DeepSeek 就积累了 2215 万日活用户, 这种爆发式增长直接导致算力供不应求。2 月 6 日,DeepSeek 出现了服务 器资源紧张的情况,不得不暂停 API 服务充值,以缓解服务器压力。这一 情况揭示了一个关键事实:虽然 DeepSeek 通过技术优化降低了推理成本, 但用户基数的急剧扩大仍会导致整体算力需求的大幅上升。
技术创新提升了算力效率,但并未改变 AI 产业对高性能计算的刚性需求。 虽然架构优化和训练策略创新能够降低单位算力成本,但随着 AI 应用从实 验室走向产业化部署,规模化商用过程中的各个环节都需要持续的算力投 入。同时,AI 技术的快速迭代和竞争加剧也推动企业不断提升模型性能, 这些因素共同决定了高性能计算基础设施仍将是 AI 产业发展的关键支撑。 随着人工智能从训练阶段转向推理阶段,算力投入的商业价值判断更加清 晰明确。随着人工智能技术的发展进程进入推理应用阶段,企业对算力资源 的投入属性发生了根本性转变。在模型训练阶段,算力投入主要体现为研发 性质的支出,其投资回报率难以准确衡量。而在推理阶段,算力投入直接服 务于具体的商业场景,成为可计量的经营性资产。这种转变使得企业在进行 算力投资决策时,能够基于明确的成本收益比进行评估,降低了投资风险。 特别是对于已经布局 AI 业务的大型科技企业而言,推理成本的持续下降正 在创造更加确定的投资回报空间,从而增强继续投资的意愿。
2.4. DeepSeek 的运营挑战和硬件依赖凸显了算力基建的重要性
DeepSeek 服务器面临的多重运营挑战进一步凸显了算力基础设施建设的 重要性。从技术瓶颈看,开发处理能力不足和模型优化需求并存;从运维管 理角度,系统升级和资源调度都可能导致服务中断;从网络环境来看,服务 稳定性受到用户反馈和网络波动的双重影响;从服务适配层面,需要同时满 足多样化的用户体验需求。这些挑战表明,即便在降低单次计算成本的情况 下,企业仍需持续投入大量资源来构建和优化算力基础设施,以确保服务的 稳定性、可扩展性和用户体验。因此,算力建设作为 AI 服务的基础支撑, 将继续成为行业发展的关键趋势。
DeepSeek V3 虽然实现了计算与通信的重叠优化,但其对硬件资源的依赖 仍然显著。系统在 H800 GPU 中需要分配 20 个 SM 用于通信任务,这占用 了宝贵的计算资源(H800 GPU 总共拥有 132 个 SM)。这些 SM 主要负责在 IB 和 NVLink 域之间转发数据、管理 RDMA 缓冲区、执行 all-to-all combine 操作,以及处理多专家之间的数据传输。虽然这种设计降低了对通信带宽的 依赖,但同时也导致张量核心资源未被充分利用,造成了新的效率损失。 在计算硬件层面,精度和性能的平衡需要更专业的硬件支持。以 FP8 GEMM 实现为例,当前 NVIDIA Hopper 架构的张量核心采用定点累加方式,通过 基于最大指数的右移来对齐尾数乘积,但实验显示这种实现仅使用了最高 的 14 位尾数。这种实现方式虽然降低了精度要求,但也说明现有硬件架构 在支持低精度计算方面还有优化空间,促使 DeepSeek 团队建议硬件厂商开 发更专业的解决方案。 未来硬件发展方向需要重点关注通信架构的创新。DeepSeek 团队明确建议 开发类似 NVIDIA SHARP 这样的专用协处理器,将通信任务从计算单元中 分离出来。同时,他们也呼吁统一 IB(scale-out)和 NVLink(scale-up)网 络的编程接口,使计算单元能够通过简单的原语(如 read、write、multicast 和 reduce)来完成跨域操作。这些建议表明,即便是经过优化的 DeepSeek V3,仍然需要硬件层面的突破来进一步提升系统效率。 算力基础设施建设仍然任重道远。从硬件资源依赖、运维挑战到架构创新需 求,每个层面都凸显了算力基建的重要性。在高并发场景下,无论是通信架 构的优化、计算单元的专业化设计,还是整体系统的稳定性保障,都需要持 续的技术突破和资源投入。这表明,算力基础设施建设将继续是支撑 AI 产 业发展的关键支柱。
2.5. Scaling Law 未被颠覆,后训练与推理阶段催生新需求
AI 发展仍遵循 Scaling Law。早在 2020 年,OpenAI 团队就发现了 AI 的三 大基本扩展定律:模型规模扩展(更多参数带来更好的学习和泛化能力)、 数据规模扩展(更大的训练数据集提升模型性能)以及计算规模扩展(更多 算力支持更长时间的训练)。英伟达 CEO 黄仁勋在 2025 CES 大会上提出了 两个新的扩展定律,进一步丰富了 AI 扩展的理论框架。
后训练扩展(Post-training Scaling)包含了一系列提升模型效能的优化技 术。Post-training scaling 的核心包括:通过领域特定数据微调来避免重新训 练完整模型;通过量化技术降低模型精度以减少内存和计算开销;通过剪枝 技术移除不必要的参数提升效率;通过知识蒸馏将大模型能力压缩到小模 型中;以及通过迁移学习在相关任务上复用预训练模型。这些技术与 pre-training 同样需要大量计算资源,但能显著提升模型在特定场景下的表现。 测试时扩展(Test-time Scaling)则专注于推理阶段的动态优化。Test-time sclaing 包括:基于输入和系统约束的动态模型调整;通过集成多个模型版 本的预测提升准确性;根据输入特征动态调整计算资源分配;推理阶段的量 化处理;响应数据输入的主动模型调整;以及通过高效批处理来最大化吞吐 量。这些技术本质上是在不重新训练模型的前提下,通过智能分配计算资源 来优化推理性能,使模型能够根据实际需求灵活调整计算强度。 Scaling Law 作为 AI 发展的基本规律将持续指引行业发展。Sam Altman 表 示:从经济学角度看,AI 模型的智能水平与训练和运行资源的对数呈正相 关,这种关系在多个数量级上都保持稳定。更重要的是,AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律的 18 个月翻倍速度,这种成本的快速下 降又进一步刺激了使用需求。同时,AI 智能水平的线性提升能带来超指数 级的社会经济价值。这三重因素的叠加效应,使得对 AI 的投资很可能会继 续保持较快增长,从而推动 Scaling Law 在更大规模上的持续验证和应用。 DeepSeek 的创新实质上是在 Scaling Law 框架内的优化,而非颠覆。R1 在 训练过程中的重要思想——强化学习,本质上仍属于后训练(Post-training) 阶段。在这个阶段,模型需要通过各种形式的学习,如人类反馈、自我练习 或 AI 教练指导,来将预训练获得的基础知识转化为解决实际问题的能力。 这个过程仍然需要大量的计算资源来支持模型进行反复试错和优化,符合 Scaling Law 中计算资源与模型能力的基本关系。
DeepSeek-R1 的思维链(CoT)能力凸显了推理阶段的 Scaling 需求。在实 际应用中,思维链推理并非简单的一步到位,而是需要模型进行多轮深入的 逻辑推导和结果验证。未来行业发展必然朝着扩展推理深度、拓宽链式推理 的广度、增强上下文理解等方向发展,这意味着在推理阶段需要投入更多的 计算资源。这种推理过程的复杂性与计算需求的增长关系,正是 Test-time Scaling Law 的具体体现,拥有更多算力的企业可以在推理过程中持续深化, 让模型生成更大的推理规模以解决更加复杂的问题,形成能力上的壁垒,这 进一步验证了即便在推理阶段,算力需求也将持续增长。 算法精耕路线与 Scaling Law 绝非势不两立,长期趋势下必然形成螺旋互 促。随着算法降本增效的趋势,越来越多的中国大模型将借鉴 DeepSeek 的 经验,专注于算法优化,这一发展符合中国国情。尽管当前中美技术路径存 在分化,但从长远来看,算法与 Scaling Law 之间一定是相互促进的关系: 规模扩张为算法优化提供验证场景,算法精耕则通过架构改进和训练策略 优化降低边际成本。国内厂商在推理优化领域积累的技术经验,未来与国产 算力供应链形成协同后,可通过更高效的资源利用率构建其竞争优势,算法 和硬件的良性互动正是 Scaling Law 持续演进的核心动力。
2.6. AI 向 Agent 和多模态发展的趋势将进一步提高算力需求
Manus 旨在借助多代理架构颠覆传统工作流程,重构 AI 应用范式。 Monica.im 的 Manus AI 开启数字代理人新时代,Manus 采用多代理协作框 架,利用独立虚拟机模式,把任务流拆分成“规划代理-执行代理-验证代理” 三个步骤,再由规划者、执行者和质检者三个数字代理分工完成任务。架构 的真正价值在于打破了传统 AI 助手的单一思维局限,引入了类似人类团队 协作的工作模式,从产业发展角度看,这种架构将推动 AI 从单一工具向复 杂系统演进,为企业级应用的场景拓展奠定了基础。同时,安全沙盒的设计 可以隔离风险,为未来 AI 系统的自主性探索提供了可控环境,或将成为 Agent 发展的关键突破点。 Agent 化架构精细分解任务,显著增加推理算力要求。Manus 实测中将复杂任务细化为多个独立环节,例如生成包含手绘漫画与极简文字描述的 HTML 网页,其任务被分解为八步甚至十六步操作。每个子任务均需要单 独的逻辑推理与实时校验,系统在虚拟机内循环调用大模型对当前步骤进 行规划、错误检查与自动修正。当遇到网络异常或执行失败时,系统能够记 录中间状态后重启任务,重复的反馈与修正机制使得整体推理环节远超传 统单步问答模式,进而大幅提高了对算力的需求。 多智能体协同运行,驱动推理重构与算力投入升级。Manus 的设计不仅局 限于单一的任务分解,还内嵌了虚拟机与工具调用功能,实现了跨账户、多 流程的并行操作。在实际操作过程中,不同任务之间通过多智能体协同运行, 各环节间不断传递中间结果,并持续进行多轮反馈与调整。这种反复迭代的 推理重构机制,使得每一次工具调用、状态监控或错误恢复都需要额外的算 力支持,从而形成复杂的联动系统。相比于普通 AI 的一次性响应,这种多 层次、纵深推进的 Agent 化模式无疑对硬件推理算力提出了更高要求。
仅依文本解析难以解决复杂应用实际需求,AI 引入多模态是必然的趋势。 文本作为高度抽象的数据形式,虽能描述大致情境,但在实际应用中往往因 缺乏直观画面和实时动态信息而存在局限。医学图像中的微妙结构、自动驾 驶中路况的动态变化、甚至社交媒体上情感表达的细微差异,都难以通过纯 文本得到有效捕捉。只有引入图像、视频等多模态数据,才能构建立体化的 环境模型,满足医疗、交通等复杂场景对全面信息的需求,从而实现更精准、 高效的智能决策。 多模态技术已经全面引领各行业数字智能应用。随着信息社会的不断进步, 各类数据以惊人的规模和多样性涌现,这为各领域带来了前所未有的信息 处理需求。在医疗健康、自动驾驶、智能监控及人机交互中,多模态 AI 正 被广泛应用。比如,医疗诊断不仅依赖病历记录,更需要医学影像的直观支 持;自动驾驶系统通过整合摄像头、雷达和激光扫描数据,实现对复杂驾驶 环境的全面感知。信息的全面性、冗余与互补优势,使多模态系统可以从多 个角度理解问题,实现精准判断。因此,多模态 AI 的发展已成为数字化转 型的关键驱动力。 多模态 AI 融合多信息输入,极大提升算力需求挑战。多模态 AI 不仅涉及 文本数据处理,更须同时对图像、视频、音频及传感器等多种异构数据进行 预处理、特征提取和噪音过滤。每种数据类型都有各自独特的处理算法,其 计算流程和资源消耗远较单一模态复杂。同时,为实现跨模态语义对齐,系 统需要构建统一的表示空间,将不同模态的信息互映、互补,这一过程本身 就需要大量的并行计算与多步推理。此外,动态场景下的实时数据接入和多 层次推理链条(从低级感知到高级语义抽取)进一步加剧了计算任务的复杂 性,要求硬件和算法均实现高效协同,从而对算力提出了更高标准。
3. 技术效率提升与市场扩张并行,算力需求迎来新增长
杰文斯悖论表明,技术效率的提升往往会导致资源需求的增加,而非减少。 当技术使得某种资源的使用变得更加高效时,降低的成本会吸引更多的用 户和应用,从而导致该资源的总体需求上升。例如,尽管能源使用效率提高, 最终的能源消耗可能会增加,因为更多的用户会选择使用这种更便宜的能 源。类似地,DeepSeek 通过降低 AI 训练和推理的成本,虽然在表面上看似 减少了算力需求,但实际上却可能通过降低准入门槛和扩大市场规模,反而 推动了对算力的更高需求。
3.1. 竞争格局并未尘埃落定,训练投入仍在持续加码
竞争格局并未尘埃落定,训练投入仍在持续加码。从大模型研发的角度来 看,尽管开源趋势可能在未来导致模型路线趋同,最终可能只剩下少数大模 型厂商提供基础模型作为应用底座,许多厂商将被淘汰,但在较长时间内, 竞争格局依然会保持复杂且充满活力。当前,各大模型厂商并未达到一个超 级应用终结市场的地步,反而在不断加大研发投入,加速产品迭代,OpenAI、 Google、xAI、Anthropic 均在 2025 年年初发布了新的模型。随着市场对 AI 应用的需求持续攀升,厂商们必须不断优化和扩展其模型能力,以保持竞争 优势。因此,尽管 DeepSeek 的技术创新降低了训练成本,但各大厂商的持 续研发投入和激烈的市场竞争将不可避免地推动算力需求的上升。
单次训练成本的降低并不意味着整体训练成本的下降。如前所述,DeepSeek 的投入绝不仅限于最终训练阶段的直接支出,前期的研发投入同样不可忽 视。对于所有大模型研发厂商而言,真正的逻辑在于:一旦单次训练成本降 低,便意味着可以进行更多次的训练,从而实现更快的技术迭代,而不是让 算力资源闲置。与此同时,开源趋势将为研发厂商提供相互学习的机会,促 进技术的快速进步。DeepSeek 的成功不仅是其自身的胜利,更将坚定整个 行业的信心,推动更多企业加大投入,争相追赶,加速算力需求的增长。 AI 技术门槛降低推动了企业长尾训练需求的增加。DeepSeek 显著降低 AI的使用成本,越来越多的企业将开始采用 AI 技术来提升自身的业务效率和 竞争力,这一趋势将直接推动微调和私有数据训练的需求,企业希望根据自 身特定的业务场景和数据集来优化模型性能。随着更多企业进入 AI 领域, 针对特定应用的训练需求将显著上升,进而提高对训练算力的需求。即使企 业不需要进行初始模型的训练,也必须进行微调或者结合私有数据,才能过 适应对应行业和客户的需求。
3.2. DeepSeek 引发 C 端热情,平台整合进一步扩大用户基础
DeepSeek 的推理需求在面向消费者的市场中迅速增长,直接使用 DeepSeek 的 Web 和 App 的用户数量庞大。根据 AI 产品榜的统计,DeepSeek 的 App 在上线仅 20 天内便吸引了 2215 万日活跃用户,2025 年 1 月月活跃用户突 破 3370 万,成为全球增速最快的 AI 应用之一。这一庞大的用户基础表明, DeepSeek 的 Web 和 App 本身就产生了巨大的推理需求,消费者在日常生 活中频繁使用这些平台进行各种任务。即便不考虑其他服务商的合作或衍 生需求,单是 DeepSeek 自身的用户需求就足以推动算力的持续增长。 DeepSeek 的接入微信平台显著提升了用户的使用频率和体验。微信的搜索 框在 2025 年 2 月 16 日开始接入 DeepSeek-R1 深度思考的 AI 搜索的灰度测 试。DeepSeek 与微信的整合使得用户能够在聊天界面中直接调用 AI 助手, 进行内容生成和信息查询。这种便捷的使用方式将能够吸引大量用户,推动 了 C 端需求的快速增长。用户无需下载额外的应用程序或进行复杂的注册 流程,便能在日常交流中轻松享受 DeepSeek 的强大推理能力,从而进一步 扩大了其用户基础。
腾讯元宝与 DeepSeek-R1 模型的整合充分利用了腾讯生态系统中的公众号 和视频号。腾讯元宝平台的接入使得用户在使用腾讯元宝时能够直接体验 DeepSeek 的强大推理能力。通过整合微信公众号和视频号,用户不仅可以 获取更精准的信息,还能享受到更丰富的互动体验。这种整合不仅提升了用 户的使用便利性,也使得 AI 推理服务在日常生活中变得更加普及,进一步 推动了对推理服务的需求增长。 百度的全面接入也为 DeepSeek 带来了新的 C 端需求,进一步推动了用户 对推理服务的使用。百度搜索在 2025 年 2 月 16 日发布消息,除了接入自 己的文心大模型外,百度搜索还全面接入了 DeepSeek,旨在提升用户的搜 索体验。通过这一整合,用户能够在百度平台上直接获取更智能和实时的回 答,享受更高效的信息检索服务,不仅增强了百度搜索的智能化水平,也使 得 DeepSeek 的推理能力得以在更广泛的用户群体中应用,进一步推动了对 推理服务的需求增长。
3.3. 大模型应用生态在企业加速落地,推理算力需求迎来爆发期
开源技术的普及正在加速算力需求向边缘侧的下沉,推动了更多企业在本 地进行 AI 应用的开发。随着越来越多的国产大模型采取开源策略,企业能 够以更低的成本和更高的灵活性在边缘设备上部署AI模型。通过模型蒸馏, 中小企业可以将大型预训练模型的知识转移到更小、更高效的模型中,从而 在本地或云端进行弹性调用和部署。中小企业不再必须依赖于大型云服务 提供商,而是能够利用本地硬件资源进行数据处理和推理,从而降低延迟和 带宽成本。这种边缘计算的模式不仅提升了算力的利用效率,也使得更多企 业能够参与到 AI 应用的开发中,加速了国内 AI 产业应用生态的形成,从 而对推理算力提出更高的要求。
3.3.1. 云平台与一体机的接入加速 DeepSeek 的渗透
三大运营商云平台全面接入 DeepSeek 大模型。中国电信天翼云、中国移动 移动云和中国联通联通云已全面接入 DeepSeek 大模型:天翼云通过多平台 支持 DeepSeek-R1 应用,提供从部署到推理、微调的全流程服务;联通云基 于"星罗"平台实现了国产及主流算力适配多规格 DeepSeek-R1 模型;移动 云则实现了全版本覆盖、全尺寸适配、全功能使用。 运营商纷纷推出 DeepSeek 版智算一体机,打造算力解决方案。三大运营商 相继推出 DeepSeek 版智算一体机产品。中国电信推出了"息壤智算一体机DeepSeek 版",为各行各业提供性能卓越、安全可控的智能算力解决方案; 中国移动的移动云也推出了"智算一体机-DeepSeek 版",通过预置镜像模型 可实现一键推理部署;中国联通也推出了 DeepSeek 一体机产品。一体机将 加速DeepSeek 在中小企业的部署,使其无需自主构建算力集群,开箱即用。 同时一体机的本地化部署特点,也将推动 DeepSeek 向数据隐私性较强的行 业渗透。
国内厂商密集发布 DeepSeek 一体机产品,加速大模型本地化部署。华为、 中科曙光和浪潮相继推出DeepSeek系列一体机产品。华为DS版FusionCube A3000 训/推超融合一体机提供 Ultra(满血版)、Pro(蒸馏版)和 Lite(蒸 馏轻量版)三种型号,搭载华为 Atlas800l A2 推理服务器,满血版处理速度 可达 671B 模型 1911 token/s。中科曙光则发布了采用国产 X86 CPU 和国产 GPGPU 加速卡的全国产 DeepSeek 超融合一体机,支持 DeepSeek 全系列模 型及主流大模型的部署。浪潮推出的 NF5468H7 推理一体机通过 inAIP 智 能引擎实现全局协同,可在 3 小时内完成从开机到推理服务上线,硬件利 用率高达 92%。一体机的形式为 AI 进行本地化部署提供了助力。

国内互联网系主流云平台全面接入 DeepSeek,大模型生态进入新阶段。除 三大运营商外,阿里云、腾讯云、百度智能云等互联网系主流云计算平台也 已全面接入 DeepSeek 系列模型。这一趋势表明,DeepSeek 作为国产大模型 的代表,正在加速构建完整的算力服务生态。云平台作为供给侧的广泛接入 不仅有助于降低企业使用 AI 的门槛,也将进一步推动算力需求的增长。 阿里云 PAI 平台全面支持 DeepSeek 系列模型,提供多种部署方案满足不 同场景需求。阿里云 Model Gallery 平台已完成对 DeepSeek-V3 和 DeepSeekR1 系列模型的全面接入。平台支持 BladeLLM、SGLang 和 vLLM 三种加速 部署方式,并针对不同规模企业提供从满血版到蒸馏版的多种模型选择。阿 里云还提供了完整的 API 调用接口和 WebUI 界面,方便企业进行二次开发 和快速应用。 腾讯云推出 DeepSeek 全栈 AI 服务。腾讯云平台提供"满血版"(671B)的 部署选项,并支持联网搜索和 RAG 等功能。通过腾讯云大模型知识引擎平 台,企业可以快速创建基于 DeepSeek 的知识库问答应用,实现 OCR、MLLM 等多种技术能力的整合。同时,平台还开放了模型配置、知识配置、问答提 取、应用评测等完整工具链,支持企业构建从测试到发布的一站式服务流程。 华为云、百度智能云相继接入 DeepSeek。华为联合硅基流动和潞晨科技, 上线基于昇腾的 DeepSeek R1 和 V3 双模型及六款加速版蒸馏版模型。百度 智能云千帆平台也上架了 DeepSeek-R1 和 DeepSeek-V3 模型,推出超低价 格方案并提供限时免费服务,支持 vLLM、LMDeploy、TensorRT-LLM、 SGLang 等各类主流推理框架。2 月 5 日,华为 HarmonyOS NEXT 的小艺 App 也正式上架了 DeepSeek-R1 Beta 版。
云计算厂商积极布局 DeepSeek 大模型服务。优刻得模型服务平台 UModelVerse 已正式上架 DeepSeek-R1 和 V3 满血版,该平台支持海外地域 访问,并提供限时免费调用服务,用户可通过 API 方式轻松接入模型能力, 其"优云智算"算力共享平台和私有云平台 UCloudStack 也已完成 DeepSeek 系列模型的接入。青云科技旗下基石智算 CoresHub 也上线 DeepSeek-V3、 DeepSeek-R1、Janus Pro 等 DeepSeek 全系列模型,支持一键云端部署及 API 调用,加速企业级 DeepSeek 模型的快速接入及部署应用。首都在线云 平台快速上架 DeepSeek-R1 模型,并在"一云多芯"战略下完成对华为、燧原 等国内 GPU 头部厂商的适配调优。
3.3.2. 垂直场景应用生态已初步形成,推理算力将迎来爆发
金融
券商行业掀起 DeepSeek 应用热潮,多家券商已完成本地化部署。根据各家 券商信息披露,目前已有多家券商宣布完成 DeepSeek-R1 模型的本地化部 署,包括国泰君安、国金证券、中泰证券、兴业证券等。这些券商将 DeepSeek 应用于多个核心业务场景,如中金财富证券实现了投顾服务领域"热点发现 -资讯处理-策略生成"三位一体的服务生态;中泰证券基于 DeepSeek 创建了 215 个知识库,问答精确度超过 95%;国泰君安将其融入"君弘灵犀"千亿参 数多模态证券垂类大模型。从应用场景来看,目前主要集中在投研、合规、 风控等内部业务环节。
多家银行已完成 DeepSeek 大模型接入,并在多个业务场景实现创新应用。 江苏银行已成功完成 DeepSeek-VL2 多模态模型和轻量 DeepSeek-R1 推理 模型的本地化部署,并将其应用于智能合同质检和自动化估值对账场景。据 江苏省金融业联合会金融科技专业委员会介绍,通过"智慧小苏"大语言模型 服务平台,江苏银行实现了金融语义理解准确率与业务效率的双重突破。海 安农商银行也已接入 DeepSeek 模型,并将其应用于营销宣传领域。已有股 份行将 DeepSeek 接入内部自研模型平台进行测试,计划在智能客服、内部 办公流程等场景展开应用。 保险公司积极开展 DeepSeek 智能化应用场景。新华保险、太平人寿、众安 保险和平安健康险等多家险企接入 DeepSeek。北大方正人寿于 2 月 14 日率 先上线基于 DeepSeek 的智能展业助手"方灵";新华保险在其新华 e 家 APP 成功接入 DeepSeek-R1 和 V3 两款模型,打造个性化 AI 助理;平安健康险 则完成了 DeepSeek 模型的本地化部署。从应用场景来看,保险公司主要将 DeepSeek 用于 AI 客服、健康咨询和保险条款解析等方面,进一步提升了保 险服务的智能化水平。
医疗
医疗科技企业密集接入 DeepSeek 大模型助力医疗健康产业智能化升级。医 渡科技将 DeepSeek 整合至其"AI 医疗大脑"YiduCore,基于超 55 亿份医疗 记录和 2800 多家医院网络,提升疾病洞察能力;鹰瞳科技于 2 月 7 日宣布 将 DeepSeek-R1 模型接入其万语医疗大模型,结合 3000 万份临床诊疗数据 和 800 余项循证医学知识图谱,实现临床诊断效率和准确率的双重提升; 智云健康则将 DeepSeek-R1 模型接入其智云大脑,基于 10 亿份电子病历优 化 ClouD GPT 及 ClouD DTx 模型;豫资开勒的"灵曦助手"完成 DeepSeek 升 级部署后,主要用于解析医学文献、临床试验报告并追踪学科前沿动态;恒 瑞医药、嘉和美康等企业也已在临床辅助决策、病历质控等多个具体场景开 展应用。
教育
教育行业掀起 DeepSeek 接入热潮。网易有道于 2 月 6 日率先将 DeepSeek-R1 接入其 AI 全科学习助手"有道小 P",优化个性化答疑功能;学而思宣布 将 DeepSeek 接入旗下学习机、学练机等智能硬件产品,通过"深度思考模式 "升级 AI 学习体验;希沃宣布全系产品陆续接入 DeepSeek,应用于课堂智 能反馈;中公教育完成 DeepSeek 私有化部署,用于内容研发和智能批改; 猿辅导集团的"小猿学练机"和"小猿口算"等产品也已接入 DeepSeek,实现 AI 问答等功能。此外,云学堂、科大讯飞、弈小象、读书郎、高途、佳发 教育等教育机构也已宣布接入DeepSeek,主要应用于个性化答疑、AI制课、 学术搜索等场景。
汽车
车企密集接入 DeepSeek 大模型。截至 2 月 13 日,已有 20 余家车企或品牌 宣布深度融合 DeepSeek 大模型。吉利汽车率先于 2 月 6 日宣布其星睿大模 型与 DeepSeek-R1 完成融合,可精准调用约 2000 个车载接口;旗下极氪品 牌也完成 Kr AI 与 DeepSeek-R1 的深度融合。岚图汽车于 2 月 7 日宣布智 能座舱接入 DeepSeek,并计划在 2 月 14 日开启全民知识蒸馏训练;上汽集 团旗下智己汽车引入 DeepSeek 并构建多场景插拔式 AI 矩阵平台;宝骏汽 车灵语智舱也完成深度融合。此外,斑马智行、忆咖通科技等智能座舱供应 商也加入接入行列。 从上述垂直行业的应用实践可以看出,DeepSeek 正在加速构建大模型应用 生态。从应用广度来看,金融、医疗、教育、汽车等重点行业已形成规模化 应用;从应用深度来看,各行业已从简单的问答交互升级到专业场景的深度 应用。其次,大模型应用正从通用场景向专业场景迁移,企业更倾向于进行 私有化部署和定制化训练,以满足特定业务需求。随着应用场景的不断深化, 特别是在需要实时响应的关键业务环节,推理算力需求将呈现爆发式增长。 我国大模型应用生态正在进入快速成熟期,推理算力基础设施的建设也将 迎来新一轮增长机遇。
4. DeepSeek 生态或产生百万 PFLOPS 算力需求及千亿 算力租赁市场
调用需求推算
对于 DeepSeek 在未来的产业生态形成后,在长期将产生多少推理算力需 求,我们做出以下假设并进行估计: DeepSeek 的推理算力需求可以主要分为以下场景:1、DeepSeek 官方 App 和 Web 端的用户需求;2、运营商、互联网公司等提供的云平台中 DeepSeek API 的用户需求;3、微信搜索、百度搜索等集成了 DeepSeek 的应用带来的 需求;4、企业级 DeepSeek 应用部署场景,包括云端调用和本地部署。分别 估计以上场景对 token 的需求量,即可估计总算力需求。
1、DeepSeek 自有应用(App/Web 端)
假设 DeepSeek App 和 Web 端 DAU 在长期分别维持 3000 万和 1000 万的 水平。根据非凡产研数据,DeepSeek APP 端日活用户峰值为 4179 万(2025 年 2 月 6 日),2 月 15 日,App 端日活用户为 3761 万,Web 端用户为 923 万。考虑到热度褪去后日活可能进一步下降,且其他平台的集成会减少对 DeepSeek 官方应用的使用,因此估计长期 DeepSeek App 端 DAU 维持在 3000 万,Web 端维持在 1000 万,累计 4000 万日活。 日活用户中,假设普通用户平均每人每日发起 5 次请求,每次提问消耗 1000 tokens(输入 200+输出 800);重度用户每人每日发起 20 次请求,平均每次 2000 tokens(输入 500 tokens,输出 1500 tokens)。假设重度用户占 DeepSeek自有应用用户比例的 20%。
2、云平台服务
根据通信产业网信息,自接入 DeepSeek 后,百度智能云大模型的调用量实 现了显著增长,无论是内部客户还是外部客户,每天的亿次调用量都增长了 20 倍以上,可假设调用增量均为 DeepSeek 引起。根据 IDC 数据,百度智 能云 2023 年在中国大模型平台及应用市场占 19.9%的份额。假设每次调用 消耗 1000 tokens。
3、大型平台集成
以微信为例,根据腾讯 2024Q3 数据,微信与 WeChat 合计月活用户为 13.82 亿,作为国民级应用,假设其日活/月活比例能够达到 70%,则预估微信 DAU 达到约 10 亿。假设灰度测试结束后,微信搜索全面接入 DeepSeek,日活用 户中 20%使用微信搜索中的 DeepSeek,每人每日 10 次请求,单次消耗 1000 tokens。
4、企业级应用
中国民营企业总数超过 5000 万家,综合考虑央国企性质的金融等行业的企 业,并考虑到剔除此前在云平台中重复计算的需求,在此仅考虑本地部署需 求。假设有 50 万家企业将 DeepSeek 深度集成到业务中,这部分企业平均 每日消耗 500 万 tokens;500 万家企业将 DeepSeek 用于简单的辅助场景, 这部分企业每日消耗 10 万 tokens。
5. 硬件瓶颈亟待突破,生态协同孕育国产机遇
5.1. 英伟达的“护城河”并非坚不可摧
英伟达 CUDA 护城河并非坚不可摧,开源编译器与跨平台框架向其技术发 起挑战。CUDA 的编程接口正在面临多方面的技术替代挑战,削弱其不可 替代性。在编程语言层面,AMD 的 ROCm、Intel 的 SYCL 等开源方案已能 实现类似功能,AMD 的 HIPIFY 工具可将 CUDA 代码自动转换为 ROCm 支持的格式,降低迁移成本。更具突破性的是编译器技术的进步,如 OpenAI 的 Triton 在部分场景下已能比肩 CUDA 性能。根据 PyTorch 团队的微基准 测试,Triton 在英伟达 H100 GPU 上实现了 0.76-0.78 倍的性能提升,在 A100 GPU 上实现了 0.62-0.82 倍的性能提升。通过算法与编译技术的创新,其他 平台有一定机会绕过 CUDA 的优化壁垒,打破英伟达在软件层面的垄断地 位。

专用芯片架构在特定 AI 任务上展现出超越通用 GPU 的效率优势。Google TPU 在深度学习模型加速方面表现出色,与 XLA 实现芯片-软件的高效协 同,特别适合大规模神经网络的训练和推理任务。虽然专用架构在通用性上 不及 NVIDIA GPU,但它们在细分领域的替代效应正在削弱 CUDA 的垄断 基础,特别是在对性能和能效要求极高的场景中。随着 AI 应用场景的多样 化,单一技术栈难以满足所有需求,这为专用架构提供了更多市场机会。 开源框架多后端支持正在分散 CUDA 生态的开发者资源。主流 AI 框架正 在通过多后端支持策略减少对 CUDA 的依赖。PyTorch、TensorFlow 等框架逐步支持多种硬件后端,同时,云服务提供商如 Google、Meta、AWS 等积 极推广自有 AI 加速器,并通过优化框架兼容性吸引开发者。去 CUDA 中心 化策略正在分散生态资源,使硬件厂商可通过适配主流框架而非完全复制 CUDA 生态来争夺市场,从而降低了 CUDA 生态的排他性优势。 DeepSeek-V3 直接使用 PTX 编程,证明 CUDA 并非 AI 训练的不可替代壁 垒。DeepSeek-V3通过直接使用NVIDIA GPU的底层指令集PTX进行编程, 成功绕过了 CUDA 的高级 API 接口,为 CUDA 护城河的可突破性提供了有 力证据。这种方法减少了对 CUDA 编译器的依赖,同时通过与 AMD、华为 等厂商合作,将其优化策略适配到其他硬件平台。尽管 CUDA 在 AI 训练领 域占据主导地位,但它并非不可替代的技术壁垒,通过底层指令集编程和硬 件优化,AI训练可以突破CUDA 生态限制,为行业提供更多技术路径选择。
5.2. DeepSeek 催化,国产 AI 芯片迎来替代浪潮
DeepSeek 生态催化国产 AI 芯片替代进程。DeepSeek 的崛起为国产 AI 芯 片提供了前所未有的替代机遇。从产业发展趋势看,DeepSeek 模型对国产 芯片的支持正在改变长期以来 CUDA 生态的垄断格局,为国内 AI 基础设 施建设提供了自主可控的技术路径。随着国际芯片供应不确定性增加, DeepSeek 与国产芯片的协同发展将加速形成完整的国产 AI 技术栈,这不 仅能满足企业对数据安全和成本控制的需求,也将推动国内 AI 产业链向更 高价值环节迈进。 华为昇腾 910B 芯片在 AI 训练领域展现出强劲竞争力,其性能已接近英伟 达 A100 水平。华为常务董事表示,昇腾 910B 在训练大型语言模型时效率 可达到英伟达 A100 的 80%,在特定测试性能上甚至超越 A100 达 20%。该 芯片采用先进的达文西架构,集成数千个处理核心,具有 320 TFLOPS 的 FP16 计算能力和 640 TOPS 的 INT8 计算能力,功耗仅为 310W。目前,腾 讯和百度等中国龙头企业均已采购昇腾 910B,显示其已获得实质性市场认 可,反映出华为在国内 AI 芯片产业的市场地位正在逐步确立。 华为昇腾 910C 芯片在 AI 推理市场展现出强劲竞争力,为公司在国产替代 浪潮中赢得先机。根据 Tom’s Hardware,华为昇腾 910C 可以平替 H100 用 于大规模训练和推理,在 FP8-FP64 下均有不俗表现,在 DeepSeek 团队实 测中 AI 推理性能已达到 NVIDIA H100 的 60%左右。随着 DeepSeek 等国产 大模型的崛起和算力需求爆发,华为凭借昇腾 910C 在推理市场的性能表现 和价格优势,有望在国产 AI 芯片替代进程中抢占市场份额,为公司在后 CUDA 时代的 AI 芯片业务带来可观的增长空间。 DeepSeek 生态对昇腾芯片的支持为华为打开了 AI 算力市场的增长通道。 DeepSeek 从第一天起就支持华为昇腾芯片,并自主维护 PyTorch 仓库,使 开发者只需一行代码就能将 CUDA 转换为 CUNN。这种生态支持极大降低 了企业采用华为 AI 芯片的技术门槛,为昇腾 910C 在大模型推理市场的渗 透提供了关键助力。
华为昇腾生态与DeepSeek深度融合,为公司AI芯片业务打开增长新空间。 华为官方于 2025 年 2 月初宣布 DeepSeek-R1、DeepSeek-V3、DeepSeek-V2、 Janus-Pro 系列模型已正式上线昇腾社区 Model Zoo,支持一键获取并在昇 腾硬件平台上开箱即用,为华为昇腾 AI 芯片提供了强大的软件生态支持。 华为为 DeepSeek-V3 模型在昇腾平台上提供了完整的部署方案,包括硬件 配置要求、权重转换、镜像加载、容器启动及服务化测试等全流程支持,具 体部署需配置 4 台 Atlas 800I A2(864G)服务器资源,用户可在昇腾社区 下载适配的镜像包,支持快速部署。随着更多企业寻求本地化部署大模型以 满足数据安全和定制化需求,华为有望通过昇腾+DeepSeek 的组合方案在企 业级 AI 市场获得更大份额,为 AI 业务带来持续增长动力。

华为昇思 MindSpore 完成 DeepSeek-V3 全栈适配。基于昇腾 AI 硬件与昇 思 MindSpore AI 框架的 DeepSeek-V3 已完成开发支持并上线开源社区。昇 思通过多维混合分布式能力、自动并行、Dryrun 集群内存仿真等技术,实 现了天级快速适配 DeepSeek-V3 的新增模型结构和分布式并行训练能力。 在推理性能方面,MindSpore 针对 DeepSeek-V3 的 MLA 和 DeepSeekMoE 等关键网络结构进行了深度优化,通过算子融合和图编译等技术显著提升 了推理效率。这一全栈适配成果不仅证明了华为在AI框架领域的技术实力, 也为国产 AI 软件生态提供了重要支撑。 摩尔线程展现生态适配速度优势,全面支持 DeepSeek 开源项目。摩尔线程 在 DeepSeek 开源周收官之际,宣布已在短时间内成功实现对 DeepSeek 各 个开源项目的全面支持,包括 FlashMLA、DeepEP、DeepGEMM、DualPipe 以及 3FS,充分验证了摩尔线程 MUSA 架构和全功能 GPU 在生态兼容与 快速适配方面的强大优势。公司基于全新 MUSA Compute Capability 3.1 计 算架构,提供原生 FP8 计算能力,并升级了高性能线性代数模板库MUTLASS,快速支持了 FlashMLA 以及其他开源项目。摩尔线程在 DeepSeek 生态中的快速适配能力,展现了国产 GPU 厂商在软件生态建设方 面的进步,为其在国产替代浪潮中赢得了先机。 沐曦科技瞄准 DeepSeek 私有化部署蓝海,CUDA 兼容性成为关键竞争力。 沐曦科技正敏锐地把握住英伟达 GPU 在国内零售市场基本消失带来的市场 空白,将战略重点聚焦于 DeepSeek 等大模型的私有化部署市场。与其他国 产 GPU 厂商相比,沐曦的直接对标国际旗舰产品的理论算力,特别适合高 算力需求场景。公司 MXN 系列 GPU 的核心竞争力在于其出色的 CUDA 兼 容性,使得 DeepSeek 等原本为 CUDA 生态开发的模型能够以极低的迁移 成本在沐曦平台上运行。
5.3. 精度支持与通信效率落后制约硬件替代进程,亟需技术突破
国产 AI 芯片要实现全面替代,需要在多个技术维度进步。随着 DeepSeek 等国产大模型的崛起,AI 芯片的技术要求不断提升。尽管众多国产芯片厂 商已经对 DeepSeek 进行了适配,但从长远来看,国产 AI 芯片仍面临多个 关键技术瓶颈需要突破。 FP8 精度格式为大模型带来关键性能突破。FP8(8 位浮点数)作为新一代 AI 计算精度格式,采用 E4M3 和 E5M2 两种表示方式,其中 E 代表指数位, M 代表尾数位。与传统的 FP16、FP32 相比,FP8 显著减少了存储空间,提 高了计算吞吐量。在 DeepSeek 等大模型场景下,通过合理的技术优化,FP8 能够提供与更高精度类型相媲美的计算结果,同时带来显著的性能提升和 能效改善。据英伟达披露,在 Hopper 架构 GPU 上,使用 FP8 相比 FP16 能 够带来 3 倍以上的吞吐量提升。 FP8 精度格式通过其独特的设计实现了计算效率与精度的最优平衡。在训 练阶段,E4M3 格式提供了更大的动态范围,适合处理梯度更新;而在推理 阶段,E5M2 格式则能更好地保持权重精度。这种灵活的精度配置使得大模 型在不同阶段都能获得最佳性能。同时,由于数据位宽减半,FP8 可以显著 降低芯片间通信带宽压力,减少内存访问次数,提升缓存命中率。这些技术 优势使得 FP8 成为大模型发展的必然选择,特别是在需要处理超大规模参 数和复杂计算的场景中。
FP64 在科学计算和工程模拟中扮演着不可替代的角色。扩展指数范围和尾 数宽度使其能够同时精确表示极大和极小的数值,这在处理大规模偏微分 方程组时尤为重要。在有限元分析(FEA)中,数值计算的微小误差会在模 型中传播,FP64 能够最大限度地减少这些误差,提高模拟的保真度和可靠性。特别是在涉及复杂几何形状和边界条件的工程模拟中,FP64 提供了处 理这些复杂性所需的数值稳定性,确保了跨不同物理过程的计算精度。 国产 AI 芯片精度支持不足成为制约发展的关键瓶颈。我国自主 AI 芯片在 计算精度支持方面与国际领先产品存在差距,这一问题正成为制约国产替 代进程的关键瓶颈。目前国内厂商大多不支持双精度(FP64)计算,仅在单 精度(FP32)及定点计算(INT8)方面与国外中端产品持平。更为关键的 是,对 FP8 精度支持严重不足,而这恰恰是 DeepSeek 训练和推理的重要技 术需求。英伟达架构已全面支持 FP8 计算,而国产芯片在这一领域的滞后, 直接影响了对 DeepSeek 等大模型的适配效率。 提升互联带宽将成为国产 AI 芯片实现大规模训练的关键突破口。高效的互 联带宽直接关系到大规模 AI 训练的效率和可行性。英伟达通过 NVLink 技 术实现了高带宽、低延迟的 GPU 间通信,为国产芯片提供了明确的技术参 考方向。国产 GPU 需要在多卡协同技术上实现突破,开发类似 NVLink 的 高效互联技术,降低通信延迟,提高带宽利用率。随着 DeepSeek 等大模型 参数规模不断增长,对芯片间高效通信的需求愈发迫切,提升互联带宽将成 为国产 AI 芯片实现技术跨越的关键一步。
美国商务部工业与安全局最新的出口管制措施明确限制了内存带宽密度高 于 3.3GB/s/mm²的 HBM 芯片对华出口。HBM(高带宽内存)芯片是 AI 芯 片的关键组成部分,占据一枚 AI 芯片制造成本的近 70%。这种限制不仅阻 碍了中国企业购买先进 HBM 芯片,同时也限制了相关生产设备的引进,试 图从源头上遏制中国在高性能 AI 芯片领域的发展。虽然国内企业已经开始 自主研发 HBM2 芯片并展示了样品,但在技术水平上与国际领先企业仍有 一定差距。这一限制措施直接影响了中国AI芯片的性能提升和大规模部署, 成为当前需要突破的重要技术瓶颈。 随着技术的跟进,国产芯片将支撑大模型生态的发展。当前国产 AI 芯片在 计算精度支持、互联技术等关键领域仍存在明显技术差距,这直接制约了其 在 DeepSeek 等大模型中的应用效果。国产芯片厂商需要集中资源突破这些 核心技术瓶颈,同时加强与国产大模型开发者的深度协同。通过建立从芯片 架构到算法框架的垂直优化体系,逐步构建起自主可控的算力生态。随着技 术迭代与市场需求的双向驱动,国产算力解决方案有望在特定行业场景中 实现突破,最终形成具备国际竞争力的技术体系和闭环生态。
编辑:火腿肠-
标签
- 计算机
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 房地产行业专题报告:城市更新推动高质量发展.pdf
- 3 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 4 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 5 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 6 投资策略:这一次,是金银的拐点吗?.pdf
- 7 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 8 宏观专题:俄乌冲突最新进展如何?.pdf
- 9 银行业理财登记托管中心-中国银行业理财市场半年报告(2026年上).pdf
- 10 腾讯研究院-FDE模式行业观察与实践:前线共创,双向赋能.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 10 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
