DeepSeek成本路线及相关数据测算

DeepSeek成本路线及相关数据测算

最佳答案 匿名用户编辑于2025/03/28 10:58

DeepSeek 开启低成本路线。

在 2024 年 5 月推出的 DeepSeek-V2 中,DeepSeek 就已经显示出了高性价比优势,被 誉为大模型领域的“拼多多”,后续 DeepSeek 又将这一优势延续到了 V3 和 R1 等产品中。

2024 年 12 月发布的 DeepSeek-V3 在性能上看齐了 GPT-4o,同时模型训练成本仅为其 1/20。2025 年 1 月发布的 DeepSeek-R1,又在性能上看齐了 o1,同时 API 调用成本仅为其 1/30。

DeepSeek-R1 的模型架构主要来自于 DeepSeek-V3,DeepSeek-V3 的模型架构中减少 算力消耗的两个关键点包括: (1)多头潜注意力机制(MLA,对传统多头注意力机制的改进):大概贡献了 2-4 倍的 计算效率提升,该技术首次在 DeepSeek-V2 中引入。传统的多头注意力的键值缓存(KV Cache)较大,DeepSeek 通过将低秩近似方法引入键值缓存压缩中,从而提升了计算效率。

(2)DeepSeek MoE 架构(对传统 MoE 架构的改进):大概贡献了 4 倍以上的计算效 率提升。DeepSeek-V3 是一个混合专家语言模型(MoE),由于 MoE 架构模型的每个输入 数据只选择激活其中一部分专家模型,因而可以减少计算量,提高训练和推理的速度。

DeepSeek-V3 具有 6710 亿参数,其中每个 Token 的计算约激活 370 亿参数。相比于 传统 MoE 模型,DeepSeek 使用专家数量大幅提升,并通过无辅助损失的负载平衡策略提高 训练的稳定性,从而实现了更高的训练效率。

DeepSeek-V3 的训练基于其自研的 HAI-LLM 框架。在模型架构之外,DeepSeek 的训练 架构上展现出了软硬协同优化能力,这成为了他们超越国内其他大模型团队的关键,这其中核 心优势包括了:

(1)FP8 混合精度训练框架:通常在大模型训练中会选用 BF16 或 FP32 / TF32 精度进 行数据计算和存储,FP8 虽然可以提升计算速度和降低存储需求,但是由于计算精度不高, 容易损失数据信息。为此,DeepSeek 结合自身在 GPU 硬件架构和训练误差方面强大的整合 分析能力,专门设计出了针对 FP8 的训练框架体系,将大多数计算密集型操作在 FP8 中进 行,而一些关键操作则保持了原有数据格式,兼顾了训练效率和稳定性。DeepSeek 也成为 了首个成功使用 FP8 混合精度训练超大规模大模型的公司。

(2)DualPipe 算法:实现高效的流水线并行,并通过计算和通信的重叠,隐藏了大模 型训练中的大部分通信开销,规避了单个服务器中 8 个 GPU 共享一个 IB NIC 流水线并行期 间出现的网络带宽竞争。从下图中可以看到,在代表着 8 个 GPU 的流水线并行中,在不同任 务的穿插计算中,白色的气泡时间都得到了极大的压缩。

(3)跨节点 All-to-All 通信内核:使用 PTX 编程,充分利用了节点间互联 (InfiniBand)和 NVLink 带宽。对显存分配进行了优化,无需使用昂贵的张量并行(TP)就 可以完成训练。

根据 DeepSeek 在 3 月 1 日发布的《DeepSeek-V3 / R1 推理系统概览》中“线上系统 的实际统计数据”的相关数据,我们对 DeepSeek 的实际推理成本做了进一步的测算。

当前 DeepSeek 用 278 台 H800 服务器提供推理服务,对应的 GPU 数量为 2224 张。由 于 DeepSeek 在夜间的需求较少,其减少了推理节点,用剩余算力满足自身的研究和训练, 平均占用 GPU 数量为 1814 张,这个数量是远低于市场预期的。 可以看到大约在每日 9 点到 24 点时段,所有节点提供推理服务,低谷阶段仍有约 1/4 的 节点提供推理。

按照理论测算,DeepSeek 会有日均 47.5 万美元的利润,对应的毛利率高达 84.5%,但 实际利润会少于理论值,对比在理论收入测算中与实际收入的差距主要包括: (1)DeepSeek 目前提供了网页、APP 和 API 推理服务,由于网页和 APP 提供免费服 务,DeepSeek 实际只能通过 API 获得收入。 (2)DeepSeek 的收入是以 R1 价格进行的计算,而 V3 的价格低于 R1。

(3)DeepSeek 在夜间提供了折扣,会降低夜间收入价格。 2024 年 10 月媒体 The Information 的报道,根据其获得的 OpenAI 公司财务文件显示, 预计从 2023 年到 2028 年,OpenAI 将蒙受 440 亿美元的损失,其中 2024 年将损失 50 亿美 元,到 2026 年年度损失可能高达 140 亿美元,到 2029 年 OpenAI 或才能扭亏为盈。对比来 看,DeepSeek 凭借强大的成本控制能力,已经可以实现 MaaS 服务盈利,同时实现如此高的理 论毛利率,都是超出市场预期的。

由于 DeepSeek 的推理成本取决于当前时段其用于提供推理服务的节点数,用户使用习 惯会影响服务需求的波动。如在 12 点左右和 18 点左右的用餐时段,DeepSeek 服务需求会 有阶段性下降,从而影响了推理节点的利用率。因而对于规模体量更大的 MaaS 供应商来 说,可以有更多不同类型客户来平抑掉推理服务的波动。比如 C 端用户通过手机等终端的 AI 服务接入后,在用餐时段或将产生更多的服务需求。

参考报告REPORT

计算机行业专题分析:三大要素齐发力,AI应用步入全面加速期.pdf

计算机行业专题分析:三大要素齐发力,AI应用步入全面加速期。我们在2024年11月30日外发的《计算机行业年度策略:国产化形势持续向好,重点关注推理、AI应用和液冷需求》中提出了“o1的问世”“让Agent也步入了发展的快车道,AI在应用软件层的发展潜力亟待释放”。DeepSeek-R1发布后,大模型成本显著下降,开源阵营在性能上实现超越。至此,AI应用集齐全面落地的三大关键要素,这一阶段具有里程碑式意义。要素一:逻辑推理能力提升。OpenAI的o1开启了大模型逻辑推理能力的提升路径,DeepSeek首次公开验证了强化学习对于大模型推理能力提升的...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至