如何看待DeepSeek-V3模型的训练成本?

如何看待DeepSeek-V3模型的训练成本?

最佳答案 匿名用户编辑于2025/03/12 11:07

DeepSeek 通用及推理模型成本相较于 OpenAI同类模型下降至数十分之一以下:

通用模型方面,2024 年 12 月 26 日 DeepSeek-V3 更新上线,模型 API 服务定价调整为每百万输入 tokens 0.5 元(缓存命中)/ 2 元(缓存未命中),每百万输出 tokens 8 元。此外,V3 模型设置长达 45 天的优惠价格 体验期:2025 年 2 月 8 日前,V3 的 API 服务价格仍保持每百万输入 tokens 0.1 元(缓存命中)/ 1 元(缓存未 命中),每百万输出 tokens 2 元。与此同时,OpenAI GPT-4o 的 API 服务定价为每百万输入 tokens 1.25 美元 (缓存命中)/ 2.5 美元(缓存未命中),每百万输出 tokens 10 美元。 推理模型方面,DeepSeek-R1 API 服务定价为每百万输入 tokens 1 元(缓存命中)/ 4 元(缓存未命中), 每百万输出 tokens 16 元。而 OpenAI o1 的 API 服务定价为每百万输入 tokens 7.5 美元(缓存命中)/ 15 美元 (缓存未命中),每百万输出 tokens 60 美元。

需要注意的是,不同模型 token 切分方法可能不同,通常 1 token 可对应 1-2 个中文汉字,或对应 3-4 个英 文字符,或 0.75 个英文单词。

DeepSeek-V3(R1 的基础模型)总训练成本仅为 557.6 万美元,但不包括架构、算法等成本。以 H800 算 力计算,DeepSeek-V3 预训练阶段在不到两个月的时间内完成,耗费 266.4 万个 GPU 小时,加上上下文长度扩 展所需的 11.9 万个 GPU 小时和后训练阶段的 0.5 万个 GPU 小时,DeepSeek-V3 的完整训练仅需 278.8 万个 GPU 小时;假设 H800 GPU 的租用价格为每 GPU 小时 2 美元,我们的总训练成本仅为 557.6 万美元。需要 注意的是,上述成本仅包括 DeepSeek-V3 的正式训练成本,不包括与架构、算法或数据的前期研究及消融实验 相关的成本。

根据我们测算,GPT-4 需要 2.5 万张 A100 训练 95 天(5700 万 A100 GPU小时),OpenAI o1 需要用 3.2 万张 H100 训练 90 天(6912 万 H100 SXM GPU小时):1)GPT-4 由 16 个 111B 的 MoE模型构成,其中两个 用于向前传播,另有 55B 被用做注意力机制的共享,则 GPT-4 的激活参数量约为 280B,我们假定 o1 模型激活参数量是 GPT-4 的两倍,达到 560B;2)GPT-4 的预训练数据集 token 量为 13B,我们假定 o1 模型接近其两倍, 达到 25B;3)GPT-4 的训练时间约为 90-100 天,我们取中间值 95 天,并假定 o1 的训练周期为 90 天;4)GPT - 4 的 GPU 利用率在 32%到 36%之间,我们取中间值 34%,并假定 o1 GPU 利用率也为 34%;5)根据 OpenAI 在 Scaling Laws 论文中给出的经验公式计算(C = rT ≈ 6*P*D,P 为模型参数量,D 为训练集 token 大小,r 为训 练集群硬件 FLOPS 总吞吐),则 OpenAI o1 预训练需要用 3.2 万张 H100。

算法迭代、架构升级促进 DeepSeek-V3 模型训练成本降低,符合产业趋势。相较于 GPT-4 和 o1 模型, DeepSeek-R1 的基础模型 DeepSeek-V3 训练成本明显更低,结合 V3 技术报告和上述计算过程,我们认为成本优 化主要缘于:1)V3 模型通过 DeepSeekMoE 架构(3.1 中将进一步说明),使用更细粒度专家模型,同时隔离部 分共享专家,提高计算资源利用率,激活参数少(仅 37B),算力消耗低;2)V3 模型采用 MLA 算法(3. 1 中将 进一步说明),通过低秩联合压缩注意力键值,减少推理时的键值(KV)缓存,降低计算量;3)Dual Pipe 框架 实现高效流水线并行,或显著提高 GPU利用率;4)DeepSeek 提出了一种利用 FP8 数据格式进行训练的细粒度 混合精度框架,通过低精度训练优化训练效率。

参考报告REPORT

DeepSeek核心十问十答.pdf

DeepSeek核心十问十答。DeepSeek-R1模型发布,具有高性能、低算力需求的特性,带动小模型推理能力的提升,引发全球开发者及用户关注。R1作为开源模型性能接近头部闭源模型o1,一定程度上已经反映了AI平权,同时纯强化学习对推理能力的提升带来RL范式泛化可能,预计后续基模的持续迭代,有望推动AI全产业链持续保持高景气和高关注度,关注算力、应用、端侧、数据等核心投资机会。DeepSeek模型密集更新,高性能+低成本促进用户数高增近期DeepSeek多款模型上线并完全开源,其中R1在推理任务上基本实现于o1相当的性能,Janus-Pro在多模态理解和生成方面表现较好。受春节信息传播下沉促进...

我来回答
分享至