DeepSeek-V3/R1技术革新有哪些?

DeepSeek-V3/R1技术革新有哪些?

最佳答案 匿名用户编辑于2025/03/12 11:07

通过架构和基础设施创新,DeepSeek-V3 实现了高效训练,奠定 R1 模型优化基础。

架构方面,DeepSeekV3 延续了 V2 模型的 MLA 和 DeepSeek MoE 架构,同时进一步开创了无辅助损失的负载均衡策略,并设定了 多 token 预测(MTP)训练目标以增强性能: 多头潜在注意力(MLA):LLM 的核心机制是自注意力(Self-Attention),其要求模型在生成每个 token 时 考虑之前所有词的关系,则假设文本长度 n 时总体复杂度为( 3 ) = ( 2 );过去的研究提出了 KV Cache 方 法,利用键值对(KV)存储已计算的注意力信息,此时总体复杂度降低为( 2 );而 MLA 则进一步通过投影的方式,将 token 的相异信息通过投影矩阵存储,在几乎不损失信息的情况下减少键值的缓存需求。 DeepSeekMoE:专家混合模型(MoE)是当前大模型技术中对前馈神经网络(FNN)的一种替代方案。不 同于 FNN 需要全部权重参与计算,MoE 利用门控机制判断输入数据需要由哪些专家模型参与处理。相较于主 流 MoE模型,DeepSeekMoE 使用更细粒度的专家,并隔离一些模型作为共享专家,进一步优化了激活参数。此 外,为解决专家负载不平衡导致的路由崩溃和计算效率降低,DeepSeek 提出无辅助损失负载均衡策略,为每个 专家模型添加可动态调整的偏差项,确保训练过程中专家负载平衡、提高模型性能。

多 token 预测(MTP):主流大模型 token-by-token 生成序列,而每次 token 生成需要频繁与访存交互,从 而因为访存效率形成训练或推理的瓶颈。MTP 方法主要将单 token 的生成,转变成多 token 的生成,提升训练 和推理的性能。DeepSeek 主要对过往 MTP 算法进行了一定优化,顺序预测额外 token,并在每个预测深度保持 完整的因果链。

除了基础架构,DeepSeek 还在基础设施方面进行了一定优化。例如设计了一种创新的管道并 行算法 DualPipe,在每一对前向和后向块内重叠计算和通信,提高通信效率、加速了模型训练;提出了一种用于 FP8 训练的混合精度框架,其中大多数计算密集型操作在 FP8 精度下进行,而一些关键操作则战略性地保持在原始 数据格式以平衡训练效率和数值稳定性;训练过程中,采用英伟达 PTX(并行线程执行)汇编级编程替代标准 CUDA 方案,实现了硬件级深度优化,减少了计算冗余,提高了推理速度。

R1-Zero 验证纯强化学习(RL)对推理能力的提升,R1 则强调冷启动和多阶段训练的平衡。R1-Zero 的特别之处在于,其无需任何监督微调数据即可获得强大的推理能力,反映了模型仅通过强化学习就能有效学习和 泛化的能力。具体而言,R1-Zero 模型在 RL 过程中延续了 DeepSeek-V3 组相对策略优化算法(GRPO),通过组 内奖励对比优化策略,而不需要额外的判别器,最终实现训练集上的平均响应长度持续提升,自然地学会了通 过更多的思考时间来解决推理任务;此外,R1-Zero 训练过程自然地涌现出“思考能力”,即模型自发学会了重 新评估其初始回答,并为问题分配更多的思考时间,这种“反思”的特性能够一定程度解决大模型幻觉问题(大 模型逐 token 输出,过去没有机制去纠正已经输出的错误,反而会继续用错误掩盖先前的问题,带来幻觉问题)。 尽管 R1-Zero 模型展现了强大的推理能力,但仍面临可读性差和语言混合等挑战,R1 模型则通过冷启动和 多阶段训练解决了上述问题。R1 同样从 DeepSeek-V3-Base 基础模型出发,经过数千条优质长链思维(CoT)数 据微调(SFT)作为冷启动,使模型输出更符合要求、可读性更强;而后,针对微调后的模型采用与 R1-Ze ro 相 同的大规模强化学习,并引入语言一致性奖励,直至模型在推理任务上达到收敛;面向推理的强化学习收敛后, 利用生成的检查点收集新的 SFT 数据,从而融入来自其他领域的数据,以增强模型在写作、角色扮演和其他通 用任务中的能力;最后,为了进一步使模型与人类偏好保持一致,实施次级 RL阶段,旨在提高模型的有用性和 无害性、精炼其推理能力。通过冷启动和多阶段训练,R1 模型最终具备较强的推理性能,同时在可读性上表现 较好。

R1 系列模型提供了 RL Scaling Law的可行方向。实际上,在 OpenAI 推出 o1 模型时即发现了推理性能随 着训练时间和测试时间计算而平稳提升的“RL Scaling law”,但业内尚未通过过程奖励模型(PRM)和蒙特卡洛 树搜索(MCTS)等方法做出较好的效果,R1 的技术报告更是提到 PRM 和 MCTS 存在难以规模化拓展、奖励 欺骗等问题。R1 模型的技术报告提供了一种多阶段训练的方式,其中在第一阶段 RL过程中,研究人员可以通 过扩大 RL训练集的方式提升模型性能,或为一种可以验证的“RL Scaling law”方向;OpenAI 首席研究官 Mar k Chen 也承认,“DeepSeek 的确独立发现了一些 o1 的核心思路”。

蒸馏使小模型具备较强逻辑推理能力的思路或与 OpenAI o1-mini 不同。据张俊林分析,o1 系列模型更可 能是重新训练的(OpenAI 多次强调 o1-mini 逻辑推理能力强,但在世界知识方面弱;如果其基于 GPT 系列模型 而来,世界知识应该不会弱于 GPT 4o-mini),而 DeepSeek-R1 则是在 V3 的基础上通过强化学习训练得到。因 此,DeepSeek 通过向更高效的小模型蒸馏 DeepSeek-R1 的输出,显著提升小模型推理能力,更可能走出了与 OpenAI o1-mini 不同的道路,从而实际上打破了之前“小模型逻辑推理能力难以通过蒸馏提升”的研究结论。 此时,小模型有望通过“能力分治”(DCA)的模式将语言、世界知识及逻辑推理三个能力解耦,即语言能 力靠小模型自身、逻辑推理靠 RL+蒸馏,世界知识靠外挂 RAG,从而具备目前最强大模型的能力,对于中小型 开发者而言,部署模型也将更加友好。

我们认为,DeepSeek-V3/R1 系列模型的核心突破在于 1)技术及架构升级显著优化模型训练成本,即工程 优化了 MoE模型架构,预计未来各厂商仍将围绕 MoE模型进行注意力头的架构优化;2)组相对策略优化算法 (GRPO)实质上仅依赖模型自身近些迭代,实现了“反思能力”;3)提供了一种具体可行的“RL Scaling law” 方向,各厂商或将跟进并继续探索其他方向;4)蒸馏使小模型具备较强逻辑推理能力,有望促进中小型开发者 推出相关应用。

参考报告REPORT

DeepSeek核心十问十答.pdf

DeepSeek核心十问十答。DeepSeek-R1模型发布,具有高性能、低算力需求的特性,带动小模型推理能力的提升,引发全球开发者及用户关注。R1作为开源模型性能接近头部闭源模型o1,一定程度上已经反映了AI平权,同时纯强化学习对推理能力的提升带来RL范式泛化可能,预计后续基模的持续迭代,有望推动AI全产业链持续保持高景气和高关注度,关注算力、应用、端侧、数据等核心投资机会。DeepSeek模型密集更新,高性能+低成本促进用户数高增近期DeepSeek多款模型上线并完全开源,其中R1在推理任务上基本实现于o1相当的性能,Janus-Pro在多模态理解和生成方面表现较好。受春节信息传播下沉促进...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至