国内模型深度推理发展现状如何?

国内模型深度推理发展现状如何?

最佳答案 匿名用户编辑于2025/03/12 10:47

R1-Zero验证了大模型仅通过RL就可实现强大推理能力。

Deepseek发布两款具备深度推理能力的大模型R1-Zero和DeepSeek-R1。 R1-Zero的训练,证明了仅通过RL,无SFT,大模型也可以有强大的推理能力。在AIME 2024上,R1-Zero的pass@1指标 从15.6%提升至71.0%,经过投票策略(majority voting)后更是提升到了86.7%,与OpenAI-o1-0912相当。 架构思路:没有任何SFT数据的情况下,通过纯粹的强化学习。 算法应用:直接在DeepSeek-V3-Base模型上应用GRPO算法进行强化学习训练。 奖励机制:使用基于规则的奖励机制,包括准确性奖励和格式奖励,来指导模型的学习。 训练模板:采用了简洁的训练模板,要求模型首先输出推理过程(置于标签内),然后给出最终答案(置于标签内)。

DeepSeek-R1:长CoT数据微调基础上应用强化学习。架构思路:在DeepSeek-V3-Base模型的基础上,经历两次微调 和两次强化学习得到R1模型。 Step 1.冷启动阶段:使用数千个高质量的长Cot人工标注样本 对DeepSeek-V3-Base模型进行微调,作为强化学习的初始模型。 Step 2.面向推理的强化学习:在冷启动阶段之后,R1采用了 与R1-Zero类似的强化学习训练,但针对推理任务进行了特别 优化。为了解决训练过程中可能出现的语言混杂问题,R1引入 了语言一致性奖励,该奖励根据CoT中目标语言单词的比例来 计算。 Step 3.拒绝采样与监督微调:当面向推理的强化学习收敛后, R1利用训练好的RL模型进行拒绝采样,生成新的SFT数据。 Step 4.面向全场景的强化学习:在收集了新的SFT数据后,R1 会进行第二阶段的强化学习训练,这一次,训练的目标不再局 限于推理任务,而是涵盖了所有类型的任务。此外,R1采用了 不同的奖励信号和提示分布,针对不同的任务类型进行了优化。

R1在推理任务上表现出色,特别是在AIME 2024(美国数学邀请赛)、MATH-500(数学竞赛题)和Codeforces(编程 竞赛)等任务上,取得了与OpenAI-o1-1217相媲美甚至超越的成绩。在MMLU(90.8%)、MMLU-Pro(84.0%)和GPQA Diamond(71.5%)等知识密集型任务基准测试中,性能显著超越了DeepSeek-V3模型。在针对长上下文理解能力的 FRAMES数据集上,R1的准确率达到了82.5%,优于DeepSeek-V3模型。在开放式问答任务AlpacaEval 2.0和Arena-Hard 基准测试中,R1分别取得了87.6%的LC-winrate和92.3%的GPT-4-1106评分,展现了其在开放式问答领域的强大能力。

DeepSeek团队进一步探索了将R1的推理能力蒸馏到更小的模型中的可能性。他们使用R1生成的800K数据,对Qwen和 Llama系列的多个小模型(1.5B、7B、8B、14B、32B、70B)进行了微调。经过R1蒸馏的小模型,在推理能力上得到了显 著提升,甚至超越了在这些小模型上直接进行强化学习的效果。推理成本来看,R1模型价格只有OpenAI o1模型的几十分之一。训练成本来看,DeepSeek-V3在一个配备2048个NVIDIA H800 GPU的集群上进行训练,预训练阶段在不到两个月内完成,并消耗了2664K GPU小时,总训练成本为557.6万美元。

2025年1月20日,kimi1.5版本模型发布,这是继2024年11月发布 k0-math 数学模型,12月发布 k1 视觉思考模型之后,Kimi 连续第三个月带来 k 系列强化学习模型的重磅升级。 从基准测试成绩看,k1.5 多模态思考模型实现了 SOTA (state-of-the-art)级别的多模态推理和通用推理能力。 在 short-CoT 模式下,Kimi k1.5 的数学、代码、视觉多模态和通用能力,大幅超越了全球范围内短思考 SOTA 模型 GPT-4o 和 Claude 3.5 Sonnet 的水平,领先达到 550%。 在 long-CoT 模式下,Kimi k1.5 的数学、代码、多模态推理能力,也达到长思考 SOTA 模型 OpenAI o1 正式版的水平。这 应该是全球范围内,OpenAI 之外的公司首次实现 o1 正式版的多模态推理性能。

Kimi k1.5 通过几个关键技术实现了强化学习(RL)在大型语言模型(LLMs)中的有效扩展和性能提升: 1)长上下文扩展:通过将RL的上下文窗口扩展到128k,Kimi k1.5能够处理更长的文本序列,从而在多个任务上提升性能。在推理过程 中,也保证了更长的思维链,可以进行更多步骤,更深入的思考。 2)改进的策略优化:采用在线镜像下降法的变体进行策略优化,并结合有效的采样策略、长度惩罚和数据配方优化,进一步提升了模 型的训练效果,进一步节约算力和思考时间。 3)简化的RL框架:通过长上下文扩展和改进的策略优化,Kimi k1.5建立了一个简化的RL学习框架,使得模型能够在不依赖复杂技术的 情况下实现强大的性能,优化算力。 4)多模态处理能力:Kimi k1.5能够同时处理文本和视觉数据,展现了在多模态数据上进行联合推理的能力。(对比Deepseek R1仅为 纯语言模型)

Kimi k1.5的推理框架分为核心几块:1)Rollout 模块:理解为推理过程中的试错者和推演者,不断推演不同可能性,从而找到最优解。 可以想象成一群工人在生产线上进行实际的操作记录下每一步的结果。根据当前的模型权重生成一系列的决策路径。 2)主管(Master)模块:理解为指挥中心。负责协调和管理整个训练过程,接收来自Rollout模块的轨迹数据,评估模型的表现,并向 Trainer Workers发送训练数据。主管还负责管理Replay Buffer(缓冲区),确保推理数据的高效利用。 3)训练模块:负责根据Rollout模块提供的数据来训练模型。使用策略模型(Policy Model)和参考模型(Reference Model)来计算梯 度更新(gradient update),从而优化模型的性能。 4)奖励模型和缓冲区:前者是 “裁判”,负责评估模型表现并给出奖励信号。后者是“记忆库”,用于存储Rollout生成的轨迹数据。 Partial Rollout创新:在Rollout模块的推理中,不需要每次都从头开始,可以从缓冲区中读取之前的轨迹后继续推理。类似于1)下棋 中,每次只需要思考最关键的步骤,而不用思考前面简单的步骤。2)设计方案时,可以复用地基的设计,只考虑顶层的不同设计方案。

2024年09月19日,阿里发布Qwen2.5系列,包括0.5B,1.5B,3B,7B,14B,32B以及72B,以及专门针对编程的Qwen2.5- Coder和数学的Qwen2.5-Math模型。Qwen2.5所有系列模型都在18Ttokens的数据集上进行了预训练,相较于Qwen2, Qwen2.5获得了更多的知识(MMLU:85+),并在编程和数学方面有了大幅提升。 用于编程的Qwen2.5-Coder和用于数学的Qwen2.5-Math,相比其前身CodeQwen1.5和Qwen2-Math有了实质性的改进: Qwen2.5-Coder在包含5.5Ttokens编程相关数据上进行了训练,使即使较小的编程专用模型也能在编程评估基准测试中 表现出媲美大型语言模型的竞争力。同时,Qwen2.5-Math支持中文和英文,并整合了多种推理方法,包括CoT (ChainofThought)、PoT(ProgramofThought)和TIR(Tool-IntegratedReasoning)。

参考报告REPORT

DeepSeek R1深度解析及算力影响几何.pdf

DeepSeekR1深度解析及算力影响几何。核心观点:Deepseek发布深度推理能力模型。R1-Zero采用纯粹的强化学习训练,证明了大语言模型仅通过强化学习也可以有强大的推理能力,DeepSeek-R1经历微调和强化学习取得了与OpenAI-o1-1217相媲美甚至超越的成绩。DeepSeekR1训练和推理算力需求较低,主要原因是DeepSeekR1实现算法、框架和硬件的优化协同。过去的预训练侧的scalinglaw正逐步迈向更广阔的空间,在深度推理的阶段,模型的未来算力需求依然会呈现爆发式上涨,充足的算力需求对于人工智能模型的性能进步依然至关重要。Deepseek发布深度推理能力模型,性...

我来回答
分享至