DeepSeek-R1和Janus-pro模型性能如何?

DeepSeek-R1和Janus-pro模型性能如何?

最佳答案 匿名用户编辑于2025/03/12 11:06

DeepSeek-R1 在推理任务上基本实现与 OpenAI-o1 相当的性能,较 o3 模型仍有差距。

DeepSeek 在 R1 模 型的测试过程中,选取英文、中文、数学、代码等基准测试,与 Claude-3.5、GPT-4o、DeepSeek-V3、OpenAI o1、 OpenAI o1-mini 等模型进行比较: 教育为导向的知识任务:在以 MMLU(R1 90.8 分;V3 88.5 分;o1 91.8 分)和 GPQA Diamond(R1 71.5 分;V3 59.1 分;o1 75.7 分;o3 87.7 分)为代表的知识基准上,R1 相比 V3 表现出更优越的性能,主因大规模强化学习(RL)促进 STEM 相关问题上准确性显著进步;在依赖长上下文的 FRAMES(R1 82.5 分;V3 73.7 分)基 准,R1 同样展示了强大的文档分析能力。 中英文搜索和数据分析任务:在英文事实基准测试 SimpleQA(R1 30.1 分;V3 24.9 分;o1 47.0 分)上,R1 优于 V3,展现了模型基于事实的查询能力;而在中文事实基准测试 C-SimpleQA(R1 63.7 分;V3 68.0 分)上, R1 表现不如 V3,主要系安全强化学习后模型倾向于拒绝回答某些查询。如果没有安全 RL, R1 的准确率可以 超过 70%。此外,R1 模型在 IF-Eval(R1 83.3 分;V3 86.1 分)、AlpacaEval2.0(R1 87.6 分;V3 70.0 分)和 ArenaHard(R1 92.3 分;V3 85.5 分)等基准测试中同样表现较好,展现了模型在遵循格式指令、写作任务和开 放域问答上的能力。 数学任务:在数学任务上, R1 表现出与 o1 相当的性能,优于其他非推理模型,突出了推理模型在数学 测试中的主导地位。例如在 AIME 2024 基准上,R1/V3/o1/o3 分别得分 79.8/39.2/79.2/96.7 分;在 Math-500 基准 上,R1/V3/o1 分别得分 97.3/90.2/96.4 分。 编码任务:推理模型在数学测试中同样表现更佳,例如在 Codeforces 基准上,R1/V3/o1/o3 分别得分 2029/1134/2061/2727 分,分别超过 96.3%/58.7%/96.6%/99.9%的人类参赛者;在 SWE-bench Verified 基准上, R1/V3/o1/o3 分别得分 49.2/42.0/48.9/71.7 分。

蒸馏技术能显著提升小模型推理能力。通过向更高效的小模型蒸馏 DeepSeek-R1 的输出,能够显著提升小 模型推理能力。例如,向 Qwen2.5-Math-7B 蒸馏 R1 模型得到的 DeepSeek-R1-Distill-Qwen-7B(简称 R1-7B,下 同),全面超越非推理模型如 GPT-4o;向 Qwen2.5-14B 蒸馏得到 R1-14B 在所有评估指标上均超过了 QwQ- 32BPreview;而向 Qwen2.5-32B 和 Llama-3.3-70B-Instruct 蒸馏得到的 R1-32B 和 R1-70B 在大多数基准测试中显著 超越了 o1-mini。

Janus-Pro 在多模态理解和生成方面优于统一模型和单一功能模型。Janus-pro 主要延续 Janus 通过解耦多 模态理解和生成的研究思路,通过优化训练策略、扩展训练数据和模型规模等方面提高模型性能: 多模态理解:在 Janus 测试过程中选取 POPE、MME-P、MMB、SEED、MMMU、MM-Vet 等广泛认可的图 像视觉语言基准测试,同时包括了一种用于真实世界视觉推理和组合式问答的新数据集 GQA。与其他前沿图像 理解生成统一模型和仅用于理解的模型相比,Janus-Pro 取得了总体最佳的结果,例如 Janus-Pro-7B 在多模态理 解基准 MMBench 上得分 79.2,超越了包括 Janus(69.4)、TokenFlow(68.9)和 MetaMorph(75.2)等,主因其 将多模态理解和生成的视觉编码解耦,缓解了这两个任务之间的冲突。此外,Janus-Pro 与规模更大的模型相比 仍具竞争力,例如 Janus-Pro-7B 在除 GQA 外的其他基准测试上的表现都优于 TokenFlow-XL(13B)。 文本-图像生成:为评估 Janus 视觉生成能力,DeepSeek 采用 GenEval(文本到图像构图能力基准测试)和 DPG-Bench(密集提示图基准测试)两个工具进行测试。Janus-Pro-7B 在 GenEval 上的总体准确率达到 80%, 超过了所有其他统一模型或仅用于生成的模型,包括 Transfusion(63%)、SD3-Medium(74%)和 DALL-E 3 (67%),反映 Janus-Pro 具有更好的指令跟随能力。同时,Janus-Pro 在 DPG-Bench 上的得分为 84.19,超过了 所有其他方法,表明 Janus-Pro 在遵循用于文本到图像生成的密集指令方面表现出色。

我们认为,DeepSeek-R1 性能已基本达到 OpenAI-o1 水平,较 o3 模型基准测试表现仍有不小差距,随着 DeepSeek 在 MoE 架构、强化学习等技术上进一步迭代,推理模型性能表现有望持续增长;Janus-Pro 在多模态 理解和生成方面则相对表现较好,一定程度验证了图像理解和生成解耦思路的可行性。

参考报告REPORT

DeepSeek核心十问十答.pdf

DeepSeek核心十问十答。DeepSeek-R1模型发布,具有高性能、低算力需求的特性,带动小模型推理能力的提升,引发全球开发者及用户关注。R1作为开源模型性能接近头部闭源模型o1,一定程度上已经反映了AI平权,同时纯强化学习对推理能力的提升带来RL范式泛化可能,预计后续基模的持续迭代,有望推动AI全产业链持续保持高景气和高关注度,关注算力、应用、端侧、数据等核心投资机会。DeepSeek模型密集更新,高性能+低成本促进用户数高增近期DeepSeek多款模型上线并完全开源,其中R1在推理任务上基本实现于o1相当的性能,Janus-Pro在多模态理解和生成方面表现较好。受春节信息传播下沉促进...

我来回答
分享至