DeepSeek模型种类、优势、调用与部署分析

DeepSeek模型种类、优势、调用与部署分析

最佳答案 匿名用户编辑于2025/03/07 16:40

低训练成本、低推理成本。

DeepSeek共研发开源十余款模型,目前最受关注的有V3对话模型和R1推理模型,分别 于2024年12月26日和2025年1月20日先后发布。从反映关注度的微信指数上可以看出, 两次模型发布都造成了后续DeepSeek关注度的飙升,12月28日DeepSeek指数达到约 6000万,1月31日达9.8亿。 V3:是采用混合专家架构(MoE)的高性能对话模型,支持多任务处理并在代码生成、 数学推理等场景表现优异。 R1:是基于强化学习训练的推理模型,专注于代码生成和复杂数学问题解决,推理能 力通过蒸馏技术可迁移至小型模型。

推理模型是在基座模型基础上再经过推理数据训练得到的模型,回答问题时会先通过思维链( CoT )逐步思考,再输出结果。 DeepSeek R1模型属于一种推理模型。

OpenAI的o1模型性能曾在推理模型领域 难逢敌手。DeepSeek-R1模型,在AI模型基准能力的 各大榜单中,得分与OpenAI o1模型不相 上下。 过去两年中,中国AI模型在业内曾被认 为落后于美国模型半年到一年。 DeepSeek R1模型的出现终结了中国AI落 后的观点。 作为国产模型,DeepSeek对中文支持更 好。

从模型训练看,DeepSeek-V3 在2048 块H800 GPU 训练3.7天,换算成单块GPU共278.8万小时,以H800每小时2美元成本计算,最后 一轮训练硬件成本仅约558 万美元;Meta同规格的Llama 3.1模型约花费9240万美元,相比高出16倍。 从模型推理看,以官方API接入价格为例,对话模型DeepSeek V3价格约为OpenAI GPT-4o价格的十分之一;推理模型DeepSeek R1价 格约为OpenAI o1价格的二十分之一。

在各家AI模型厂商宣布开源时,开源的程度并不相同。开放源代码促进会(OSI)于2024年10月发布开源AI定义1.0(OSAID 1.0)。 OSAID 1.0从模型权重、训练数据、代码、商业使用权、社区协议、符合开源定义等多维度评价开源程度。

OpenAI创始人Sam Altman:DeepSeek R1是一个令人印象深刻的模型,尤其是能够以这样的价格提供卓越性能。我们(OpenAI) 显然会推出更好的模型,同时,有一个新的竞争对手加入确实让人感到振奋! 微软CEO Satya Nadella:DeepSeek的新模型非常令人印象深刻,他们不仅有效地实现了一个开源模型,实现了推理时间计算,而 且计算效率极高。 AI投资机构a16z 创始人 Marc Andreessen:DeepSeek R1是他所见过的最令人惊叹、最令人印象深刻的突破之一,是给世界的一份 深刻礼物。 Eureka Labs 创始人 Andrej Karpathy:DeepSeek R1与 OpenAI 的模型在性能上旗鼓相当。 Perplexity 创始人 Aravind Srinivas :DeepSeek 是人工智能和开源的重大进步。人工智能模型和使用这些模型的产品需要最大限度 地寻求真相。输出越虚假,使用这些模型或其输出(直接作为用户)和间接(用于提炼)就越危险。 NVIDIA 资深研究经理 Jim Fan:DeepSeek不仅开源了一系列模型,更难能可贵的是公开了所有训练细节。

DeepSeek R1模型可通过云端调用和本地部署的方式使用。云端调用,可通过官方API或第三方API直接调用DeepSeek R1模型服务并接入业务中;或者可以在云平台上创建、部署、微调 模型,再通过API连接模型调用。 • 云端调用优势在于,用户无需购置硬件即可按需调用云端模型。本地部署 ,要本地运行模型,用户需下载DeepSeek R1满血版或蒸馏版本模型,通过Ollama、vLLM等工具启动模型,并借助可视化界面工 具与用户交互。 • 本地部署优势在于无网络依赖,适合对数据安全要求高的企业私有化场景,但需满足高性能显卡和服务器的硬件配置要求。

参考报告REPORT

DeepSeek完全实用手册1.0版:从技术原理到使用技巧.pdf

DeepSeek完全实用手册1.0版:从技术原理到使用技巧。DeepSeek全称杭州深度求索人工智能基础技术研究有限公司,简称深度求索,成立于2023年7月,是幻方量化旗下的AI公司,专注于实现通用人工智能(AGI),具有深厚的软硬件协同设计底蕴。DeepSeek共研发开源十余款模型,目前最受关注的有V3对话模型和R1推理模型,分别于2024年12月26日和2025年1月20日先后发布。从反映关注度的微信指数上可以看出,两次模型发布都造成了后续DeepSeek关注度的飙升,12月28日DeepSeek指数达到约6000万,1月31日达9.8亿。V3:是采用混合专家架构(MoE)的高性能对话模型...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至