如何看待DeepSeek的出圈?

如何看待DeepSeek的出圈?

最佳答案 匿名用户编辑于2025/03/12 11:10

DeepSeek全球出圈,激发竞争活力。

1.DeepSeek:低成本+高性能模型,引发全球AI产业的竞争活力

12月底上线V3模型,多项评测成绩接近GPT-4o。V3为开源MoE模型,当前版本暂不支持多模态输入 输出。其多项评测成绩超越了 Qwen2.5-72B 和 Llama-3.1-405B 等其他开源模型,知识类、长文本、代 码测试表现超过GPT-4o。但每百万token的输入和输出价格分别为0.27和1.10美元,显著低于GPT-4o 的2.50和10美元。

MLA(多头潜在注意力)创新技术降低模型推理成本。MLA与标准注意力机制相比,每个查询所需 的 KV 缓存量(存储上下文对话)减少约93.3%,从而减少计算量和算力需求。我们认为这是 DeepSeek实现超低API价格的关键一环。

2.DeepSeek:R1模型低成本、高效率,性能赶超o1模型

Deepseek发布开源模型DeepSeek-R1。数学/编程/推理能力接近OpenAI的o1模型,但API调用成本仅 为其2%。DeepSeek-R1系列包括DeepSeek-R1-Zero和DeepSeek-R1两大模型,核心创新点在于: 传统大模型需要大量人工标注的监督数据进行训练,但DeepSeek-R1-Zero仅通过大规模强化学习训练 ,没有监督微调,便自发涌现出“反思”“多步验证”等复杂推理行为,训练成本较低。 推理能力可以向小模型迁移。使用DeepSeek-R1作为教师模型生成800K数据对小模型微调,提升逻辑 能力,通义千问15亿参数开源模型经过微调后,数学能力超过GPT-4o。

DeepSeek——C端视角:全球破圈, 成为用户规模增速最快的移动端AI应用

DeepseekAI助手成为今年春节爆款应用。 看国内:2021-2024年春节中国区iOS应用榜Top10,字 节系普遍占5个以上,今年DeepSeek稳居榜首,成为首 个在春节期间持续霸榜的AI应用。 看全球:春节期间Deepseek登顶中国、美国、德国等全 球超100个国家和地区的iOS应用总榜第1,下载量超越 ChatGPT。用户从早期的开发者+编成IT群体,拓宽到 了目前的泛C端用户。

Deepseek成为全球用户规模增速最快的移动端AI应用。 日活(全球):据AI产品榜,DeepSeek移动端上线第20天 (1月30日)全球日活2161万,为同期ChatGPT移动端日 活 14.8 倍。若对比海外移动端用户数(SensorTower口径 ),1月31日DeepSeek为1203万,环比增加4%。 下载量(全球):据点点数据,截至2月1日DeepSeek App 全球累计下载量2261万创新高,环比前一天增加16%。

全球主流的公有云公司均在旗下的AI应用开发平台中接入DeepSeek模型,包括微软、亚马逊、腾讯 、华为、案例、百度等。应用端,秘塔AI搜索成为首个接入DeepSeek模型的国产应用之一,弥补了 当前DeepSeek AI助手未开放联网搜索功能的问题。

DeepSeek——大厂视角:看好DeepSeek提升AI应用渗透率

多个海外AI应用公司高管认为DeepSeek提升大模型效率、降低推理成本。当前大模型性能已满足绝 大部分应用场景,DeepSeek提升大模型训练和推理效率、降低API成本,有望提升AI应用在各个场景 的渗透率。苹果、微软和SAP的CEO均对DeepSeek在大模型效率和成本方面的贡献给予积极评价, Meta作为海外头部开源模型研发厂商,CEO表示将吸收DeepSeek的模型开发经验。

DeepSeek——大厂视角:微软、Meta未下调资本开支预期,对推理需求保持乐观

微软和Meta并未下调25财年资本开支计划,我们认为这是对推理侧需求的积极预判。 微软:四季度(FY2Q25)资本开支226亿美元,公司指引未来两个季度与四季度相近,则25财年合计 约800亿美元,与1月初的指引相近。CEO纳德拉提到DeepSeek反映了创新周期中的成本下降趋势,有 望带来更多AI需求,利好微软这种AI服务提供商;微软未来资本开支会根据需求决定。 Meta:公司重申25财年资本支出600-650亿美元,CEO扎克伯格提到重金投入AI基础设施是长期战略。

DeepSeek——开发者视角:适合本地化部署的大参数高性能模型

Hugging Face数据反映DeepSeek V3和R1均为适合本地化部署的大参数高性能模型。Hugging Face是全 球主流的开源模型社区之一,该社区的模型下载量虽然不能直接反映基于各模型开发的AI应用数量, 但也侧面反映了开发者对不同模型的偏好。 小参数模型:性能较弱,但推理算力和存储需求较小,适合本地化微调和部署,因此Llama 3.1 8B等小 参数模型下载量断层式领先。据Synaptic的统计,24年6月下载量前10的模型,参数量普遍低于100亿; 中大参数模型:性能较强,但对推理算力、部署设备均有较高要求。V3和R1性能处于第一梯队,同 时推理算力需求相对较低,适合本地化部署和蒸馏,近一个月下载量显著高于Llama和通义千问2.5。

GitHub的Stars是项目在社区中受欢迎程度的直接指标,Fork则表示项目累计被用户拷贝的数量,两个 指标均代表项目上线至今的关注度和用户喜爱度。DeepSeek V3和R1两个项目上线至今均不足2个月, 但它们的累计Star和Fork均与上线时间更早的Llama接近,显著高于24年4月发布的Llama3,直接反映 了开发者对DeepSeek开源模型的高认可度。

DeepSeek——开发者视角:模型运行成本低,降低AI应用开发门槛

开发者展示了R1模型进行本地化部署的案例。V3和R1模型均采用稀疏MoE架构,推理过程中激活 的参数较少,算力和设备要求也相应较低。我们通过GitHub、Hugging Face两大开发者社区,以及 Youtube相关内容梳理本地化部署和调用R1模型的实测体验,Youtube博主Deep Charts和Digital Spaceport的实测结果显示,671B大模型可以在较低成本的服务器中部署(满足特定配置要求),经 过微调的80亿参数小模型则可以在普通的M1 Macbook Pro中赋能多Agent工作流。作为对比,Llama 3.1 405B需要在两台H100服务器中运行,年租金合计30万美元以上(SemiAnalysis测算)。

DeepSeek——行情视角:港股AI公司涨幅显著,国产应用有望加速落地

国产模型全面赶超海外,市场看好国产应用长期受益。DeepSeek V3和R1模型是国产模型快速赶超海 外的典型代表。国产模型追平海外的时间不断缩短,4o发布半年之后,国产豆包、Minimax就发布对 标模型;Sora的demo4个月后,国产AI视频可用度与性价比更高;o系列模型发布4个月后,R1等国产 o系列模型涌现。国产应用有望受益于国产模型能力跃升,春节后首个交易日港股AI公司涨幅明显, 恰恰反映之一市场预期。

阿里:Qwen2.5-Max综合性能对标DeepSeek V3,国产开源模型再添重磅新品

Qwen Max是通义千问系列效果最好的模型,春节期间更新了2.5版本。新版本同样为超大规模MoE 模型,在大学水平知识测试MMLU-Pro、编程能力测试LiveCodeBench,综合能力测试LiveBench中, 新版本结果均略高于DeepSeek V3,与GPT-4o的水平接近。当前已推出AI助手和API服务。新版本使 用了超过20万亿token的预训练数据,显著超过Llama3的15万亿,是超大规模模型训练的典型案例。

参考报告REPORT

DeepSeek专题报告:DeepSeek激活创新竞争,AI应用迎来“安卓时刻”.pdf

DeepSeek专题报告:DeepSeek激活创新竞争,AI应用迎来“安卓时刻”。Deepseek激发创新竞争之后,AI应用怎么看?应用开发迎来“安卓时刻”。回顾安卓与iOS应用的发展,我们率先提出不应只关注大模型本身的用户数及活跃度,更应该关注开发者,尤其是中小开发者的数量。据GitHub,在Llama比DeepSeek开源时间早1年半的情况下,目前DeepSeekR1在GitHub上的开发者点赞数量已经达到约5.7万,接近Llama。根据GitHub、HuggingFace社区上的开发者实测,经过R1微调的80亿参数小模型可以在个人笔记本中运...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至