大模型全球格局与特点有哪些?

大模型全球格局与特点有哪些?

最佳答案 匿名用户编辑于2024/07/18 10:42

全球格局与模型特点基本明晰。

1.全球格局:海外技术收敛,国内百花齐放

海外闭源大模型已经形成 OpenAI 为首,Google、Anthropic 等模型紧随的格局。闭源模 型中,虽然 Google Gemini 和 Anthropic 分别于 24 年 2 月和 3 月更新了 1.5 Pro(Gemini 1.0 是在 23 年 12 月)和 Claude 3,在上下文长度、数学、编码、专业领域等能力测评上超过 了 GPT-4,但是考虑到:1)GPT-4 和 4 Turbo 实质上为 23 年 3 月 GPT-4 系列的迭代,比 Gemini 和 Claude 3 早推出近一年;2)ChatGPT 对多模态、App 语音交互、工具调用(联 网、高级数据分析)、智能体(GPTs)等能力进行了有机整合;3)根据 UC 伯克利大学 Chatbot Arena 的榜单(该榜单为用户盲测模型评价的结果,较为客观),GPT-4 的用户体验仍是头 部顶尖水平;4)GPT-5 已在训练中;5)GPT-4o 的端到端能力再次提升。因此,我们认 为,OpenAI 的技术仍处于暂时领先。

Meta 的 Llama 系列作为开源模型,具有格局上的特殊性和分界性。海外模型厂商如果在 模型性能上无法超越同代的开源 Llama 模型(据 Meta 官网 4 月 18 日信息,Llama 3 的 8B 和 70B 先行版小模型已经发布,最大的 400B 参数正在训练),则很难在海外基础模型中占 据一席之地,除非模型具有差异化应用场景,典型的如陪伴类应用 Character.ai。此外,除 了头部大参数模型,能够超过同代 Llama 的较小参数或者有独特使用体验的模型,也会得 到用户青睐,典型的如:1)马斯克旗下 xAI 的 Grok-1(已开源)、Grok-1.5(未开源),能 够独家使用 X 平台上的数据,较好的响应用户实时信息查询需求;2)法国大模型初创公司 Mistral,开源了 Mistral 7B、Mixtral 8x7B-MoE 小模型,适配算力受限的端侧等平台,随后 又转入闭源模型,更新了性能更强的 Mistral-medium 和 large,并与微软合作,在 Azure 上为用户提供 API。

国内模型百花齐放,互联网大厂、初创公司、科技企业均有代表性模型产品。国内模型技 术辨识度不高,据 SuperCLUE 测评结果榜单,头部的国内模型在得分上相差并不显著。在 国内主流的模型中,互联网厂商和科技企业在大模型上起步较早,如百度在 GPT-4 发布的 后一天即 23 年 3 月 15 日发布文心一言,23 年 3 月 29 日 360 智脑 1.0 发布,23 年 4 月通 义千问上线,23 年 5 月 6 日讯飞星火 1.0 发布。进入 24 年,初创公司的大模型产品得到 了更广泛的关注,例如 24 年 3 月月之暗面更新 Kimi 智能助手 200 万字的上下文支持能力, 直接引发了百度、360 等厂商对长上下文的适配。同月阶跃星辰 STEP 模型发布,其 STEP 2 宣称为万亿参数 MoE 模型,直接对标 GPT-4 的参数(一般认为是 1.8 T 参数的 MoE), 在大多数国内模型以千亿参数为主的环境下,将参数量率先提升到万亿级别。4 月,MiniMax 也发布了万亿参数 MoE 架构的 abab 6.5。

2.特点#1:大模型与小模型同步发展

根据 Scaling Law,更大参数、更多数据和更多算力能够得到更好的模型智能。2020 年 1 月,OpenAI 发布论文《Scaling Laws for Neural Language Models》,奠定了 Scaling Law (缩放定律)的基础,为后续 GPT 的迭代指明了大参数、大算力方向。Scaling Laws 是一 种经验性质的结论,并非完备的数学理论推导。OpenAI 在 decoder-only Transformer 架构 的特定配置下进行了详尽的实验,摸清了模型性能(用模型 Loss 衡量,Loss 越小性能越 好)与参数(N)、数据集 token(D)和投入训练算力(C)的关系——N、D、C 是影响 Loss 最显著的因素,三者增加将带来更好的模型性能。Transformer 架构中的层数、向量 宽度等其它参数并不构成主要影响因素。

根据 Scaling Law 论文,可以用 6ND 来估算模型所需要的训练算力(以 FLOPs 为单位)。 Transformer 架构涉及了多种参数,包括层数(nlayer)、残差流维数(dmodel)、前馈层维数 (dff)、注意力机制输出维数(dattn)、每层注意力头数(nhead)、输入上下文 token 数(nctx) 等。在训练数据进入 Transformer 解码器后,每一步运算都会涉及相应的参数,并对应有需 求的算力。据 OpenAI 测算,单个 token 训练时在 Transformer 解码器中正向传播,所需 FLOPs(每秒浮点运算数)为 2N+2nlayernctxdattn。由于在论文写作于 2020 年,当时模型上 下文长度 nctx并不长,满足 dmodel> nctx/12,因此 2N+2nlayernctxdattn可约等于 2N。在训练中 反向传播时,所需算力约为正向的 2 倍(即 4N),因此单个 token 训练全过程需要算力总 共 6N FLOPs,考虑全部的训练 token 数 D,共需算力近似 6ND FLOPs。在推理时,为了 计算方便,通常采用正向训练算力需求 2ND 来计算所需 FLOPs。 值得注意的是,目前 Claude 3、Gemini 1.5 Pro、Kimi 智能助手等大模型支持的上下文 长度远超当年,dmodel > nctx/12 不再满足,因此 2nlayernctxdattn 应予以考虑。即上下文长度 更长时,训练需求的算力是高于 6ND 的。

在 Scaling Law 指导下,OpenAI 延续了大参数模型的路线。2020 年 1 月 Scaling Laws 论文发表后不久,2020 年 5 月 GPT-3 系列问世,将参数从 GPT-2 的 15 亿提升到 1750 亿, 训练数据大小从 40G 提升到 570G(数据处理后,处理前数据量更大),分别提升了 100+ 倍和 14 倍。到了 GPT-4,虽然 OpenAI 官方未公布参数大小,但是根据 SemiAnalysis 的 信息,目前业界基本默认了 GPT-4 是 1.8 万亿参数的 MoE 模型,训练数据集包含约 13 万 亿个 token,使用了约 25,000 个 A100 GPU,训练了 90 到 100 天,参数量、数据集和训 练所需算力相比 GPT-3 又有数量级的提升。OpenAI 在不断践行 Scaling Law,将模型的参 数以及模型的智能提升到新的层级。

从 Google 和 Anthropic 的模型布局看,印证了大参数能带来模型性能的提升。Google 的 Gemini 和 Anthropic 的 Claude 3 系列均分别提供了“大中小”三款模型,虽然两家厂商并 未给出模型参数、训练数据细节,但是均表示更大的模型智能更强, 推理速度相对较慢,所需的算力和训练数据也相应更多,是对 Scaling Law 的印证。此外, 我们梳理了全球主流模型厂商的参数情况,同样发现旗舰模型的参数量仍在变大。

我们认为,全球头部闭源模型的参数目前呈现的规律是:跨代际更新,模型参数进一步加 大;同代际更新,随着模型技术架构优化和软硬件资源协同能力提高,在模型性性能不降 的情况下,参数或做的更小。Google 和 OpenAI 的最新模型都呈现了这个趋势。24 年 5 月 13 日,OpenAI 发布了 GPT-4o 模型,在多模态端到端的架构基础上,实现了更快的推 理速度,以及相比于 GPT-4 Turbo 50%的成本下降,我们推测其模型参数或在下降。5 月 14 日 Google 发布了 Gemini 1.5 Flash,官方明确指出 Flash 是在 Pro 的基础上,通过在线 蒸馏的方式得到,即 Flash 的参数小于 Pro。

大参数并不是唯一选择,小参数模型更好适配了终端算力受限的场景。Google 的 Gemini 系列是典型代表,其最小的 Nano 包括 1.8B 和 3.25B 两个版本,并且已经在其 Pixel 8 Pro 和三星 Galaxy S24 上实现部署,取得了不错的终端 AI 效果。此外,Google 在 24 年 2 月 开源了轻量级、高性能 Gemma(2B 和 7B 两种参数版本),与 Gemini 模型技术同源,支 持商用。Google 指出,预训练和指令调整的 Gemma 模型可以在笔记本电脑、工作站、物 联网、移动设备或 Google Cloud 上运行。微软同样在 23 年 11 月的 Ignite 大会上提出了 SLM(小语言模型)路线,并将旗下的 Phi 模型升级到 Phi-2,参数大小仅 2.7B,性能超过 7B 参数的 Llama 2。24 年 4 月 Phi-3 发布,最小参数仅 3.8B,其性能超过参数量大其两倍 的模型,5 月微软 Build 大会上,Phi-3 系列参数为 7B 和 14B 的模型发布。

Mistral发布的 7B和 8x7B 模型也是开源小模型的典型代表。法国人工智能初创公司 Mistral AI 成立于 2023 年 5 月,其高管来自 DeepMind、Facebook 等核心 AI 团队。2023 年 9 月 和 12 月,Mistral 分别开源了 Mistral-7B(73 亿参数)和 Mixtral-8x7B-MoE(467 亿参数, 8 个 专 家 )。 Mistral-7B 在多项测试基准中优于 130 亿 参 数 的 Llama 2-13B 。 Mixtral-8x7B-MoE 在大多数测试基准上超过 Llama 2,且推理速度提高了 6 倍;与 GPT-3.5 相比,也能在多项测评基准上达到或超过 GPT-3.5 水平。在小参数开源模型中,Mistral 的 竞争力很强。Mistral 推出的平台服务 La plateforme 也支持模型的 API 调用。

小参数模型的训练算力需求仍在变大,定性看,训推算力需求空间可观。虽然模型参数较 小,但是为了提高性能,模型厂商均投入了大量的训练数据。如Phi-2有1.4T训练数据tokens, Phi-3 为 3.3T tokens,Gemma 为 6T/2T tokens(分别对应 7B 和 2B 模型)。24 年 4 月 Meta 率先开源的两个 Llama 3 系列小模型 8B 和 70B,对应的训练 token 已经达到了 15T,并且 Meta 表示,即使已经使用了 15T 的训练数据,仍能看到模型性能的持续提升。我们认为, 虽然单个小模型相比于大模型训练算力需求并不大,但是一方面小模型本身的训练数据集 在不断增加,另一方面,未来在终端 AI PC 和手机,甚至车机和机器人上,都有可能部署 终端模型,因此定性看,小模型总体的训练和推理算力需求仍然可观。

特点#2:原生多模态逐步成为头部大模型的标配能力

OpenAI 的 GPT 系列在全球闭源大语言模型厂商中率先适配多模态能力。抛开专门的多模 态模型/产品,如文生图 Stable Diffusion / Midjourney / DALL-E,文生视频 Sora / Runway / Pika / Stable Video Diffusion 外,在头部闭源 LLM 中,OpenAI 的 GPT-4 最先引入多模态 能力。23 年 3 月,GPT-4 技术报告中即展示了 GPT-4 支持文本和图像两种模态作为输入。 9 月 25 日,OpenAI 官方 Blog 宣布 GPT-4 的 Vision(视觉)能力上线,支持多图和文本的 交错推理,同时宣布 ChatGPT App 支持语音交互(语音转文本模型为 Whisper,文本转语 音模型为 Voice Engine)。23 年 10 月 19 日,OpenAI 旗下新一代文生图模型 DALL-E 3 在 ChatGPT 中实装上线,可以通过与 ChatGPT 对话来实现文生图。

通过模型间非端到端协作,ChatGPT 网页端和 App 实现了完备的多模态能力支持。随着 OpenAI 的 GPT-4V、DALL-E 3、Whisper、Voice Engine 等模型的上线和更新,OpenAI 将所有的模型协同集成成 pipeline 形式,使得 ChatGPT 能够实现:1)推理文本;2)理解 图像;3)生成图像;4)语音转文本;5)文本转语音。ChatGPT 成为 2023 年支持模态最 多的 LLM 产品。

Google 从 PaLM 模型开始即在探索 LLM 向多模态领域的拓展。PaLM 是 Google Gemini 的前一代主要模型系列。2022 年 4 月,Google 的 PaLM 模型问世。PaLM 自身为大语言 模型,仅支持文本模态,但是在 PaLM 的能力之上,Google 将图像、机器人具身数据转化 为文本 token 形式,训练出多模态模型 PaLM-E。此外,还将音频模态与 PaLM 模型结合, 发布 AudioPaLM。在医疗领域,Google 先基于 PaLM 训练出医疗语言模型 Med-PaLM, 随后在 Med-PaLM 基础上将医疗图像知识增加到训练数据中,训练出医疗领域多模态模型 Med-PaLM M。

Gemini 模型问世后,端到端原生多模态能力成为头部模型厂商的“标配”能力。2023 年 5 月的 I/O 大会上,Google 宣布了下一代模型 Gemini,但未透露细节。12 月,Gemini 1.0 模型发布,配备了 Ultra/Pro/Nano 三种参数大小依次递减的型号。Gemini 同样支持文本、 图像、视频、音频等多模态,但是其范式和 OpenAI 的 ChatGPT 有很大区别:ChatGPT 属于多种不同模型的集合,每个模型负责不同的模态,结果可以串联;而 Gemini 具备端 到端的原生多模态能力,Gemini 模型自身可以处理全部支持的模态。据 The Decoder 信 息,23 年 OpenAI 内部已经在考虑一种代号为“Gobi”的新模型,该模型同样从一开始就 被设计为原生多模态。我们认为,这种端到端的原生多模态范式将成为未来头部大模型厂 商实现多模态的主流范式。

Anthropic Claude 模型多模态能力“虽迟但到”,Claude 3 模型科研能力优异。Anthropic 的 Claude 系列模型在 2024 年 3 月更新到 Gen 3 后,全系适配了多模态图像识别能力,并 在科学图表识别上大幅超越 GPT-4 和 Gemini 1.0 Ultra。此外,Claude 3 Haiku 有着优秀 的成本控制和推理速度优势,据 Anthropic 官方,Haiku 的速度是同类产品的三倍,能够在 一秒内处理约 30 页的内容(21K token),使企业能够快速分析大量文档,例如季度备案、 合同或法律案件,且一美元就能分析 400 个最高法院案例或 2500 张图片。

GPT-4o 在 GPT-5 发布之前实现了端到端的多模态支持,验证了原生多模态的技术趋势。 24 年 5 月 14 日 Google I/O 大会前夕,OpenAI 发布了新版模型 GPT-4o(omni),弃用了 之前 ChatGPT 拼接 GPT-4V、Whisper、DALL-E 的非端到端模式,统一了文本、图像、音 频和视频模态,以端到端的方式,实现了输入文本、图像、音频和视频,输出文本、图像 和音频,追上了 Google Gemini 的原生多模态进度,并且模态支持更加全面(4o 支持音频 输出,Gemini 不支持)。4o 在文本、图像、音频等各项指标上均超越了同等级现有模型。

Claude 3.5 Sonnet增强了UI交互体验,与GPT-4o的语音交互相比朝着差异化路径发展。 6 月 21 日,Anthropic 宣布了 Claude 3.5 Sonnet 模型,在价格相比于 Claude 3 Sonnet 不 变的情况下,在研究生水平推理、代码等能力(文本层面),以及视觉数学推理、图表问答 等能力(视觉层面)上超过了 GPT-4o。Claude 3.5 Sonnet 另一个突出的性能是 UI 交互能 力的增强,主要由 Artifacts 功能实现。当用户要求 Claude 生成代码片段、文本文档或网站 设计等内容时,对话旁边的专用窗口中将实时出现相应的展示,例如编写的游戏、网页等。 Anthropic 指出,Artifacts 交互方式未来将会从个人拓展到团队和整个组织协作,将知识、 文档和正在进行的工作集中在一个共享空间中。我们认为,GPT-4o 和 Claude 3.5 Sonnet 均在优化用户交互上下功夫,但是两者的方向存在差异化,GPT-4o 更注重语音交互,而 Sonnet 更注重 UI 界面交互。

国内模型厂商积极适配多模态,以图像理解能力为主。在 GPT-4 宣布支持多模态后,国内 厂商也积极适配多模态图片的识别、理解和推理。截至 2024 年 4 月,国产主流模型多模态 支持情况如下:1)百度文心一言,说图解画支持单张图像推理,支持图像生成。2)阿里 通义千问,支持单张图片推理,支持图像生成。阿里开源的模型 Qwen-VL 支持图像推理。 3)腾讯混元助手,支持图像生成,以及单张图像推理。3)讯飞星火,支持单张图像推理, 支持图像生成。4)智谱 ChatGLM 4,支持单张图像推理,支持图像生成。5)360 智脑, 支持图像生成。6)字节豆包,支持图像生成。7)Kimi 智能助手,支持图片中的文字识别。 月之暗面官方表示 24 年下半年将支持多模态推理。8)阶跃星辰基于 Step 模型的助手跃问, 支持多图推理。

特点#3:上下文作为 LLM 的内存,是实现模型通用化的关键

国外 LLM 厂商较早实现长上下文,国内厂商通过长上下文找到差异化竞争优势。国外较早 实现长上下文的厂商是 Anthropic,旗下 Claude 模型在 23 年 11 月,将支持的上下文从 100K tokens 提升到 200K,同时期的 GPT-4 维持在 128K。24 年 2 月,Google 更新 Gemini 到 1.5 Pro 版本,将上下文长度扩展到 1M(5 月更新中扩展到 2M),并在内部实现了 10M, 是目前已知最大上下文长度。国内方面,23 年 10 月由月之暗面发布的 Kimi 智能助手(原 名 Kimi Chat),率先提供 20 万字的长上下文,并在 24 年迎来了用户访问量的大幅提升。 24 年 3 月,阿里通义千问和 Kimi 先后宣布支持 1000 万字和 200 万字上下文,引发国内百 度文心一言、360 智脑等厂商纷纷跟进长上下文能力迭代。我们认为,国内 LLM 厂商以长 上下文为契机,寻找到了细分领域差异化的竞争路线,或有助于指导后续的模型迭代。

长上下文使得模型更加通用化。据月之暗面官方信息,长上下文能够解决 90%的模型微调 定制问题。对于短上下文模型,在执行具体的下游任务前,其已具备的能力往往仍有欠缺, 需要针对下游任务进行微调。微调的基本步骤包括数据集的准备、微调训练等,中间可能 还涉及微调结果不理想,需要重新梳理微调过程。而上下文长度足够的情况下,可以将数 据作为提示词的一部分,直接用自然语言输入给大模型,让模型从上下文中学习,达到微 调效果,使得模型本身更具有通用性。以 Google Gemini 1.5 Pro 为例,将 250K token 的 Kalamang 语(全球使用人数小于 200 人,几乎不存在于 LLM 的训练集中)直接作为上下 文输入给模型,实现了接近人类的翻译水平。而 GPT-4 和 Claude 2.1 由于上下文支持长度 不够,无法通过上下文学习到全部的知识。

长上下文还能很好的适配虚拟角色、开发者、AI Agent、垂类场景等需求。1)虚拟角色 Chatbot:长文本能力帮助虚拟角色记住更多的重要用户信息,提高使用体验。2)开发者: 基于大模型开发剧本杀等游戏或应用时,需要将数万字甚至超过十万字的剧情设定以及游 戏规则作为 prompt 输入,对长上下文能力有着刚性需求。3)AI Agent:Agent 智能体运 行需要自主进行多轮规划和决策,且每步行动都可能需要参考历史记忆信息才能完成。因 此,短上下文会导致长流程中的信息遗忘,长上下文是 Agent 效果的重要保障。4)垂直场 景客户需求:对于律师、分析师、咨询师等专业用户群体,有较多长文本内容分析需求, 模型长上下文能力是关键。

实现长上下文有多种方法,优化 Transformer 架构模块是核心。拆解 Transformer 解码器, 可以通过改进架构中的各个模块来实现上下文长度的拓展。1)高效注意力机制:高效的注 意力机制能够降低计算成本,甚至实现线性时间复杂度。这样在训练时就可以实现更长的 序列长度,相应的推理序列长度也会更长。2)实现长期记忆:设计显式记忆机制,如给予 外部存储,解决上下文记忆的局限性。3)改进位置编码 PE:对现有的位置编码 PE 进行 改进,实现上下文外推。4)对上下文进行处理:用额外的上下文预/后处理,在已有的 LLM (视为黑盒)上改进,确保每次调用中给 LLM 的输入始终满足最大长度要求。5)其他方 法:以更广泛的视角来增强 LLM 的有效上下文窗口,或优化使用现成 LLM 时的效率,例如 MoE(混合专家)、特殊的优化目标函数、并行策略、权重压缩等。

RAG 与其他长文本实现方法相比,并没有显著的优劣之分,要结合场景进行选择。RAG 基本原理是,在用户提问时,retriever(检索器)会从外部的知识库中检索最相关的信息传 递给大模型,作为大模型推理所需知识的补充。RAG 更像是大模型本身的“外挂”帮手。 而优化注意力机制等其他长上下文实现方法,则是大模型的“内生”能力,是模型本身能 够支持输入更长的信息,并通过注意力机制掌握序列全局关系。“内生”似乎比“外挂”更 高级,因为模型会捕捉到用户提出的所有历史信息,更适用于 C 端信息量有限场景。但是 对于 B 端用户,其企业 Know-How 积累量巨大,且很多知识也是结构化的 QA(如客服), 而模型上下文长度不可能无限延长(受制于算法、算力、推理时间等各种因素),因此 RAG 这种“外挂”的形式更加适合。例如,主要面向 B 端的大模型厂商 Cohere,将 RAG 作为 模型重要能力以适配 B 端检索场景,其 Command R+模型本身上下文长度仅 128K。 我们认为,“内生”长文本技术是从根本上解决问题,是发展趋势,但是受制于算力等因素 (未来或将逐步解决),短期内将与 RAG 共存,选择上取决于使用场景。

特点#4:MoE 是模型从千亿到万亿参数的关键架构

MoE 架构有利于预训练和推理效率的提升,方便模型 scale up 到更大的参数。据 Hugging Face 信息,在有限的计算资源预算下,用更少的训练步数训练一个更大的模型,往往比用 更多的步数训练一个较小的模型效果更佳。MoE 的一个显著优势是它们能够在远少于稠密 模型所需的计算资源下进行有效的预训练,当计算资源有限时,MoE 可以显著扩大模型或 数据集的规模,更快地达到稠密模型相同的质量水平。MoE 的引入使得训练具有数千亿甚 至万亿参数的模型成为可能。MoE 特点在于:1)与稠密模型相比,预训练速度更快;2) 与具有相同参数数量的模型相比,具有更快的推理速度(因为只需要调用部分参数);3) 需要大量显存,因为所有专家系统都需要加载到内存中,而 MoE 架构的模型参数可达到上 万亿;4)MoE 进行指令调优具有很大的潜力,方便做 Chatbot 类应用。

MoE 由稀疏 MoE 层和门控网络/路由组成。MoE 模型仍然基于 Transformer 架构,组成部 分包括:1)稀疏 MoE 层:这些层代替了传统 Transformer 模型中的稠密前馈网络层,包 含若干“专家”(例如 8、16、32 个),每个专家本身是一个独立的神经网络。这些专家甚 至可以是 MoE 层本身,形成层级式的 MoE 结构。稀疏性体现在模型推理时,并非所有参 数都会在处理每个输入时被激活或使用,而是根据输入的特定特征或需求,只有部分参数 集合被调用和运行。2)门控网络/路由:决定将用户输入的 tokens 发送到哪个具体的专家。 例如下图中,“More”对应的 token 被发送到第二个专家处理,而“Parameters”送到第一 个专家。一个 token 也可以被发送到多个专家进行处理。路由器中的参数需要学习,将与 网络的其他部分一同进行预训练。

专家数量存在边际递减效应,MoE 的选择也要考虑模型的具体应用场景。据 Hugging Face 信息,增加更多专家可以加速模型的运算速度和推理效率,但这一提升随着专家数量的增 加而边际递减,尤其是当专家数量达到 256 或 512 之后更为明显。另外,虽然推理时只需 要激活部分参数,但是推理前仍然需要将全量的模型参数加载到显存中。据 Switch Transformers 的研究结果,以上特性在小规模 MoE 模型下也同样适用。在架构的选择上, MoE 适用于拥有多台机器(分布式)且要求高吞吐量的场景,在固定的预训练计算资源下, 稀疏模型往往能够实现更优的效果。在显存较少且吞吐量要求不高的场景,传统的稠密模 型则是更合适的选择。

Google 是 MoE 架构的早期探索者之一,OpenAI 实现了 MoE 的商业化落地。MoE 的理 念起源于 1991 年的论文《Adaptive Mixture of Local Experts》。在 ChatGPT 问世之前, Google 已经有了较深入的 MoE 研究,典型代表是 20 年的 Gshard 和 21 年的开源 1.6 万亿 Switch-Transformer 模型。23 年 3 月 GPT-4 问世,OpenAI 继续走了闭源路线,没有公布 模型参数。但是据 SemiAnalysis 信息,GPT-4 的参数约 1.8 万亿,采用 MoE 架构,专家 数为 16,每次推理调用两个专家,生成 1 个 token 约激活 2800 亿参数(GPT-3 为 1750 亿参数),消耗 560 TFLOPs 算力。在 GTC 2024 演讲上,黄仁勋展示了 GB200 训练 GPT 模型示意图,给出的参数也是 GPT-MoE-1.8T,交叉印证。

Mistral 引发 MoE 关注,Google 掀起 MoE 浪潮,国内厂商跟随发布 MoE 模型。23 年 12 月,Mistral 开源 Mixtral-8x7B-MoE,以近 47 亿的参数在多项测评基准上达到或超过 1750 亿参数的 GPT-3.5 水平,引发了全球开发者对 MoE 架构的再次关注。英伟达的研究主管 Jim Fan 指出 MoE 将成为未来模型发展的重要趋势。24 年 2 月,Google 将其最先进模型 系列 Gemini 更新到 1.5 Pro,并指出架构上从稠密架构切换到 MoE 架构,实现了 1.5 Pro 模型性能的大幅提升,核心能力超过 Gemini 1.0 Ultra。国内外模型厂商随即跟进发布 MoE 相关模型,包括 xAI 开源的 Grok-1(23 年 10 月已实现 MoE,24 年开源)、MiniMax abab6、 Databricks DBRX、AI21 Jamba、阿里 Qwen-1.5 MoE、昆仑万维天工 3.0、阶跃星辰 STEP 2、商汤日日新 5.0 等。

参考报告REPORT

计算机行业深度研究: 全球大模型将往何处去?.pdf

计算机行业深度研究:全球大模型将往何处去?大模型头部格局基本确定,AIAgent将加速AGI进程。我们认为,海外闭源大模型已经形成OpenAI为首,Google、Anthropic等紧随的格局。在头部闭源模型之下,Meta引领开源模型生态,开源闭源模型差距逐步缩小。为了适配端侧需求,小参数模型也在快速发展。国内看,模型百花齐放,但技术辨识度不高,23年头部互联网厂商和科技企业进展较快,24年以来初创公司开始发力长文本、MoE等领域。展望后续,ScalingLaw+Transformer仍将长期有效,合成数据或逐渐成为关键数据来源。此外,AIAgent能够极大提高现有模型的表现,是实现AGI的重...

我来回答

快速提问

海量报告支持,行业专家解读

海量文库支持,行业专家解答

  • 相关问题
  • 最新问题
用户解答榜
分享至