2025年AI产业深度分析:混合专家(MoE),大语言模型持续进化的核心架构基石
- 来源:国泰海通证券
- 发布时间:2025/06/17
- 浏览次数:633
- 举报
AI产业深度分析:混合专家(MoE),大语言模型持续进化的核心架构基石.pdf
AI产业深度分析:混合专家(MoE),大语言模型持续进化的核心架构基石。MoE不仅是驱动大语言模型(LLM)持续进化的核心架构基石,更在重塑LLM的市场格局,推动AI领域的多元化竞争与开源生态的繁荣。随着LLM的竞争日益转向对更高性能与更大模型规模的追求,其背后急剧增长的算力成本与训练开销已成为行业发展的核心瓶颈。在此背景下,混合专家(MixtureofExperts,MoE)架构已从理论探索走向产业应用的核心,成为解决这一根本矛盾的关键。它通过解耦总参数量与单次推理激活参数量,为业界提供了一条在算力约束下持续扩展模型规模、提升智能水平的决定性路径。MoE技术最早可追溯至1991年Robert...
1. MoE 架构诞生于 1990 年代,其早期探索为当前 LLM 的 爆发奠定了理论与实践基础
混合专家(Mixture of Experts,MoE)架构,作为当今驱动大语言模型(LLM) 持续进化的核心架构基石之一,其思想萌芽和早期探索可以追溯到 1990 年代初。 理解其“前世”,有助于我们更深刻地把握其技术演进的脉络,以及从源头理解为 何它能成为支撑 LLM 庞大参数规模和高效运算的关键。
1.1. MoE 概念的提出旨在通过分而治之应对复杂模型挑战,奠定了条件 计算的理论基石
MoE 概念最早由 Robert Jacobs、Geoffrey Hinton、Michael I. Jordan 和 Stephen Nowlan 等研究者在 1991 年发表的里程碑式论文《Adaptive Mixtures of Local Experts》中正式提出。这篇论文不仅奠定了 MoE 架构的理论基础,也清晰阐述了 其核心思想:构建一个由多个独立的专家网络(Expert Networks)和一个门控网络 (Gating Network)协同工作的系统。这一思想的提出,旨在应对当时单一神经网 络在处理复杂、多模态或多任务场景时面临的性能瓶颈,这与当前 LLM 对模型容 量和知识广度的极致追求不谋而合。 具体而言,每个专家网络被设计为专注于处理输入空间的一个特定子区域,或者 解决一个复杂任务的某个子问题。它们各自学习专门的知识和技能,以期在自己 负责的领域内达到较高的处理精度。而门控网络则扮演着智能调度员的角色,它 学习分析输入数据的特征,并根据这些特征动态地决定将当前的输入样本分配给 哪一个或哪些专家进行处理。这种分配可以是硬性的(即选择一个最优专家),也 可以是软性的(即给多个专家分配不同的权重,最终结果是这些专家输出的加权 组合)。
这一架构设计的初衷,是借鉴了集成学习(Ensemble Learning)中“三个臭皮匠顶 个诸葛亮”的思想,以及模块化系统中分而治之的策略。当时,研究者们已经意 识到,单一的、整体式的神经网络在面对具有多种潜在模式、或者需要在不同输 入区域采用不同处理逻辑的复杂任务时,往往会遭遇学习效率低下、泛化能力不 足以及不同任务学习间的干扰效应等瓶颈。MoE 的提出,正是为了克服这些局限 性,这为日后 LLM 需要整合并高效处理海量异构信息提供了早期的理论雏形。通 过让不同的专家网络在各自擅长的局部数据区域内进行深度学习,同时由门控网 络进行全局的、智能化的任务分配与协调,MoE 架构期望能够显著提升整体模型 的性能、灵活性和学习效率。如论文中所述,该架构利用网络间的竞争机制来递 归地切分输入空间,并在每个划分出的区域内学习独立的输入输出映射关系,从 而有效地将复杂问题分解为一系列相对简单的子问题。这种分解与整合的思想, 为 LLM 处理大规模、多样化知识提供了重要的方法。
1.2. 提升模型容量与计算效率是早期 MoE 的核心动机,前瞻性地契合 了当前 LLM 急速发展的规模化需求
在 MoE 概念提出的初期,其架构设计主要围绕以下几个核心动机与目标展开。 这些动机极具前瞻性,至今仍在驱动着 MoE 技术在 LLM 领域的发展,并成为其 架构基石地位的关键支撑。 首先,提升模型容量与表达能力,满足 LLM 对知识广度的渴求。通过将多个专 家网络组合起来,MoE 模型的总参数量可以得到显著的扩展,远超同期任何单个 专家网络的大模型参数规模。更大的参数量意味着大模型有更好的潜力学习更为 复杂的数据分布和输入输出函数,这正是 LLM 存储和运用海量知识所必需的。其次,通过实现条件计算,提高计算效率,应对 LLM 的算力挑战。尽管 MoE 模 型的 总参数量 可能非常庞大 ,但其核 心优势在于条 件计算( Conditional Computation)的思想。对于每一个具体的输入样本,门控网络仅激活少数(理想 情况下是一或两个)最相关的专家参与计算,而其他大部分专家则保持静默状态。 这意味着,在单次推理或训练迭代中,实际参与运算的参数量(即激活参数量) 远小于大模型的总参数量。这种稀疏激活的特性,使得 MoE 模型能够在拥有巨大 总参数量的同时,保持相对较低的实际运算负荷。这不仅在计算资源相对匮乏的 早期尤为重要,更为重要的是,它为当前 LLM 在有限算力预算下实现万亿级别参 数规模提供了关键的可行路径。 再次,有效处理异构数据和复杂任务,契合 LLM 的多样化应用场景。现实世界 中的数据往往具有高度的异构性,不同部分的数据可能遵循不同的模式或规律。 单一模型很难同时完美拟合所有这些异构部分。MoE 架构通过允许不同专家专门 处理数据的不同子集、不同模态或任务的不同方面,为解决这一问题提供了有效 途径。例如,在 Robert Jacobs 等人最初的语音识别实验中,模型能够让不同专家 对应不同说话者,体现了专家在特定数据子集上的特定能力。这与 LLM 需要理解 和生成多样化内容(文本、代码、多模态信息等)的需求高度一致。 最后,增强模型的模块化与一定程度的可解释性,助力 LLM 的可维护性与过程 理解。专家分工的模式为理解模型行为提供了一种模块化的视角。虽然深度学习 模型通常被视为黑箱,但 MoE 架构中各个专家的不同激活模式和它们各自擅长的 领域,可能为分析 LLM 这一复杂系统的内部推理及决策过程提供更高效的方法。

1.3. 早期发展受限于计算资源与训练难题,但 MoE 发展过程中的关键 里程碑为后续发展指明了方向
MoE 技术在诞生后的最初十年间,虽然未能成为主流,但也取得了一些关键的理 论和应用进展,同时也暴露了其在当时技术背景下的主要挑战。这些早期的积淀 与遇到的瓶颈,都为后续 MoE 技术在 LLM 时代的发展与成熟应用提供了宝贵的 经验和待解决的课题。 早期关键里程碑: 1991 年,MoE 概念的奠基:Robert Jacobs、Geoffrey Hinton、Michael I. Jordan、 Steven Nowlan 等人发表的 Adaptive Mixtures of Local Experts,不仅首次系统地提出了 MoE 的基本框架(专家网络+门控网络),并通过在元音辨别等任务上的 实验,初步验证了其有效性。实验表明,MoE 能够将复杂的辨别任务成功分解为 若干个可以由非常简单的专家网络解决的子任务。这篇论文是 MoE 技术发展的原 点,其分而治之和条件计算的核心思想至今仍是 LLM 中 MoE 架构的基石。 1994 年,分层混合专家 HME 的提出:Michael I. Jordan 和 Robert Jacobs 在后 续工作中进一步发展了 MoE 思想,提出了分层混合专家(HME,Hierarchical Mixtures of Experts)模型。HME 通过构建一个树状的层级结构来组织门控网络 和专家网络。这种递归划分的机制使得 HME 能够对输入空间进行多尺度的建模, 增强了模型处理复杂分层结构数据的能力。这为后来 LLM 通过 MoE 层堆叠处理 不同抽象层次的信息提供了一种早期的结构范例。同时,他们还为 HME 架构开 发了基于期望最大化算法的训练方法,为 MoE 模型的参数学习提供了更成熟的统 计框架。 2000 年代初期,MoE 思想在机器学习领域的拓展:MoE 思想具有一定的普适性, 其应用并未局限于神经网络,同样可应用于其他机器学习方法。在发展初期,研 究者们也尝试将 MoE 的理念应用于其他机器学习方法中,例如支持向量机(SVM, Support Vector Machine)、高斯过程等。这表明 MoE 作为一种模块化和条件计算 的框架,具有跨多种模型范式的潜力,也预示着其最终能在 LLM 这一集大成者身 上发挥重要作用。 2010 年代初,MoE 在深度学习中的早期探索与铺垫:随着 2010 年后深度学习的 再次兴起,研究者开始重新审视 MoE 在更复杂模型中的潜力。Ilya Sutskever 等人 在 2013 年进行的将 MoE 作为深度神经网络组件的尝试,虽然在当时并未立即引 发 MoE 的大规模应用,但他们的工作为后续将 MoE 架构集成到更复杂的深度学 习模型,尤其是最终被大语言模型广泛采用的 Transformer 等架构,进行了有益的 探索,起到了连接早期理论与后续大规模实践的桥梁作用。

早期面临的主要挑战: 计算资源的高度依赖与匮乏:这是早期 MoE 发展最主要的瓶颈。训练和运行一 个包含多个(可能是数十个)专家网络的 MoE 系统,即使每个专家相对简单,其 总体计算需求对于当时的硬件水平而言依然是巨大的负担。有限的 CPU 速度和内 存容量严重制约了 MoE 模型的规模和复杂度,使其难以在更具挑战性的大型实际 问题上得到有效应用。这一瓶颈凸显了硬件发展对于释放 MoE 潜力的极端重要 性,也解释了为何 MoE 的真正潜力直到计算能力足以支撑大规模神经网络(如 LLM)时才得以充分展现。 门控网络的训练与优化难题 :门控网络的性能直接决定了 MoE 系统的成败。如何有效地训练门控网络,使其能够准确地识别输入数据的特征,并将数据路由到 最合适的专家(或专家组合),是一个核心的技术难题。如果门控网络路由不当, 可能会导致某些专家接收到过多的训练样本而过载,而另一些专家则因样本不足 而训练不充分(饿死现象),最终影响整体模型的学习效果和泛化能力。这些路由 和负载不均的问题,至今仍是 MoE LLM 架构设计的核心考量,并催生了如辅助 损失函数、专家容量限制等一系列关键优化技术。 专家特化(Expert Specialization)与负载均衡之间的内在矛盾:MoE 的设计初衷 是鼓励专家网络针对输入空间的不同区域或任务的不同方面发展出各自的特化 能力。所谓特化,指的是模型中的不同专家在结构上形成功能差异,各自偏向于 处理某类特定数据或任务,这种机制在一定程度上与泛化(Generalization)相对, 强调的是局部适应性与效率而非通用性。通过特化,专家能够在其擅长的输入分 布上更精准、更高效地做出响应,从而提高整体模型的表达能力。然而,在实际 训练过程中,往往难以完美地实现所有专家既能充分特化,又能均匀地分担计算 负载。过度强调特化可能导致负载不均,而过度强调负载均衡又可能牺牲部分特 化程度。如何设计有效的学习机制(如损失函数、正则化项)来平衡这两者,是 早期研究者面临的一大挑战。这一根本性的权衡推动了 MoE 路由算法和负载均 衡策略的持续创新,直接影响着 LLM 中专家知识的有效利用和模型的整体性能 提升。
理论分析不足:尽管 HME 等工作在统计学习理论方面有所推进,但早期对 MoE 模型的许多理论性质,如其确切的收敛保证、泛化能力的边界、最优专家数量的 确定等,尚缺乏深入和完备的分析。这一定程度上限制了对其行为的预测和更深 层次的优化。随着 MoE 在 LLM 中的规模和复杂性远超早期模型,对其理论性质 的深入理解和分析(例如稀疏激活下的参数有效性、知识冗余问题)变得更加迫 切和重要。 这些早期的里程碑为 MoE 的后续发展奠定了理论基础。而早期所面临的挑战,特 别是计算资源限制和门控网络训练的复杂性,也预示了大规模 MoE 模型仍需持续 攻克的关键技术方向。正是由于这些挑战,MoE 技术在诞生后的较长一段时间内 并未成为人工智能领域的主流范式,其真正的复兴与在 LLM 中的大规模应用,有 待于后续计算能力的巨大飞跃、深度学习理论与实践的成熟,以及稀疏化这一核 心思想在现代神经网络架构中的重新发现与强化。可以说,MoE 的“前世”是在 为成为 LLM 核心架构基石的“今生”积蓄能量、指明方向并揭示了必须克服的障 碍。
2. MoE 架构通过稀疏激活与一系列关键技术,成功支撑 LLM 实现大而轻的高效扩展
经历了早期的理论探索与沉淀,混合专家 MoE 技术在大语言模型(LLM)兴起 的背景下,迎来了其发展的“今生”。当前的 MoE 架构在继承早期核心思想的同 时,针对 LLM 等大规模应用场景进行了诸多关键的技术革新与优化。
2.1. 专家网络与门控网络协同工作,构成了 LLM 存储与高效调用海量 知识的基础
MoE 架构依然围绕两大核心组件构建:专家网络(Experts Network)和门控网络 (Gating Network,亦称路由器 Router)。这两大组件的协同工作,为 LLM 提供了 大规模存储知识并根据输入动态、高效调用相关知识的基础。
专家网络(Experts Network)
在最新的 MoE 实现中,尤其是在 LLM Transformer 架构下,专家网络通常是指一 系列独立的、结构相似(但参数不同)的前馈神经网络(FFN,Feed-Forward Networks)。在 Transformer 模型中,MoE 层往往用于替代标准的、稠密的 FFN 层。 选择替换 FFN 层而非注意力层,主要是因为研究发现 FFN 层在 Transformer 中不 仅占据了显著的参数量(通常约三分之二),更被认为是存储和加工模型在预训练 阶段学到的事实性知识和世界知识的关键场所。因此,将FFN层扩展为多个专家, 天然契合了 LLM 对海量知识容量的需求,使得 LLM 可以通过增加专家数量来大 幅提升其知识存储的上限。例如,Google 的 GLaM 模型,其每个 MoE 层就包含 了多达 64 个 FFN 专家,并且倾向于扩展每个专家的中间隐藏层维度,以增强单 个专家的表达能力,从而支持其 1.2 万亿的总参数规模。 每个专家网络接收由门控网络路由过来的输入(通常是用上一层注意力机制输出 的 token 表示),并独立地对该输入进行非线性变换,生成各自的输出。尽管所有 专家可以拥有相同的网络结构,但它们各自拥有独立的权重参数。这使得在训练 过程中,不同的专家能够学习到不同的知识或技能,从而特化于处理输入数据的 不同方面或应对不同的子任务。对于 LLM 而言,这意味着不同的专家可以分别掌 握不同领域、不同语言或不同类型的知识。
门控网络(Gating Network/Router)
门控网络是 MoE 架构的指挥中心,其核心功能是实现对输入数据的动态、智能路 由,确保 LLM 在面对不同输入时能激活最相关的知识子集。对于 MoE 层接收到 的每一个输入 token,门控网络会计算一个针对所有可用专家的亲和度得分或概率 分布。这些得分反映了每个专家处理当 token 的适宜性或重要性。 门控网络本身通常也是一个可学习的神经网络,例如一个简单的线性层,其输入 是 token 的表征,输出是对应每个专家的 logits(即未归一化的得分,通常是模型 最后一个全连接层的输出)。这些 logits 随后会通过一个选择机制(如 Softmax 函 数结合 Top-k 选择)转换成最终的路由决策和权重。门控网络的参数与专家网络 的参数一同通过端到端的方式进行训练,目标是学习到一种最优的路由策略,使 得整个 MoE 系统(即 MoE LLM)能够在特定任务上表现最佳。
信息流(Information Flow)
典型的 MoE 层信息处理流程如下: 1) 输入 token(例如来自 Transformer 块中自注意力层的输出)进入 MoE 层; 2) 该 token 的表征被送入门控网络; 3) 门控网络为池中的每一个专家计算一个路由分数(logit); 4) 基于这些路由分数和一个预设的路由算法(例如 Top-k 选择),门控网络会选 择一个或少数几个专家被激活; 5) 原始 token 的表征被发送给这些被选中的专家; 6) 每个被选中的专家独立地处理该 token,并产生各自的输出;
2.2. 稀疏激活、智能路由与负载均衡是 MoE 的核心技术,共同奠定了 LLM 性能提升的基石
MoE 架构之所以能够成功应用,并成为支撑 LLM 发展的关键技术,依赖于一系 列核心技术的支持。这些技术共同保障了 MoE LLM 在大幅扩展参数规模以承载 更多知识的同时,依然能够保持高效的计算性能、稳定的训练过程和良好的泛化 能力。
2.2.1. 稀疏激活(Sparse Activation)使得 LLM 能够突破参数与算力的增长瓶颈
稀疏激活是 MoE 模型区别于传统稠密模型的核心特征,也是其能够支撑 LLM 发 展的根本原因之一。其本质在于,对于任何给定的输入样本(例如,LLM 处理的 一个 token),模型中只有一小部分参数(即被门控网络选中的少数几个专家的参 数)会被激活并参与到实际的计算过程中,而模型中的绝大多数参数则保持非激 活状态。 这一机制带来了显著的计算优势,使得 LLM 的总参数量可以扩展到数千亿甚至 万亿级别(如 Switch Transformer 的 1.6 万亿参数和 GLaM 的 1.2 万亿参数),从 而极大地提升模型的潜在容量和学习复杂模式的能力。然而,由于在每次前向传 播中实际执行的浮点运算次数(FLOPs)仅与被激活的专家数量相关,因此其计算 成本可以控制在与一个规模小得多的稠密模型相当的水平。例如,GLaM 在推理 时仅激活约 8%(970 亿)的参数。这种用更少的计算撬动更大模型的能力,对于 在有限算力预算下训练和部署超大规模 AI 模型至关重要。稀疏激活的实现完全 依赖于门控网络的路由决策,Noam Shazeer 等人提出的稀疏门控混合专家 (Sparsely-Gated Mixture-of-Experts)思想,为后续大规模 MoE LLM 的发展奠定 了坚实基础。
2.2.2. 路由算法 (Routing Algorithms)作为 LLM 的智能调度系统,精准调度知识库
路由算法是门控网络用于选择专家的具体策略,它直接决定了信息如何在 MoE 层 中流动,对 LLM 的性能和效率有着至关重要的影响,堪称 LLM 内部知识库的智 能调度系统。 1) Top-k 路由(Top-k Routing):目前 MoE LLM 中最为广泛的路由策略之一。 其工作方式是:门控网络首先为输入 token 计算其与所有 N 个可用专家的亲 和度得分(logits),通常通过一个线性层作用于 token 嵌入得到,即?????? = ? ∙ ??,其中 x 是 token 嵌入(Embedding),??是可学习的门控权重矩阵。然 后,从这些 logits 中选出得分最高的?个专家。?值通常是一个远小于?的小整 数,例如 1 或 2,这直接决定了 LLM 在处理每个 token 时激活知识子集的稀 疏度。例如,Google 的 GShard 和 GLaM 均采用了 Top-2 门控,而 Switch Transformer 则开创性地采用了更为极致的 Top-1 门控。在 Top-1 门控中,每 个 token 仅被路由到一个专家进行处理。令人意外的是,这种简化不仅没有牺 牲模型质量,反而因为降低了路由计算的复杂度并使得每个专家的批处理大 小(即专家容量)可以减半,从而提升了计算效率和训练稳定性。被选中的? 个专家的 logits 会经过 Softmax 函数归一化,得到它们各自的门控权重?(?)?, 用于后续加权组合专家输出。这种设计不仅清晰定义了 LLM 内部信息流的路 径选择和权重分配,也在实现专家知识的有效特化处理和控制整体计算复杂 度之间取得了良好平衡,从而使 LLM 能够高效地处理大规模 token 序列。

2) 带噪声的 Top-k 路由(Noisy Top-k Gating):为了改善负载均衡和促进训练过 程中避免门控网络过早收敛到只选择少数几个专家,Noam Shazeer 等人引入 了在计算 logits 后、进行 Top-k 选择前加入高斯噪声的机制。噪声的引入使得 路由决策具有一定的随机性,有助于让更多的专家在训练初期得到学习机会。 其公式可以表示为:?(?)? = (? ∙ ??) + ??????????????() ∙ ????????((? ∙ ??????)? ),此处??????????????生成一个标准正态分布的随机变量,乘以 Softplus 保证噪声幅度为正,然后对?(?)进行 Top-k 选择和 Softmax。这种随 机扰动对于激活 LLM 中更多沉睡的专家、提升模型整体知识的丰富性和鲁棒 性具有积极作用。
3) 专家选择路由(Expert Choice Routing):与 Top-k 路由中 token 选择专家的 模式不同,专家选择路由反其道而行之,让专家选择 token。在该机制下,每 个专家会从当前批次的所有 token 中选择固定数量(即专家容量)的、其认为 最适合自己处理的 token。这种方式的一个主要优点是能够天然地实现完美的 负载均衡,因为每个专家处理的 token 数量是预先固定的,这对于优化大规模 LLM 训练的计算资源分配、保证所有专家得到均等训练机会具有直接优势。 然而,该机制也可能导致某些 token 被多个专家选中,或者某些 token 不被任 何专家选中,此时需要额外的处理机制,如将这些 token 直接传递到下一层以 避免这些问题。
4) 其他高级路由算法:随着 MoE 研究的深入,学术界和产业界也在不断探索更 先进的路由策略,旨在为 LLM 实现更高效、更健壮、更智能的 token 与专家 之间的匹配机制。例如基于相似度的路由、层级循环路由、非可训练路由(如 哈希路由)以及旨在改善训练稳定性的软性门控(Soft Gating)等。这些探索 反映了业界对于最大化 MoE LLM 性能与效率的不懈追求。
2.2.3. 负载均衡(Load Balancing)策略是确保 LLM 所有智囊有效运作的关键
负载均衡是确保 MoE LLM 模型训练成功和高效运行的关键环节。其目标是使得 在训练过程中,LLM 中所有专家都能接收到数量大致均等的训练样本,并承担相 近的计算负荷。如果缺乏有效的负载均衡机制,门控网络可能会导致路由崩溃, 使得 MoE LLM 退化为少数几个专家主导的系统,严重浪费模型的参数容量,阻 碍 LLM 整体智能的提升。
1) 辅助损失函数(Auxiliary Loss Functions):这是迄今为止最常用且核心的负 载均衡方法,广泛应用于 MoE LLM 的训练中。其思想是在模型的总损失函数 中额外加入一项或多项专门用于惩罚专家负载不均衡的损失项。例如,在早期 的 GShard 模型中,就引入了一个可微的辅助损失函数,通过专家平均门控和 平均门控决策的点积来促进负载均衡。在 Noam Shazeer 等人的早期工作及 GShard 和 GLaM 中,通常会设计两种类型的辅助损失:重要性损失 (Importance Loss),旨在确保所有专家对于整个批次的数据都具有一定的重 要性,通常定义为各专家所获得的门控权重总和的变异系数的平方;以及负载 损失(Load Loss),旨在确保分配给每个专家的 token 数量大致相等,通常定 义为每个专家实际接收到的 token 数量的分布与均匀分布之间的差异。Switch Transformer 则提出了一种简化的辅助负载均衡损失,其形式为:???????? = ? ∙ ? ∙ ∑ ?? ? ?=1 ∙ ??,其中,?是专家总数,??是分配给第?个专家的 token 在批次中 所占的比例,??是门控网络为第?个专家输出的平均概率(在批次所有 token 上 平均),?是一个超参数,用于控制该辅助损失在总损失中的权重。这个损失 函数的目标是使得??和??都趋向于1/?,即实现均匀路由,从而保证 LLM 的每 个专家都得到充分训练,避免知识分布的极端不均。尽管辅助损失被广泛应 用,但其引入也可能带来如梯度冲突、超参数调优复杂等问题。
2) 专家容量(Expert Capacity):这是一种硬性约束机制,即为 LLM 中的每个 专家设定一个在单次处理(例如一个 mini-batch)中所能接收的 token 数量上 限。GShard 就率先引入了专家容量限制来应对负载不均衡问题。如果某个 token被路由到的目标专家(或所有被选中的目标专家)均已达到其容量上限, 那么这个 token 就会被视为溢出。溢出的 token 通常会通过残差连接直接传递 到下一层,而不经过任何专家处理,或者在某些实现中被完全丢弃。专家容量 机制有助于防止 LLM 中少数专家被海量 token 淹没,但其阈值的设定(通常 表示为容量因子 Capacity Factor)也需要权衡:过低的容量因子会导致大量 token 被跳过,影响 LLM 的学习效率;过高的容量因子则可能削弱负载均衡 的效果。合理设置专家容量是平衡 LLM 训练效率与负载均衡效果的重要工程 实践。
3) 带噪声的门控(Noisy Gating):如前所述,在 Top-k 路由的 logits 计算中引入 噪声,可以增加路由的随机性,鼓励 LLM 的门控网络在训练初期探索更多的 专家,从而有助于实现更均匀的负载分布。
4) 无损负载均衡(Loss-Free Load Balancing):近年来,为了克服辅助损失带来 的潜在负面影响,研究者开始探索不依赖显式损失函数的负载均衡方法。例 如,DeepSeek提出的Loss-Free Balancing阐述了一种动态调整专家偏置(bias) 或路由分数的方法。该方法根据每个专家近期的负载情况,在路由决策前对其 原始路由分数进行调整(例如,对负载较重的专家施加负偏置,对负载较轻的 专家施加正偏置),从而在不引入额外损失梯度的情况下引导 token 流向负载 较轻的专家。这种方法旨在将 LLM 的负载均衡控制与主任务的优化解耦,有 望在不牺牲主任务性能的前提下,提升模型训练的稳定性和效率。
2.2.4. 训练策略(Training Strategies)是高效稳定训练 MoE LLM 的必要保障
训练 MoE LLM 相比于训练传统的稠密 LLM,需要考虑更多独特的因素和策略, 以确保模型能够稳定收敛并充分发挥其作为 LLM 核心架构的潜力。 1) 分布式训练与并行策略(Distributed Training and Parallelism Strategies):由 于 MoE LLM 通常参数量巨大,有效的分布式训练和并行策略至关重要。 Google 的 GShard 在早期就探索了专家并行(Expert Parallelism),将 MoE 层 中的每个专家分配到不同的计算设备(TPU 核心),而非 MoE 层则在所有设 备间复制,并通过 XLA 编译器自动分区和并行化处理,这为训练超过单个加 速器内存限制的超大规模 MoE LLM 奠定了基础。Switch Transformer 则基于 Mesh-TensorFlow(MTF)有效地结合了数据并行、模型并行和专家并行策略, 实现了在 TPU Pod 等大规模硬件集群上的高效训练。这些并行策略是支撑 MoE LLM 参数规模持续扩展的核心技术。 2) 端到端联合训练(Joint Training):MoE 模型中的专家网络和门控网络(路由 器)通常是作为一个整体进行端到端联合训练的。这意味着门控网络的路由决 策会影响专家网络的输入数据分布,而专家网络的学习情况又会反过来影响 门控网络如何调整其路由策略。通过统一的损失函数(包含主任务损失和辅助 负载均衡损失等)和反向传播算法,两者的参数得到协同优化。 3) 辅助损失的运用:负载均衡等辅助损失是 MoE LLM 训练策略中不可或缺的 一环,确保 LLM 的所有专家得到充分且均衡的训练。 4) 参数初始化(Initialization):MoE LLM 的参数初始化对于训练的稳定性和收 敛速度至关重要。一些研究表明,MoE 模型(特别是其专家网络或门控网络) 可能需要比稠密模型更小规模的初始化权重。例如,Switch Transformer 的研 究者发现,将标准 Transformer 初始化尺度因子缩减 10 倍,有助于提高训练 稳定性并改善模型质量,减少不同训练运行之间的方差。这对于动辄万亿参数 的 LLM 而言,是保证训练顺利启动和稳定进行的重要技巧。 5) 训练精度(Precision):在大规模 LLM 训练中,为了提高计算效率和减少内 存占用,通常会采用较低的数值精度,如 bfloat16。然而,MoE 模型由于其稀 疏激活和硬性路由决策的特性,在低精度训练下有时会面临稳定性问题。一种 有效的应对策略是采用选择性精度训练(Selective Precision Training)。例如, 在 Switch Transformer 中,路由器的输入 token 表征在进入路由器函数内部计 算时被临时转换为 float32 精度,以保证路由决策的数值稳定性,而路由器的 输出(如分发和组合张量)在传递给专家或进行通信前则被转换回 bfloat16 精 度。这种局部高精度处理能够在很大程度上保持 LLM 在 bfloat16 精度下训练 的效率优势,同时显著提升训练的稳定性。6) 专家 Dropout(Expert Dropout):对于参数总量巨大的稀疏 MoE LLM,在对 下游任务进行微调时,可能会比 FLOPs 匹配的稠密模型更容易出现过拟合。 为了缓解这一问题,Switch Transformer 的研究者提出了一种专家 Dropout 策 略。具体做法是,在微调阶段,对非专家层的参数(如自注意力层)使用标准 的较低 Dropout 率(例如 0.1),而对每个 MoE 层内部的专家网络(通常是 FFN 的中间层)应用一个显著更高的 Dropout 率(例如 0.4)。这种针对 MoE LLM 结构特点的正则化有助于提升模型在下游任务上的泛化能力。 7) 预训练稠密模型的 MoE 转换(Upcycling from Pre-trained Dense Models): 这是一种新兴且受到关注的 MoE LLM 训练(或初始化)策略,旨在利用已有 的、高质量的预训练稠密模型来加速和优化 MoE LLM 的构建过程。其基本思 路是,将一个预训练好的稠密模型的 FFN(前馈网络)层的权重复制多份,作 为 MoE 层中各个初始专家的参数。之后,可以通过一些方法(如对复制的权 重添加少量随机扰动,或在后续的继续预训练/微调阶段让它们独立更新)来 促进这些初始同质的专家逐渐分化,发展出各自的特长。阿里巴巴的 Qwen1.5- MoE-A2.7B 模型就是一个采用此策略的例子。这种方法有望显著减少从零开 始训练大规模 MoE LLM 所需的计算资源和时间,因为它复用了稠密模型已 经为 LLM 学到的通用知识,为构建更强 MoE LLM 提供了高效路径。
2.3. Google 的 GShard、Switch Transformer 和 GLaM 等奠基性实践,率 先验证了 MoE 在超大规模模型上的巨大潜力
前两节深入剖析了 MoE 架构的核心组件与关键技术点。它们的有效性和巨大潜 力,首先通过 Google 研究团队在 2020 至 2021 年间推出的一系列具有开创性的模 型 GShard、Switch Transformer 和 GLaM 得到了实践的集中验证。这些模型可被 视为早期大规模语言模型(LLM)或其前身在 MoE 架构上的成功探索,它们不仅 将 MoE 技术成功应用于拥有数千亿乃至万亿级别参数的神经网络,更在稀疏路 由、负载均衡、分布式训练、能效优化等多个 MoE 核心技术方向上取得了突破性 进展,是连接 MoE 理论与大规模 LLM 应用的关键桥梁。 GShard 通过其创新的专家并行(Expert Parallelism)机制(具体架构如图 11 所示), 并结合 Top-2 门控、专家容量限制和辅助负载均衡损失等设计,成功将多语言神 经机器翻译模型扩展至超 6000 亿参数,并在训练效率与模型质量上取得了显著成 果(如图 9 所示)。紧随其后的 Switch Transformer 则通过极致简化的 Top-1 门控 路由和更优化的负载均衡及训练策略(如低精度训练),将模型参数规模推向 1.6 万亿,并实现了远超同等稠密模型的预训练速度。而 GLaM 以其 1.2 万亿参数的 规模,在展现与 GPT-3 相媲美性能的同时,大幅降低了训练能耗和推理计算量, 有力证明了 MoE 架构在构建兼具高性能和高效率 LLM 方面的巨大潜力。
这些模型的成功,有力地证明了 MoE 是扩展语言模型等 AI 模型规模、提升性能 同时兼顾计算可行性的关键路径。它们为后续 MoE 技术在 LLM 领域的蓬勃发展 和广泛应用奠定了坚实的技术基石,深刻影响了业界对构建超大规模 AI 模型的 认知和实践。图 10 总结了这些具有奠基性贡献的早期 MoE 模型及其核心创新。

这些早期模型的探索与成功,不仅直接推动了 MoE 技术的成熟,更重要的是,它 们向整个 AI 领域展示了通过稀疏化路径构建前所未有规模的智能模型的可能性。 它们验证了 MoE 作为一种核心架构,能够有效平衡 LLM 对巨大模型容量的需求 与有限计算资源之间的矛盾,为当前大语言模型百花齐放的局面打下了实践基础, 其奠基性的贡献不容忽视。
2.4. MoE 模型以更高的参数扩展能力与计算效率,成为 LLM 规模化发 展中优于稠密(Dense)模型的选择
混合专家(MoE)模型和传统的稠密(Dense)模型代表了当前大规模神经网络架 构设计的两种不同范式。 2.4.1. MoE 模型凭借卓越的参数扩展能力与计算效率,在规模化路径上优势显著 1) 卓越的参数扩展能力与模型容量:这是 MoE 模型赋能 LLM 最核心的优势之 一。通过将模型参数分散到众多的专家网络中,MoE 架构能够以远超稠密模 型的规模扩展总参数量,同时保持单次推理或训练迭代中的激活参数量(即实 际参与计算的参数量)相对较小。例如,一个拥有数万亿总参数的 MoE LLM, 其激活参数可能仅为数百亿,与一个中等规模的稠密模型相当。这种总参数巨 大,激活参数可控 的特性,使得LLM有潜力存储和处理远比稠密模型更丰富、更复杂的知识和模式,从而在理论上具备更高的模型容量和更强的学习能力。 2) 更高的计算效率(FLOPs Efficiency):在达到相似性能水平或拥有相似总参 数规模的前提下,由于只有被选中的少数专家参与计算,MoE LLM 通常在每 次前向传播中需要执行的浮点运算次数(FLOPs)显著少于稠密模型。因此, MoE LLM 在预训练阶段可以更快地达到与稠密模型相当的质量,或者在相同 的计算预算下训练出更大、性能更好的 LLM。 3) 潜在的更快推理速度:由于在推理时每个 token 只需激活少数专家,MoE LLM 的推理延迟(即每秒生成的 token 数)往往优于拥有相同总参数量的稠密模型。 这一优势对于 LLM 的实际部署和在线服务非常重要。不过,只有在计算资源 (而非内存带宽或专家之间的通信)是推理的主要瓶颈时,MoE 模型的速度 优势才能充分发挥。如果内存带宽或通信成为瓶颈,这种速度提升就会受到限 制。 4) 专家特化带来的益处:MoE 架构鼓励 LLM 中的不同专家网络学习并特化处 理输入数据的不同方面、不同子任务或不同知识领域。这种分工合作的模式, 使得 LLM 在处理包含多种模式的复杂、异构数据时(例如多语言翻译或多领 域问答)可能表现更佳。
2.4.2. MoE 模型也面临内存开销巨大、训练复杂及通信昂贵等挑战
1) 巨大的内存开销:尽管 MoE LLM 在计算时是稀疏激活的,但在运行时,所有 专家(包括未被激活的专家)的参数都必须完整地加载到计算设备的内存中。 这意味着 MoE LLM 的内存占用量与其总参数规模成正比,这对硬件资源(尤 其是显存容量)提出了极高要求,是其部署面临的挑战之一。 2) 训练不稳定性与复杂性:MoE LLM 的训练过程通常比稠密模型更为复杂和不 稳定。这主要源于路由决策的离散性可能导致训练梯度的不平滑,以及需要精 巧的负载均衡机制来确保所有专家得到充分训练,避免路由崩溃。同时,其通 常对初始化和学习率等超参数更为敏感。 3) 高昂的通信开销:在分布式训练或推理环境中,如果 LLM 中一个 token 被路 由到的专家分布在不同的计算设备(如不同的 GPU 或 TPU 芯片)上,就需要 进行跨设备的数据传输( All-to-All 通信)。随着专家数量和设备数量的增加,这种通信开销会变得非常显著,甚至可能成为整个系统的性能瓶颈。 4) 实现与优化的复杂性:相比于结构相对简单的稠密模型,MoE 架构在实现、 调试和性能优化方面都更为复杂。开发者需要处理专家并行、路由逻辑、负载 均衡、通信同步等一系列额外的问题。 5) 微调的挑战:历史上,预训练好的 MoE LLM 在针对特定下游任务进行微调 时,往往比稠密模型更容易出现过拟合现象,或者其泛化能力不如预期。如何 有效地将 MoE LLM 的强大预训练能力迁移到各种下游任务,是一个仍在积 极研究的课题。 6) 参数有效性问题:虽然 MoE LLM 的总参数量可以非常大,但这些参数是否都 得到了充分且有效的利用,避免知识冗余,是一个值得探讨的问题 。如果负 载均衡不理想,或者专家之间学习到的知识存在较多冗余,那么 MoE LLM 实 际的参数效率可能并不总是优于一个经过精心训练的、规模与其激活参数相 当的稠密模型。
总结而言,MoE 模型通过稀疏激活机制,为 LLM 在可接受的计算成本下大幅扩 展模型参数容量提供了一条极具吸引力的路径,是 LLM 追求极致性能和处理超 大规模数据集的关键技术。尽管其优势是以更高的内存需求、更复杂的训练过程 和潜在的通信瓶颈为代价,但其为 LLM 带来的收益往往具有战略性和决定性意 义。学术界和产业界正致力于通过改进路由算法、负载均衡策略、训练技巧以及 与硬件协同设计等方式,不断克服 MoE 存在的挑战,以期更充分地释放其作为 LLM 核心架构基石的潜力。如何在实现计算稀疏性的同时,有效管理由总参数量 带来的高昂内存成本,以及如何优化门控/路由机制,是驱动 MoE LLM 相关研究 的关键因素和创新最为活跃的领域。
3. 主流 LLM 厂商纷纷推出创新的 MoE 模型,形成印证其核心 基石地位的实践浪潮
继 Google 通过 GShard、Switch Transformer 及 GLaM 等早期模型成功验证了 MoE 架构在大语言模型(LLM)规模化与高效化方面的巨大潜力后,MoE 技术迅速从 主要由大型科技公司内部研究的范畴,扩展到更广泛的学术界和开源社区,并催 生了一批具有强大影响力的开源及商业 MoE LLM。这些模型不仅在参数规模、性 能表现上屡创新高,更在 MoE 的架构设计、路由机制、专家特化、训练推理效率 优化等方面展现出丰富的创新。它们共同构成了 MoE 技术作为 LLM 核心架构基 石,并驱动其持续进化的生动实践。
3.1. 主流 MoE LLM 的崛起与实践创新提供了高性能与高效率的强大模 型
3.1.1. Mistral AI 的 Mixtral 系列模型(2023)凭借卓越的性能与效率,成功树立了 开源领域 MoE LLM 的首个标杆
Mistral AI 推出的 Mixtral 系列模型,特别是其 Mixtral 8x7B 版本,是近年来开源 MoE LLM 领域的一个现象级产品,它以卓越的性能和高效的架构设计,有力地证 明了 MoE 作为 LLM 核心架构在提升模型能力和促进技术普及方面的巨大价值。 1) MoE 架构特性与 LLM 的参数效率:Mixtral 8x7B 是一款基于 Transformer 的 LLM,其核心架构创新在于采用了稀疏混合专家(SMoE)设计。具体而言, 在每个 Transformer 层的 FFN 部分,Mixtral 8x7B 部署了 8 个独立的专家网络 (每个专家为标准的 FFN/SwiGLU 子块)。对于每一层的每一个输入 token, 一个路由网络会选择 Top-2 专家进行激活和计算,然后将这两个专家的输出 通过 Softmax 后的门控值加权并求和,得到该 MoE 层的最终输出。这种设计 使得 Mixtral 8x7B 虽然拥有约 467 亿的总参数量,但在推理时每个 token 仅激 活约 130 亿参数(约占总参数的 28%)。这充分体现了 MoE 架构的核心优势: 通过稀疏激活,LLM 能够在大幅增加总参数以提升模型容量和知识丰富度的 同时,有效控制实际的计算开销,实现了大模型参数与高效能计算的解耦与共 存。模型训练时的上下文长度为 32k tokens。后续的 Mixtral 8x22B 版本进一 步将总参数扩展至 1410 亿,激活参数约 390 亿,并支持更长的 64k tokens 上 下文。 2) 卓越性能与 LLM 能力验证:Mixtral 8x7B 在众多基准测试中表现出色,其性 能优于或持平 Llama 2 70B 以及 GPT-3.5。特别是在数学、代码生成和多语言 理解等复杂任务上,Mixtral 8x7B 显著超越了 Llama 2 70B。其指令微调版本 Mixtral 8x7B– Instruct 在 MT-Bench 等人工评估基准上也超越了 GPT-3.5 Turbo、 Claude-2.1 等模型,一度成为表现最佳的开源 LLM。此外,Mixtral 在长程上 下文检索任务中也展现了强大的能力。这些优异的性能表现,再次印证了 MoE 架构能够有效支撑 LLM 在多种复杂认知任务上达到 SOTA 水平。 3) 开源影响与 MoE 的普及:Mixtral 8x7B 及其指令微调版本均在 Apache 2.0 许 可下开源,这极大地推动了 MoE 技术在开源 LLM 社区的普及和应用。它的 成功证明了即使是中等规模的团队,也能通过精巧的 MoE 设计,构建出与 AI 巨头旗下大规模稠密 LLM 相媲美甚至超越的模型。这为 AI 领域的竞争格局 带来了新的活力,并凸显了 MoE 架构在提升 LLM 研发效率和推动 AI 技术普 及的重要性。其高效的推理性能(得益于稀疏激活)也使其在实际部署中更具 吸引力。Mixtral 系列采用的 8 选 2 路由机制和高效的显存利用策略,被社区 广泛采纳,使其成为开源 MoE LLM 的标杆产品之一。
3.1.2. DeepSeek AI 系列模型(2024/2025)系列通过细粒度专家与训练创新,在前 沿探索 MoE 的训练效率与专家特化
DeepSeek AI 在 MoE 大语言模型领域贡献了多个重要的开源模型,尤其在提升模 型训练效率、优化专家特化以及探索低成本高性能 MoE LLM 方面进行了深入且 富有成效的探索,其系列模型充分展现了 MoE 架构在构建高性价比 LLM 方面的 巨大潜力,为 MoE 作为 LLM 核心基石提供了更多样化的实践路径。 1) MoE 架构创新与 LLM 参数有效性探索:DeepSeek 系列 MoE 模型的一个核 心设计理念在于提升参数的有效利用率和专家的特化程度。早期版本的 DeepSeek-MoE(如 16B 版本)便引入了细粒度专家分割(fine-grained expert segmentation)和共享专家(shared experts)的设计。细粒度专家分割通过将 FFN 专家的中间隐藏维度进一步细分,创建出数量更多、规模更小的专家, 旨在让每个专家更聚焦于特定的知识领域,从而提升 LLM 的整体知识精细度 和特化水平,同时保持总参数量的可控性。而共享专家的引入,则保证了每个 token 都能得到基础的、通用的处理,这不仅有助于稳定训练过程,还能提升 模型的整体性能和泛化能力,确保 LLM 在利用特化知识的同时,不失其通用 理解能力。最新的旗舰级 MoE 模型 DeepSeek-V3(总参数量 6710 亿,每个 token 激活 370 亿参数)进一步沿用并优化了这一架构思想,持续强调成本效 益训练与专家的高效利用。 2) 训练效率与负载均衡的创新突破:DeepSeek AI 在 MoE LLM 的训练效率和负 载均衡机制方面也展现了显著的创新。DeepSeek-V3 引人注目的一个创新是采 用了无辅助损失的负载均衡策略:通过为每个专家引入一个动态调整的偏置 项来指导路由决策,从而在训练过程中自然地引导实现专家间的负载平衡,这 有效避免了传统辅助损失函数可能对模型主任务学习产生的潜在干扰和对超 参数的敏感依赖。同时,模型辅以一个微小的序列级平衡损失以防止极端不平 衡情况的发生。在训练通信成本控制方面,DeepSeek-V3 采用了节点限制路由 (Node-Limited Routing)机制,确保每个 token 在分布式训练环境中最多被发 送到预设数量的计算节点,有效管理了大规模 MoE LLM 训练中的通信开销。 此外,DeepSeek-V3 还采用了多 token 预测(Multi-Token Prediction,MTP)的 训练目标以稠密化训练信号、提升数据效率,并支持 FP8 混合精度训练及高 效并行算法(如 DualPipe),显著提升了训练效率。这些训练和负载均衡上的 创新,对于降低 MoE LLM 的训练门槛、提升其实用性具有重要意义,是推动 MoE 架构成为 LLM 普适性选择的关键因素。 3) 性能表现与开源社区贡献:DeepSeek 系列 MoE LLM,特别是 DeepSeek-V3 的 聊天版本,在知识问答、代码生成、数学推理等多个复杂任务上展现出优异性 能,据称可与业界顶尖的闭源模型(如 GPT-4o)相媲美,并在某些方面(如 中文事实性知识)实现超越。DeepSeek 系列模型的开源,尤其是其在 MoE 架 构(如细粒度专家、共享专家设计)和训练策略(如无辅助损失负载均衡)上的创新,为开源社区提供了宝贵的实践参考和高质量的 MoE LLM 底座,进一 步推动了高效能、低成本大规模 AI 模型的发展,有力地印证了 MoE 架构作 为 LLM 核心基石在持续演进中的强大生命力与广阔前景。

3.1.3. 阿里巴巴 Qwen3 系列模型(2025)积极实践高性能通用 MoE 模型,探索更 丰富的专家组合策略
阿里巴巴推出的 Qwen3(通义千问 3)系列,通过其 MoE 架构版本(如 Qwen3- 235B-A22B 等),展示了其在构建高性能、高效率的通用大语言模型方面的积极探 索和重要成果。Qwen3 MoE 模型的实践,进一步丰富了业界对于如何通过 MoE 架构提升 LLM 综合能力、优化资源利用的认知,为 MoE 作为 LLM 核心基石提 供了有力的案例支持。 1) MoE 架构设计与专家特化探索:Qwen3 旗舰级 MoE 模型 Qwen3-235B-A22B 拥有 2350 亿总参数,在推理时每个 token 激活 220 亿参数(约占总参数的 9.3%)。其 MoE 层设计体现了对专家数量和激活策略的精心考量:模型总共 包含 128 个专家,并采用 Top-8 路由的策略,即每个 token 会激活 8 个专家进 行处理。这一设计相较于常见的 Top-1 或 Top-2 路由,旨在为每个 token 引入 更丰富的专家知识组合,以期提升模型在复杂任务上的性能。值得注意的是, 与一些采用共享专家的 MoE 设计不同,Qwen3-235B-A22B 的 MoE 层排除了 共享专家,可能更侧重于通过路由机制和大量专家的组合来实现知识的全面 覆盖与特化。同时,该模型也采用了细粒度专家分割技术,并结合全局批量负 载均衡损失(global-batch load balancing loss)来鼓励专家形成更精细化的特长 并保障训练的稳定性。Qwen3 MoE 模型的基础架构则与 Qwen3 稠密版本保持 一致,采用了 GQA、SwiGLU 激活函数、RoPE 和 RMSNorm 等当前 LLM 的 成熟技术。这种在 MoE 层设计上的精细调整与对专家特化的追求,反映了业 界在提升 MoE LLM 参数利用效率和模型表达能力方面所做的持续努力。 2) 精细化的训练策略与 LLM 能力构建:Qwen3-235B-A22B 模型的训练过程分 为预训练和后训练两大环节,体现了构建高性能 MoE LLM 的系统性工程思 维。预训练通过通用、推理和长上下文三个阶段,为模型打下坚实的知识基础 和强大的基础建模与理解能力。随后的多轮后训练,则涵盖了指令微调(SFT)、 人类反馈强化学习(RLHF/DPO/CPPO)、多语言与多模态对齐、代码能力强化 及安全性优化等多个方面,旨在全面提升模型在实际应用中的任务解决能力、交互体验和安全性。这种贯穿预训练与后训练的精细化策略,对于充分发挥 MoE LLM 的巨大参数潜力、使其在多样化下游任务中展现出卓越性能至关重 要。 3) 性能表现与开源贡献:Qwen3-235B-A22B 模型在多种下游任务基准测试中取 得了 SOTA 或接近 SOTA 的成绩,据称其基础模型能以仅约 220 亿的激活参 数(约为 Qwen3-稠密模型总参数的 1/5),达到与 Qwen3 稠密模型相当的性能 表现。在多数公开评测基准上,Qwen3-235B-A22B 表现优于此前领先的开源 稠密及 MoE 基础模型(如 DeepSeek-V3 Base,Llama-4-Maverick Base)。其报 告指出其以约 1/3 的总参数和 2/3 的激活参数在 15 个基准中的 14 个上超越了 DeepSeek-V3-Base。Qwen3 系列 MoE 模型的开源(采用 Apache 2.0 许可), 进一步丰富了全球开发者和研究者对于高性能、高效率 MoE LLM 的选择,为 多语言处理、多模态融合以及高效推理等方向的研究与应用提供了新的、强大 的基础模型平台,再次印证了 MoE 架构在推动 LLM 技术进步和生态繁荣中 的核心作用。
3.1.4. Meta 在 Llama 4 系列模型(2025)中全面拥抱 MoE 架构,标志着国外主流 开源模型向稀疏化方向演进
Meta 作为开源大语言模型的重要推动者,在其备受瞩目的 Llama 系列最新一代 Llama 4 中引入了 MoE 架构。这一举措反映了 MoE 技术在提升主流 LLM 效率和 能力方面日益增长的重要性,进一步凸显了其作为 LLM 核心架构演进的关键方 向,并展示了其在支持原生多模态处理等前沿探索中的应用潜力。 1) MoE 架构特性与创新设计:Llama 4 是 Llama 系列中首个采用 MoE 架构的模 型,其主流型号包括 Llama 4 Scout(总参数 1090 亿,激活参数 170 亿,16 个 专家)和 Llama 4 Maverick(总参数 4000 亿,激活参数 170 亿,128 个专家)。 为了提升推理效率,Llama 4 模型采用了交替的稠密层和 MoE 层的独特设计。 其 MoE 层的一个显著创新在于同时使用了路由专家(routed experts)和共享 专家(shared expert)。在这种设计下,每个 token 都会首先经过一个共享专家 进行处理(该共享专家负责通用知识的理解与加工),之后还会被路由到一个 从多个路由专家中选出的特定专家进行更专业化的处理。这种通用+特化的专 家组合策略,旨在平衡 LLM 的通用能力和在特定领域的深度处理能力,是 MoE 架构在提升 LLM 综合性能方面的一种重要探索。 2) MoE 赋能下的 LLM 核心能力拓展:Llama 4 的 MoE 架构是其实现多项核心 能力突破的基础。首先,Llama 4 被设计为原生多模态模型,采用了早期融合 策略,能够将文本和视觉(图像、视频、音频)无缝集成到统一的 MoE 增强 主干中进行联合预训练。MoE 的稀疏激活和专家特化能力,为处理和融合不 同模态的信息提供了灵活高效的架构支持。其次,Llama 4 在超长上下文处理 方面也表现突出,Scout 模型支持高达 1000 万 token 的上下文长度,Maverick 也支持百万级上下文,这得益于包括 MoE 在内的整体架构设计(如交错注意 力层和 iRoPE 等)。在训练效率方面,Llama 4 采用 FP8 精度进行训练,并在大规模 GPU 集群(如 32K GPUs)上实现了高 FLOPs 利用率,训练数据量超 过 30 万亿 token。这表明 MoE 架构与先进的训练技术相结合,能够有效支持 LLM 在更大规模数据上进行高效预训练。 3) 性能表现与行业影响:Llama 4 模型在编码、推理、长上下文处理和图像理解 等多个基准测试中,展现出与业界领先模型相当甚至更优的性能。例如,Scout 模型在大海捞针等长上下文检索任务中表现出色。Llama 4 的开源(采用社区 许可,对大型企业有使用限制)延续了 Meta 在推动 AI 技术普及的努力。其 对 MoE 架构的采纳,以及在原生多模态、超长上下文等 LLM 前沿技术方向 上的突破,为开源社区提供了又一个强大的 MoE LLM 基础模型,进一步加速 了 MoE 技术在 LLM 领域的创新与应用,再次印证了 MoE 架构作为 LLM 核 心基石的地位。

3.1.5. Minimax 的 MiniMax-01 系列模型(2025)将 MoE 与创新注意力机制结合, 成功赋能 LLM 的超长上下文处理
由 MiniMax 推出的 MiniMax-01 系列模型,通过将 MoE 架构与创新的线性注意力 机制(Lightning Attention)巧妙结合,在大语言模型的超长上下文处理能力方面 取得了显著突破。这一实践展示了 MoE 作为 LLM 核心架构的灵活性,能够与其 他先进技术协同优化,共同提升 LLM 在特定关键能力维度上的表现。 1) MoE 架构与混合注意力机制的协同设计:MiniMax-Text-01 模型拥有 4560 亿 总参数,在推理时每个 token 激活 459 亿参数(约占总参数的 10%)。其 MoE 部分包含 32 个专家,并采用了 Top-2 路由策略。这一 MoE 设计本身提供了 强大的模型容量和高效的条件计算能力。更为核心的创新在于,MiniMax-01 采用了混合注意力架构:模型的大部分 Transformer 层使用了计算复杂度为线 性的 Lightning Attention,而在每隔 7 个 Lightning Attention 层之后则放置一个 传统的 Softmax Attention 层。这种设计旨在通过线性注意力大幅降低长序列 处理的计算和内存瓶颈,同时利用 MoE 扩展模型的参数规模和表达能力,并 通过少量标准注意力层维持全局依赖的捕捉能力,从而在保持 LLM 核心能力 的同时,显著提升其处理超长上下文的效率和性能。 2) 训练效率与超长上下文能力的实现:MiniMax-01 模型的训练采用了一系列优 化的并行策略,如专家张量并行(ETP),以及高效的计算-通信重叠技术,如 线性注意力序列并行(LASP+)。这些技术确保了其大规模 MoE 与混合注意 力架构能够得到有效训练。得益于此,模型在训练时的上下文长度可达 100 万tokens,并且在推理时能够进一步外推至处理高达 400 万 tokens 的超长上下 文,同时保持了可控的计算成本。其视觉语言模型 MiniMax-VL-01 则是在此 文本模型基础上,通过 5120 亿视觉语言 token 继续训练构建,进一步展示了 该架构向多模态扩展的潜力。这表明 MoE 架构与高效注意力机制的结合,是 LLM 在不牺牲过多性能的前提下,大幅扩展上下文窗口、增强长程依赖建模 能力的一条有效路径。 3) 性能表现与行业影响:据其技术报告称,MiniMax-01 在标准基准测试中的表 现与 GPT-4o、Claude-3.5-Sonnet 等业界顶尖模型相当,但在长上下文处理能 力方面则展现出远超对手(20-32 倍)的优势。例如,其在 400 万 token 的大 海捞针检索任务中达到了 100%的准确率。MiniMax-01 的开源及其在 MoE 与 高效注意力机制结合、赋能 LLM 超长上下文处理方面的创新,为 AI 社区, 特别是需要处理海量文本或长序列数据的应用场景(如法律文档分析、长篇小 说理解与创作、大规模知识库问答等),提供了处理超长序列数据的新思路和 强大的 LLM 基础工具,进一步拓展了 MoE LLM 的应用前景。
3.1.6. 腾讯混元 TurboS 模型(2025)通过 MoE 与混合架构协同,为 LLM 的性能 与效率探索新路径
腾讯混元团队于 2025 年推出的 Hunyuan-TurboS,是一款引人注目的大型混合 Transformer-Mamba 架构的 MoE 语言模型。该模型通过将 MoE 的稀疏激活优势 与 Transformer 的上下文理解能力及 Mamba 架构的长序列处理效率相结合,并引 入新颖的思维链机制,为构建更高性能、更高效率且更具适应性的 LLM 提供了创 新的解决思路,进一步彰显了 MoE 作为 LLM 核心架构基石的灵活性与强大潜力。 1) MoE 与混合架构的深度融合及特性:Hunyuan-TurboS 拥有 5600 亿总参数, 在推理时每个 token 激活 560 亿参数(激活比例 10%)。其核心架构特色在于 采用了混合 Transformer-Mamba2-MoE 设计。模型共 128 层,并创新性地引入 了 AMF(Attention→Mamba2→FFN)与 MF(Mamba2→FFN)块的交替模式, 旨在协同发挥不同架构组件的优势。至关重要的是,其 FFN 层采用了 MoE 结 构,具体包含 32 个专家,每个 token 会激活 1 个共享专家和 2 个特化专家。 这种包含共享专家的 MoE 设计,有助于 LLM 在利用特化知识的同时保持其 通用理解能力和训练稳定性。该模型支持 256K 的上下文长度,并在高达 16 万亿的高质量 tokens 上进行了预训练。Hunyuan-TurboS 的架构探索,代表了MoE 技术与新高效模型架构(如 Mamba)集成,以期突破现有 LLM 在长序 列处理、计算效率和模型能力平衡方面瓶颈的重要方向。 2) 核心创新、训练策略与推理效率:Hunyuan-TurboS 在多个层面进行了创新。 其 Mamba-Transformer 协同架构旨在融合 Mamba2 的线性复杂度长序列处理 能力和 Transformer 的优越上下文理解能力,而 MoE 的应用则进一步提升了 模型的参数和计算效率。模型引入的自适应长短链思维(Adaptive Long-short CoT)机制,能够根据问题复杂度动态切换快速响应与深度思考模式,从而优 化 LLM 的计算资源分配和问题处理流程;这一机制通过一个经过专门 SFT 和 独特强化学习框架训练的教师模型来实现。其训练过程也采用了全面的后训 练策略,包括大规模指令微调 SFT、新颖的自适应长短链 CoT 融合方法、多 轮反思学习以及针对性的两阶段大规模强化学习(GRPO)。在推理效率方面, 作为业界首批大规模部署的 Mamba 混合模型之一,Mamba 核心获得了 1.8 倍 的速度提升。这些创新和优化,共同确保了其复杂的 MoE 混合架构能够高效 训练并实现高性能、低成本的推理,为 MoE LLM 的实用化和规模化部署提供 了宝贵经验。 3) 性能表现与行业影响:Hunyuan-TurboS 在 LMSYS Chatbot Arena 的评估中取 得了 1356 分的成绩(排名前 7),并在 23 项自动化基准测试中平均达到 77.9% 的准确率,尤其在数学、编码及多语言任务中表现优异。该模型在提供与顶尖 LLM 相当性能的同时,推理成本显著降低,例如在 Chatbot Arena 中仅使用 Deepseek-R1 约 50%的生成 token 量。Hunyuan-TurboS 的成功实践,不仅在高 性价比大规模 LLM 领域建立了新的范式,更重要的是,它展示了 MoE 架构 与 Transformer、Mamba 等不同类型骨干网络模块化结合的巨大潜力,为未来 LLM 架构的多元化和创新性发展开辟了新路径,进一步巩固了 MoE 作为灵 活且强大的 LLM 核心组件的地位。
3.1.7. 小红书 dots.llm1 模型(2025)以极具竞争力的性能成本比,探索高效 MoE 新前沿
小红书(rednote-hilab)于 2025 年 6 月发布的 dots.llm1 是一款拥有 1420 亿总参 数的大规模混合专家(MoE)模型,它以严谨的工程实践和深度系统优化,在性能与成本之间取得了卓越的平衡。该模型在激活 14B 参数的条件下,实现了与 Qwen2.5-72B 等顶尖稠密模型相当的性能,同时大幅降低了训练与推理成本。 dots.llm1 的成功实践,有力地证明了通过高效的架构设计、高质量的数据以及与 底层硬件的深度协同,能够持续拓展大语言模型的能力边界。 1) 架构设计与数据策略:dots.llm1 采用 Transformer 架构,其中前馈网络(FFN) 被 MoE 模块所替代。其 MoE 层由 128 个路由专家和 2 个所有 token 共享的专 家构成,路由机制会为每个 token 选择 Top-6 的路由专家,使得每个 token 总 共激活 8 个专家。为保证训练的稳定性,模型采用了无辅助损失(auxiliaryloss-free)的负载均衡策略,通过引入并动态调整偏置项来引导路由,从而避 免了对模型性能的潜在负面影响,并在训练中实现了零 token 丢弃。在数据层 面,dots.llm1 在高达 11.2 万亿的高质量、多样化 token 上进行预训练,并明确 强调在预训练阶段未使用任何合成数据。其创新的三阶段数据处理框架,通过 文档准备、基于规则的处理以及基于模型的处理,并结合自研的网页清洗模型 与类别平衡分类器,从源头确保了训练数据的卓越品质。 2) 深度系统优化与训练成本效益:dots.llm1 的训练依托于基于 NVIDIA Megatron-Core 自研的轻量级框架 Cybertron。其在系统优化上取得了显著突破: 首先,团队提出了一种创新的基于交错 1F1B 的通信计算重叠方案,有效隐藏 了 MoE 模型中开销高昂的 All-to-All 通信延迟;其次,对 MoE 架构中的核心 计算单元分组矩阵乘法(Grouped GEMM)进行了高效实现,在 NVIDIA H800 芯片上的性能测试中,其前向计算平均比 NVIDIA 官方的 Transformer Engine 快 14.00%,后向计算快 6.68%。这些深度的系统级优化,使得 dots.llm1 的训 练成本效益极为突出,其总训练耗时仅为 146 万 GPU 小时,相较于达到同等 性能水平的 Qwen2.5-72B 模型(612 万 GPU 小时),总计算资源消耗降低了近 4 倍。 3) 性能表现与社区贡献:全面的基准测试结果表明,dots.llm1 的基础模型性能 优于 DeepSeek-V2,且与 Qwen2.5-72B 相当。其指令微调模型 dots.llm1.inst 则 展现出强大的综合能力,尤其在数学推理和中文任务上表现优异,例如,其在 AIME24 数学竞赛基准上得分达 33.1,接近 Deepseek-V3 的 34;在中文测试 集 C-Eval 上得分达 92.2,超越了包括 DeepSeek-V3 在内的同类模型。作为对 开源社区的重大贡献,dots.llm1 团队开创性地公开了训练过程中每一万亿 token 的中间检查点。这一举措为研究社区提供了极大的透明度,使得研究人 能够深入探究大型模型学习的动态过程,从而加速整个领域的创新与发展。
3.1.8. 丰富的开源探索共同构成了 MoE LLM 多元化的技术生态与繁荣景象
除了前述由大型科技公司或知名 AI 初创公司主导的旗舰级 MoE LLM 外,学术界 和开源社区也涌现了众多重要的 MoE 模型及相关技术研究。这些探索在 MoE 架 构的特定方面(如开源复现性、与新兴架构的融合、特定场景的优化等)进行了 富有价值的尝试,共同推动了 MoE LLM 技术的多元化发展和生态繁荣,进一步 印证了 MoE 作为 LLM 核心架构的广泛适应性与持续创新活力。 1) OpenMoE(2024):由新加坡国立大学等学校合作推出的 OpenMoE 系列,旨 在提供完全开源且可复现的 MoE LLM。其设计通常遵循 ST-MoE(Switch Transformer-MoE)的架构和路由策略(如 Top-2 路由)以保障训练稳定性, 并采用了 umT5 分词器以更好支持低资源语言。架构上的一个显著特点是残 差 MoE(Residual MoE),即每个 MoE 块中包含一个固定的、始终被激活的 FFN 层(可视为共享专家),而 MoE 层则以交错方式使用(例如每 4 或 6 层 部署一个 MoE 层)。训练中也使用了负载均衡损失和 Router Z-loss 来提升稳 定性和并行效率。OpenMoE-8B/32E(80 亿总参数,约 20 亿激活参数,32 个 专家)是其代表型号。OpenMoE 项目及其对 MoE LLM 行为特性的研究(如 上下文无关的特化、早期路由学习、末端丢弃现象等),为理解 MoE 模型的内 部运作机制和指导未来优化方向提供了宝贵的开源实践和洞见。 2) DBRX(2024):Databricks 推出的 DBRX 模型总参数量达到 1320 亿,其 MoE 层每层包含 16 个专家,并采用了 Top-4 路由策略(每个 token 激活 4 个专家), 推理时激活参数量约 360 亿。DBRX 采用了细粒度专家和多专家激活的策略, 在多项基准测试和代码生成任务上表现优异,与 Mixtral 等知名开源 MoE LLM 形成了有力竞争。其灵活的路由选择(Top-4)和由此带来的高模型表达能力, 为后续 MoE LLM 架构在提升性能和路由多样性方面提供了新的参考趋势。 3) Snowflake Arctic(2024):Arctic 模型采用了一种新颖的稠密-稀疏混合(DenseMoE Hybrid)架构,总参数量高达 4800 亿,但激活参数仅为 170 亿。其模型 主干是一个稠密的 Transformer 网络,而在残差连接部分则部署了多达 128 个 小型的 MoE 专家,通过 Top-2 门控进行路由。这种设计旨在兼顾稠密模型的 基础性能、训练稳定性与 MoE 架构的组合建模能力和参数扩展效率,为企业 级部署和特定应用场景(如文档智能)提供了新的高性价比 MoE LLM 方案。 4) AI21 Jamba(2024):Jamba 被认为是首个将 Transformer、Mamba(一种状态 空间模型 SSM)与 MoE 架构显式结合的混合模型。它采用了交错的 Transformer 和 Mamba 层,并在模型的 MLP 层(即 FFN 部分)引入了 MoE 设计。Jamba 模型主打长上下文处理能力(支持 256K tokens)、高吞吐量和相 对较低的内存占用。Jamba 的探索进一步拓展了 MoE 技术与新兴高效模型骨 架(如 Mamba)的结合方向,为构建能够高效处理超长序列、同时保持强大 建模能力的 LLM 开辟了新路径。 5) OLMoE(2024)、JetMoE(2024)等开源项目:以 OLMoE 为例,其致力于 彻底开放模型权重、训练数据、代码与日志,为 MoE LLM 的可复现研究树立 了典范。JetMoE 等项目则代表了开源社区在 MoE 架构的细粒度设计、训练策 略优化以及特定硬件适配等方面的持续探索和贡献。这些开源努力极大地降 低了研究和应用 MoE LLM 的门槛,加速了技术的迭代和创新。
这些多样化的模型和技术探索,共同构成了 MoE LLM 技术繁荣发展、持续创新 的生动图景。它们不仅在性能和效率上取得了长足进步,也为解决 MoE 自身面临 的挑战(如负载均衡、训练稳定性、专家特化、长上下文处理等)提供了丰富的 思路和解决方法,持续巩固和拓展了 MoE 作为 LLM 核心架构基石的内涵与外延。
3.2. 行业巨头在旗舰闭源模型中积极采用 MoE 架构,彰显其不可或缺 的战略价值
许多领先的 MoE 大语言模型(LLM)选择开源或发布详细的技术报告,但一些 AI 巨头依然对其旗舰级 LLM 采取闭源策略。尽管如此,这些公司在闭源旗舰 LLM 的迭代开发中,同样积极探索并应用 MoE 或类似的稀疏化技术。这些行业领导者 的技术选型,往往预示着前沿技术的主流发展方向。 对这些旗舰模型的观察表明,MoE 架构已成为顶尖 LLM 在平衡模型规模、推理 成本与核心能力时的一致选择,其战略价值日益凸显。
3.2.1. Google Gemini 系列明确采用 MoE,证实 MoE 是其提升效率与支持超长上 下文的关键
Google 在 Gemini 系列模型的演进中,为业界观察 MoE 在旗舰 LLM 中的实际部 署和战略价值提供了相对清晰的窗口。 1) Gemini 1.0 的早期信息与 MoE 的“缺席”:Google 发布的 Gemini 1.0 初步技 术报告详细介绍了其多模态能力和基于 TPU 的训练,但并未明确提及 MoE 或 稀疏架构。 2) Gemini 1.5 Pro 与 Flash 明确采用 MoE:转折点出现在 Gemini 1.5 系列的发 布。Google 在 2024 年 2 月明确宣布 Gemini 1.5 Pro(及其后的 Flash 版本)采 用了 MoE 架构,并解释此举是为极大提升模型的效率,通过选择性激活最相 关的专家神经网络路径来实现。Google 首席科学家杰夫·迪恩(Jeff Dean)的 在苏黎世联邦理工大学的演讲也明确指出 Gemini 1.5 Pro 及后续版本使用了 MoE 架构。Google 将采用 MoE 的主要原因归结为提升训练和服务的效率, 以及支持更长的上下文窗口(初期支持 100 万 token,研究中测试高达 1000 万 token)。MoE 被视为解锁实用超长上下文能力的关键,构成了 LLM 效用的一 大差异化因素。尽管确认了 MoE 的应用,但专家数量、规模、路由机制等具 体实现细节,Google 未予披露。Gemini 1.5 对 MoE 的明确采用并成功实现超 长上下文处理,强有力地证明了 MoE 架构是当前 LLM 突破核心能力瓶颈(如 上下文长度、计算效率)的基石性技术。 3) Gemini 2.5 Pro 与 Flash 基于 MoE 稀疏技术进阶与推理能力增强:虽然 Google 尚未发布 Gemini 2.5 系列的官方技术报告,但从其新功能设计和性能提升来 看,该系列显然延续并发展了前代的 MoE 架构。针对 Gemini 2.5 Pro,Google 引入了深度思考(Deep Think)模式和可配置的思考预算(Thinking Budgets), 允许用户或开发者影响给定查询的计算量,从而在成本/延迟与响应质量/深度 之间进行权衡。Gemini 2.5 Flash 也被描述为具有类似的动态可控推理能力。 这些特性强烈暗示了其背后是进一步优化和高度可控的 MoE 计算机制,使得 LLM 的经济效益和应用灵活性得到显著增强。Google 开发者博客也强调了 Gemini 2.5 Pro 在编码能力和复杂工作流方面的提升,这些很可能也得益于其 优化的 MoE 架构与 TPU 硬件的深度协同。
Google 在信息披露上采取了分阶段策略,从 Gemini 1.0 的缄默,到 Gemini 1.5 的 明确采用并阐述优势,再到 Gemini 2.5 强调由 MoE 支持的高级功能,其路径清晰 地展示了 MoE 已成为其技术路线图上不可或缺的一环。这一系列行动并非孤立的 战术选择,而是其长期技术战略的必然延续和成果展示。回顾更早的奠基性工作, 正是 Google 通过 GShard、Switch Transformer 和 GLaM 等一系列开创性实践,率 先验证了 MoE 在超大规模模型上的巨大潜力,并解决了专家并行、高效路由等核 心工程难题,为整个行业铺平了道路。从早期探索到如今在旗舰产品中的深度集 成,Google 始终是 MoE 范式最坚定和最重要的推动者。其持续且不断加码的投 入,为 MoE 作为应对 AI 规模化挑战的核心架构基石地位,提供了最强有力的产 业背书。
3.2.2. xAI 的 Grok 系列从开源到闭源的迭代,印证 MoE 作为旗舰模型的持续演进
xAI 公司推出的 Grok 系列大语言模型,同样采纳了混合专家(MoE)架构,其从 开源到闭源的迭代路径,清晰地反映了 MoE 作为构建前沿 LLM 核心基座的演进 趋势,并在探索 LLM 与实时信息源的深度融合方面,展现了其独特的技术路径。
1) Grok-1(2023)的 MoE 架构实践与开源贡献:作为该系列的开山之作,Grok1 是一款拥有 3140 亿参数的大规模混合专家(MoE)语言模型。其架构细节 清晰地体现了 MoE 在平衡模型容量与计算效率方面的核心设计:模型在每个 Transformer 层中部署了 8 个独立的专家网络,并采用 Top-2 路由策略,这意 味着对于任意一个输入 token,门控网络会激活两个最相关的专家参与计算。 因此,Grok-1 在推理时仅激活约 25%的参数(约 860 亿),从而在拥有巨大知 识容量潜力的同时,有效控制了实际的运算负荷。其在MMLU得分达到73%, HumanEval 得分达到 63.2%,超过了 GPT3.5。该模型支持 8192 个 token 的上 下文长度,并以其能够接入 X(前 Twitter)平台的实时信息流而备受关注。 Grok-1 最重要的贡献之一在于其对开源社区的开放姿态。xAI 已将 Grok-1 的 基础模型权重和网络架构在 Apache 2.0 许可下完全开源。这一举措意义重大, 它为全球研究者和开发者提供了除 Qwen、Mistral 等系列外,又一个可供研究、 使用和再开发的大规模 MoE 模型范例。这不仅极大地推动了 MoE 架构的透 明化研究和技术普及,也为业界验证和改进大规模稀疏模型的训练、微调与部 署策略提供了宝贵的资源,有力地佐证了 MoE 作为 LLM 核心架构基石的行 业共识与价值。 2) Grok-3(2025)的迭代与架构推测:作为 Grok 系列的最新版本,Grok-3 在性 能上实现了显著跃升,在多个重要评测指标(如 AIME24)上取得了 SOTA 级 别的结果。它具备了更强的推理能力、原生多模态处理能力以及更长的上下文 窗口。然而,与 Grok-1 不同,Grok-3 是一款闭源模型,xAI 官方并未披露其 底层的具体架构细节。因此,当前学术界和产业界尚无权威的第三方分析确认 其是否沿用了 MoE 架构。但基于技术演进的合理推断,Grok-3 极有可能是在 Grok-1 成功的 MoE 基础上进行的优化与升级。为了支持其更强大的多模态和 复杂推理功能,Grok-3 的架构或许采用了更精细的专家设计、更智能的路由 机制或与其他先进模块的深度融合,以期在延续稀疏化带来成本效益的同时, 实现模型综合能力的飞跃。这种从开源到闭源的迭代路径,也反映了业界在技 术探索与商业化应用之间的平衡策略。 Grok 系列模型的实践,特别是 Grok-1 的开源,为 MoE 生态贡献了一个关键的大 规模模型样本。其独特的发展方向,例如将高效的 MoE 架构与实时、动态的信息 流相结合,为 LLM 开辟了一条差异化的演进路径。这表明,MoE 框架不仅是实 现 LLM 参数与计算效率扩展的有效手段,更是一个能够灵活集成多样化外部知 识源、支持构建更具即时性和情境感知能力智能系统的强大基座,从而进一步拓 展了 MoE 作为 LLM 核心架构的应用边界与想象空间。
3.3. MoE 技术凭借其架构优势正重塑 LLM 市场格局,并引领着未来的 技术演进方向
综合回顾本章所分析的众多主流及前沿 MoE 大语言模型(LLM)的实践,我们可 以清晰地观察到 MoE 技术在驱动 LLM 持续进化过程中的若干显著技术趋势和市 场动态。MoE 架构已经从早期的理论探索和初步实验,发展成为当前构建超大规 模、高性能 LLM 的核心技术范式之一,被全球领先的 AI 研究机构、大型科技公 司以及创新型初创企业广泛采纳和积极推进。这些趋势和格局共同印证了 MoE 作 为 LLM 核心架构基石的地位,并预示着其未来的发展方向。
3.3.1. MoE LLM 技术正朝着更大参数、更智能路由和更精细化专家设计的方向演 进
1) 参数规模的持续扩展与计算效率的极致追求:MoE LLM 普遍追求极大的总参 数量(从数百亿到数万亿级别),同时通过稀疏激活(通常每个 token 激活总 参数的一小部分,例如 Mixtral 8x7B 激活约 28%,GLaM 激活约 8%,DeepSeekV3 激活约 5.5%,Qwen3-MoE 激活约 9.3%,Hunyuan-TurboS 激活约 10%)来 严格控制实际的计算成本。这清晰地反映了业界试图通过更大的模型容量来 提升 LLM 的智能水平和知识覆盖面,同时又必须兼顾训练和推理的经济可行 性,MoE 为此提供了关键的实现路径。 2) 路由策略的多样化与持续优化:Top-k 路由仍然是 MoE LLM 的主流选择,其 中 Top-1 路由(如 Switch Transformer 的实践)和 Top-2 路由(如 GShard、 GLaM、Mixtral 系列、MiniMax-01、OpenMoE 等模型的采用)最为常见。部 分模型则探索了更高数量的专家激活(如 Qwen3-235B-A22B 采用 Top-8 路由, dots.llm1 采用 Top-6 路由)。同时,也涌现出如专家选择路由(Expert Choice Routing)、软性门控(Soft MoE)、以及 DeepSeek-V3 采用的节点限制路由 (Node-Limited Routing)等更高级或针对特定场景优化的路由/门控机制。这 表明学术界和产业界正持续探索更智能、更高效的路由方式,以提升 MoE LLM 的负载均衡效果、专家特化能力和整体性能。 3) 专家设计的精细化与多样化:除了将 Transformer 中的标准 FFN 层替换为 MoE 专家外,专家本身的设计也日趋精细。共享专家/残差 MoE(例如 Llama 4 的 设计、OpenMoE、dots.llm1 以及 DeepSeekMoE 的部分理念)已成为一种流行 设计,旨在保证 LLM 的基础性能和训练稳定性。细粒度专家分割(如 DeepSeekMoE 和 Qwen3 的实践)则试图通过创建更多、更小的专家单元来提 升专家的特化程度和知识覆盖的精细度。此外,MoE 架构也展现出与其他技 术模块的强大结合能力,例如与特定注意力机制的结合(如 MiniMax-01 将 MoE 与 Lightning Attention 结合;Grok-3 据第三方分析可能采用跨专家注意力 门),以及与新兴模型骨架(如 Mamba)的融合(如 Hunyuan-TurboS 的 Transformer-Mamba-MoE混合架构、AI21 Jamba)。这些探索极大地拓展了MoE LLM 的设计空间,使其能够更好地适应不同任务和性能目标的需求。 4) 负载均衡策略的持续攻坚:高效的负载均衡对于充分发挥 MoE LLM 的潜力 至关重要。相关技术从早期 GShard、Switch Transformer 及 Mixtral 系列等采 用的辅助损失函数,发展到更复杂的损失设计(如 ST-MoE 的 Router Z-loss), 乃至如 DeepSeek-V3 与 dots.llm1 采用的无辅助损失动态调整策略和 Expert Choice 路由的固有均衡特性。这反映出负载均衡始终是 MoE LLM 研究与实 践的核心议题之一,目标是在不牺牲模型性能的前提下,实现更稳定、更高效 的专家负载管理。 5) 训练与推理效率的极致优化:除了 MoE 架构本身带来的计算效率提升外,各 大 MoE LLM 的开发者也在积极采用包括低精度训练(如 FP8,见于 Llama 4 和 DeepSeek-V3 的训练)、高效并行策略(专家并行、流水线并行、张量并行 的组合)、优化的通信算法以及与特定硬件的协同设计等手段,以进一步提升 训练和推理的整体效率。 6) 开源趋势的强化与生态的繁荣:以 Mixtral 系列、DeepSeek 系列、Qwen 系列、 Llama 系列、Grok-1(基础权重与架构)、dots.llm1(中间检查点)、MiniMax01、OpenMoE 以及 Hunyuan-TurboS 等为代表的一系列高性能 MoE LLM 的 开源或发布详细技术报告,极大地促进了 MoE 技术的普及和社区创新,对闭 源模型构成了有力的竞争和补充。这一趋势加速了 MoE 作为 LLM 核心架构 的共识形成,并为更广泛的开发者和研究者提供了构建和应用先进 MoE LLM 的机会。
3.3.2. MoE LLM 市场已形成巨头引领与创新力量并存的多元化竞争格局
1) 巨头引领与创新力量并存的多元化格局:Google(如 Gemini 系列,早期 GShard 等 )、Meta(Llama 4 系列)、xAI(Grok 系列)、阿里巴巴(Qwen3 系列)、腾 讯(Hunyuan-TurboS)等 AI 巨头凭借其强大的研发实力和计算资源,在 MoE LLM 技术的探索和应用上持续领先。与此同时,Mistral AI(Mixtral 系列)、 DeepSeek AI(DeepSeekMoE/V3/R1 系列)、MiniMax AI(MiniMax-01 系列 ) 等 AI 创新公司也通过在 MoE 架构上的独特创新,成功推出了具有强大竞争 力的产品,在某些细分领域或特定性能上甚至表现突出,打破了市场的固有格 局。这种多元化的竞争与创新格局,共同推动了 MoE LLM 技术的快速迭代 和应用深化。 2) 性能与成本效益竞争的白热化:MoE 技术的核心价值之一在于其优越的性能 与计算成本之比。随着越来越多参与者的加入,市场竞争的焦点也日益集中于 如何以更低的成本提供更强的模型能力。这不仅推动了 MoE 架构本身的持续 优化,也对底层的 AI 芯片(GPU/TPU、NPU 等)、互连技术以及软件栈(训 练/推理框架)提出了更高的要求和更大的创新空间。 3) 开源生态的持续繁荣及其战略意义:开源 MoE LLM(特别是那些采用宽松许 可协议的模型)的涌现,正在催化一个更加开放和协作的 AI 生态系统。这使 得中小型企业和学术研究机构能够接触并使用到 SOTA 级别的 MoE 技术,加 速了 AI 应用的落地和创新,进一步巩固了 MoE 技术在 LLM 领域的基础设施 地位。 4) 应用场景的持续拓展:MoE LLM 凭借其处理大规模、多样化知识的能力以及 更高的计算效率,正在从通用的语言理解和生成,向更专业的领域(如科学研 究、代码生成与辅助开发、数学推理、金融分析、医疗健康、多模态内容理解 与创作等)渗透。未来,针对特定行业或任务需求高度优化的 MoE LLM,有 望成为推动产业智能化升级的关键引擎。
3.3.3. 主流 MoE 模型架构呈现高度多样化,业界在平衡性能与效率上持续探索

从 Google 的早期奠基性探索到当前众多开源与闭源模型的百花齐放,MoE 架构 在专家数量、路由策略、总参数与激活参数的比例、以及与共享专家机制或特定 注意力机制的结合等方面,均展现出丰富的变体和持续的创新。这种架构上的多 元化探索,其根本驱动力在于业界对更高模型能力(更大参数容量、更强知识学 习与应用)和更优计算效率(更低的训练与推理成本)的不懈追求,而 MoE 正是 满足这些 LLM 核心需求的关键技术路径。 Llama 4 和 DeepSeek-V3 等模型引入共享专家机制,旨在确保 LLM 处理所有输入 时都有一条通用的知识路径,这可以视为对早期纯稀疏 MoE 可能存在的某些 token 处理不足或训练不稳定问题的一种有效改进。而 MiniMax-01 将 MoE 与 Lightning Attention 结合以处理超长上下文,则代表了 MoE 架构与其他先进技术模块深度协同,共同提升 LLM 特定能力的趋势。近年,DBRX、Snowflake Arctic 和 AI21 Jamba 等新兴开源 MoE LLM 的出现,进一步丰富了 MoE 的架构形态和 应用场景,特别是在跨领域知识融合和构建新一代混合模型方向上展现了最新进 展。 开源 MoE LLM 的蓬勃发展,特别是 Mixtral 系列 和 DeepSeek 系列的成功,极大 地推动了 MoE 技术的普及和创新。它们不仅为学术研究提供了宝贵的、可复现的 实验平台,也为中小型企业和开发者提供了使用 SOTA 级别 LLM 的机会,从而 加速了整个 AI 生态系统的进步和 AI 技术的普及。这种开放性反过来也对闭源模 型构成了积极的竞争压力,促使其不断提升性能和优化效率。 当前 MoE LLM 的设计中并没有一劳永逸解决所有问题的完美方案。专家数量从 数个到上百个(如 8 个到 128 个)不等,激活的专家数量通常为 1 个或 2 个(但 如 Qwen3-235B-A22B 则达到了 8 个),这些差异表明业界仍在积极探索不同 MoE 配置在 LLM 的性能表现、训练与推理效率以及整体训练复杂度之间的最佳平衡 点。这种持续的探索过程本身充满了挑战,但也清晰地指向 MoE 技术作为 LLM 核心架构基石,其自身仍在不断进化并孕育着未来取得更大突破的巨大机遇。
4. 业界正通过多元化的前沿优化技术攻克核心挑战,持续巩 固 MoE 的架构基石地位
混合专家(MoE)架构作为大语言模型(LLM)突破规模与效率瓶颈、实现持续 进化的核心技术基石,其巨大潜力已得到广泛认可。然而,正如任何一项前沿技 术在走向成熟和大规模应用的过程中所必然经历的,MoE 架构在充分释放其赋能 LLM 的潜力,并应对 LLM 日益增长的复杂性需求时,仍面临着一系列关键的挑 战。深刻理解并积极应对这些挑战,是进一步巩固和强化 MoE 作为 LLM 核心架 构地位的关键所在。
4.1. 训练稳定性、通信开销与参数效率等是 MoE 在规模化应用中亟待 解决的核心难题
MoE 模型的稀疏和动态特性,在为 LLM 带来显著优势的同时,也衍生出一系列 特有的技术难题,直接关系到 MoE LLM 的训练效率、最终性能、部署成本以及 应用的广泛性。
4.1.1. 负载不均衡与离散路由决策共同导致了 MoE LLM 训练过程的不稳定与收 敛困难
对于参数规模动辄数千亿乃至万亿的 MoE LLM 而言,确保其训练过程的稳定性 和有效收敛是一个首要挑战。稀疏门控机制虽然能够扩展模型容量,但也可能导 致训练过程的不稳定和收敛困难。负载不均衡是主要原因之一:如果 LLM 中的某 些专家被过度使用,而另一些专家则鲜少被激活(即“专家饥饿”现象),会导致 后者训练不足、前者可能过拟合或成为计算瓶颈,最终损害 LLM 整体的知识学习 和泛化能力。此外,门控网络离散的专家分配决策本身也可能引入训练动态的不 平滑,增加优化难度。OpenMoE 的研究进一步揭示,MoE LLM 的路由决策可能 在训练早期就固化,且表现出一定程度的上下文无关特性,这可能限制模型对新 数据分布的适应性和学习的灵活性,对 LLM 的持续学习和知识更新能力构成潜 在制约。
4.1.2. 专家并行中高昂的 All-to-All 通信开销,成为制约 MoE 模型规模化扩展效率 的系统瓶颈
在分布式训练环境中,专家并行是扩展MoE LLM参数规模的常用且有效的策略,但这不可避免地引入了显著的 All-to-All 通信开销。具体而言,在 MoE LLM 的每 个 MoE 层中,输入 token 需要从其当前所在的计算设备被分发到存储着被选中专 家的其他设备上;在专家计算完成后,其输出结果又需要从各个专家所在的设备 聚合回原始 token 对应的设备。对于拥有海量参数和大量专家的 LLM 而言,这种 跨设备的数据传输(尤其是在专家数量众多或需要跨节点通信时)使得通信带宽 和延迟成为制约整体训练速度和模型可扩展性的关键瓶颈。负载不均衡会进一步 加剧这一问题,因为整个系统可能需要等待最繁忙的设备(或通信量最大的专家 路径)完成计算和数据传输。如何设计高效的通信协议、优化数据传输路径、以 及通过软硬件协同降低通信延迟,是提升超大规模 MoE LLM 训练和推理效率必 须解决的核心问题。
4.1.3. 如何有效利用海量参数并避免专家间的知识冗余,是实现 MoE 模型大而精 的核心挑战
尽管 MoE 架构使得 LLM 的总参数量可以达到前所未有的规模,但如何确保这些 海量的参数都得到了充分且有效的利用,避免不同专家间的知识冗余,是一个持 续存在的挑战。理想情况下,LLM 中的每个专家应学习到独特且互补的知识和技 能,从而共同构成一个全面而高效的知识体系。然而,如果门控网络的路由机制 不够智能或负载均衡不足,可能导致多个专家学习相似或重叠的功能,或者某些 专家因未能得到充分训练而无法形成独特的专长,从而降低了参数的实际效率(即 每单位参数对 LLM 性能的贡献度)。虽然引入共享专家机制(如 Llama 4、 DeepSeek-V3 等模型的实践)有助于 LLM 捕捉通用知识并提升训练稳定性,但也 需要精心设计以避免其与动态激活的特化专家的功能产生不必要的重叠。提升 MoE LLM 的真实参数效率,实现大而精,而非仅仅大而全,是衡量 MoE 架构设 计优劣和释放其全部潜能的关键。
4.1.4. MoE 模型在下游任务微调与实际部署中面临过拟合和高内存开销等复杂难 题
将预训练好的大规模 MoE LLM 成功应用于多样化的下游任务(通过微调),以及 将其高效、经济地部署到实际应用场景中,相较于传统的稠密 LLM 通常更为复 杂。 1) 微调困难:稀疏的 MoE 架构在针对特定领域或小规模下游任务数据进行微调 时,可能比具有同等激活参数量的稠密模型更容易出现过拟合。预训练阶段形 成的路由模式可能对特定数据分布产生了较强的偏好,难以快速适应新任务 的数据特性和知识需求。OpenMoE 的研究也观察到,在指令微调数据上,末 端丢弃(即序列末尾的 token 更容易被路由机制忽略或丢弃)的问题可能尤为 严重,且标准的 SFT 过程本身难以显著缓解此问题。如何开发出更适合 MoE LLM 架构的参数高效微调(PEFT)技术和特定任务的适配策略,是提升其泛 化能力和应用范围的关键。 2) 部署复杂:MoE LLM 的总参数量通常远大于单个计算设备(如 GPU)的内存 容量。即使在推理时只激活一部分专家,也需要高效的参数加载、卸载和管理 机制,以应对海量总参数带来的存储压力。动态路由和稀疏计算模式对推理引 擎的优化也提出了更高要求,需要专门的系统支持以实现低延迟、高吞吐的在 线服务。这些都增加了 MoE LLM 从模型到实际产品转化过程中的工程复杂 度和潜在成本。
4.1.5. 在鼓励专家特化与保持模型泛化能力之间取得平衡,是 MoE 架构设计实现 “博”与“专”的核心艺术
MoE 架构的核心设计理念在于通过专家特化来提升模型处理复杂问题的能力。然 而,过度特化可能损害 LLM 的泛化能力,使其在面对训练数据中未充分覆盖或与已有模式略有不同的新输入时,表现不佳。如何在鼓励 LLM 中的各个专家学习独 特知识、形成专长的同时,保持模型对广泛未知输入的鲁棒性和适应性,是一个 需要精细权衡的难题。OpenMoE 观察到的上下文无关的特化(即路由决策主要基 于 token 而非其上下文语义)现象,正是这种挑战的一个具体体现,它可能导致 LLM 在需要深度依赖上下文进行决策时,无法准确激活最合适的专家。实现专家 知识的“专而能通、博而能精”,是 MoE LLM 逼近更高级别人工智能的关键。
4.1.6. 动态路由与众多专家的存在加剧了 MoE 模型的黑箱特性,给可解释性带来 严峻挑战
相较于稠密模型,MoE LLM 由于其动态门控机制和众多专家的存在,理解其内部 决策过程(哪个专家被激活?为什么是它?这个专家具体学到了什么知识?)的 难度显著增加。这种复杂性使得 MoE LLM 的黑箱特性更为突出,为模型调试、 信任建立、偏见检测和责任归属带来了更大的挑战。特别是在一些闭源的旗舰 MoE LLM 中(如前文 3.2 节所述),由于缺乏架构细节的透明度,外部研究者难 以对其决策的公平性、潜在偏见以及可能存在的行为捷径进行有效评估和监督。 提升 MoE LLM 的可解释性和透明度,对于其在关键领域(如医疗、金融、法律) 的负责任应用至关重要。
4.2. 从智能路由到软硬件协同的全方位优化,正不断夯实 MoE 赋能 LLM 的技术基础
面对前述 MoE 架构在大语言模型(LLM)应用中所面临的训练稳定性、通信开 销、参数效率、微调部署以及专家特化与泛化平衡等诸多挑战,学术界和产业界 并未止步不前,而是围绕这些核心问题展开了持续且深入的优化技术研究。这些 前沿的探索横跨了路由算法的革新、负载均衡策略的精进、专家集合的动态管理、 高效能训练与推理系统框架的构建、与底层硬件的协同设计以及针对 MoE 特性的 模型压缩等多个维度。这些优化技术的共同目标,是最大限度地发挥 MoE 架构在 赋能 LLM 方面的巨大潜力,克服其固有瓶颈,从而不断加固和提升其作为 LLM 核心架构基石的效率、鲁棒性和可扩展性,推动 LLM 向更高智能、更广应用和更 优成本效益的方向持续进化。
4.2.1. 新型路由算法与门控机制正向动态化与上下文感知演进,以提升知识调用的 精准度与效率
路由算法作为 MoE 架构的神经中枢,直接决定了信息(即 LLM 处理的 token)如 何在众多专家间流动,其性能直接关系到专家的有效激活、负载均衡以及最终 LLM 的整体表现。针对传统静态 Top-k 路由可能存在的计算资源次优利用(如对 所有 token 采用固定数量专家可能无法适应不同 token 的复杂度需求)以及离散性 带来的训练难题,研究重点正转向更智能、自适应且可能连续可微的机制,旨在 提升 LLM 知识调用的精准度与计算效率。 1) 动态专家激活策略实现 token 级自适应计算资源分配。为克服传统 Top-k 路 由固定 K 值(即不区分 token 复杂度,均激活同等数量专家)的局限性,研究者们探索了多种动态专家激活策略,旨在让 MoE LLM 能根据输入 token 的实 际复杂度或重要性,按需分配专家计算资源。一类方法如 Ada-K,通过强化学 习训练轻量级分配器来动态决定各 token 应激活的专家数量,从而在提升模型 性能的同时降低计算量与推理延迟。另一类重要方法则基于输入难度或模型 对专家选择的置信度进行动态调整。例如,北京大学团队 2024 年发表于 ACL 的工作(Harder Tasks Need More Experts)提出:若模型对某专家的选择置信 度高(如概率超阈值),则仅激活该专家;反之,则逐步增加激活专家数量直 至满足特定条件。这类动态机制使得 LLM 能为困难 token 分配更多专家,为 简单 token 分配较少专家,从而在优化计算效率与资源利用率的同时,提升整 体性能和表征学习的适应性,最终提升 LLM 的综合表现与运行效率。 2) 上下文感知与任务导向路由增强路由决策的智能化水平。为了进一步提升路 由决策的精准性,研究者开始探索将更丰富的上下文信息或任务导向信息融 入路由过程。例如,在神经机器翻译(NMT)等需要特定领域知识的 LLM 应 用中,微信 AI 团队提出的 THOR-MoE 等工作通过引入任务级别信息(如目 标语言或领域标签)来预先筛选或偏置一部分专家子集,并结合句子级别的上 下文信息进行更细致的 token 路由决策,从而提升了模型在特定任务上的翻译 质量。在视觉 MoE 模型(V-MoE)中,也会根据图像块(patch)的重要性进 行差异化路由。这些探索旨在让 MoE LLM 的门控网络具备更强的上下文理 解能力和任务适应性,使其能够根据当前 token 所处的具体语境、所属任务或 自身特性,更精准地将其导向最合适的专家集群或单个专家,从而提升 LLM 的知识运用效率和最终性能表现。 3) 可微分与连续路由优化 MoE LLM 训练动态的探索。传统基于 Top-k 选择的 硬性路由机制,其离散性(一个 token 要么被路由给某个专家,要么不被路由) 可能导致训练过程中的梯度消失或爆炸问题,增加 MoE LLM 训练的难度和 不稳定性。为了解决这一问题,Soft MoE 等方法采用了一种隐式的软性分配 策略。例如,通过注意力机制计算每个 token 与所有专家之间的相似度,并将 所有输入 token 的加权组合(而非原始 token)传递给每个专家,或者反过来, 将所有专家的输出加权组合作为最终输出。这种软性路由通过将离散选择转 化为连续加权,实现了门控过程的完全可微分,有助于稳定训练过程,并可能 提升最终 LLM 的性能,尽管其代价可能是增加了计算量或不完全适用于某些 自回归解码场景。另一类工作如清华大学团队提出的 ReMoE,则尝试使用 ReLU 等激活函数作为路由器的一部分,并结合自适应的 L1 正则化来控制路 由的稀疏度和负载均衡。这些都是在探索如何在保持路由稀疏性的同时,利用 连续可微操作来优化 MoE LLM 的训练动态和收敛性。 4) 其他路由机制探索与通用优化技巧:研究已证实,可学习的路由器相较于固 定的、基于哈希等规则的路由机制,通常能为 MoE LLM 带来更好的性能,因 为它能根据数据和任务自适应地调整路由策略。此外,学术界也在积极探索更 具创新性的路由范式,例如,Symbolic-MoE 等框架探索基于符号与技能的无 梯度专家选择机制,据称在 LLM 的复杂推理任务上表现突出 ,这为 MoE 在 提升 LLM 高级认知能力方面开辟了新的路径。
除了上述特定类型的路由算法创新外,一些通用的路由器优化技巧对于稳定 MoE LLM 的训练和提升其性能也至关重要。这些技巧包括为门控网络设计合理的参数 初始化方案、采用与主干网络不同的差分学习率、对路由器的权重或输出施加适 当的正则化(如 Router Z-loss,旨在稳定门控网络输出的 logits 幅度,防止其过大 或过小影响训练)、在门控决策中引入噪声(如前文讨论的带噪声的 Top-k 门控, 有助于促进训练初期的探索和改善负载均衡)以及对门控网络的梯度进行裁剪等。 这些多样化的路由机制探索和优化技巧,共同构成了提升 MoE LLM 知识调用效 率和整体智能水平的关键研究方向,对于夯实 MoE 作为 LLM 核心架构基石的稳 定性与高效性具有重要作用。

4.2.2. 负载均衡策略从辅助损失向无损动态控制演进,为 MoE 的高效稳定运行提 供保障
确保 MoE 大语言模型(LLM)中各个专家之间的计算负载均衡,对于模型的训练 效率、参数利用率以及最终的整体性能至关重要。如果缺乏有效的负载均衡,LLM 可能会出现部分专家“过劳”而另一些专家“饥饿”的现象,导致模型收敛困难、 性能下降,甚至训练崩溃。因此,学术界和产业界持续探索和改进负载均衡策略, 旨在实现计算资源在 LLM 各个专家间的均匀分配,促进所有专家得到充分训练 和有效特化,从而最大化 MoE 架构的优势,夯实其作为 LLM 核心架构的稳定性 与高效性。
1) 辅助损失的演进与优化:传统的辅助负载均衡损失函数(GShard、Switch Transformer 等模型采用的机制)虽然被广泛应用,但其设计目标主要是均匀 分配 token,有时可能与促进 LLM 专家形成真正意义上的特化存在一定矛盾, 甚至可能对主任务的学习产生干扰。针对这些问题,研究者们对辅助损失函数 进行了持续的演进和优化。例如,Google 提出的 Router Z-loss(ST-MoE) 旨 在通过约束门控网络输出的 logits 的量级来提升训练稳定性。具体而言,它通 常对 logits 经过特定函数(如 log-sum-exp)聚合后的值的平方进行惩罚,以 防止因 logits 数值过大或分布不均导致的训练不稳定问题,从而间接改善负载 均衡的效果。由 Qwen 团队提出来的全局批量负载均衡损失(global-batch load balancing loss)则着眼于在更大的数据批量(可能是跨多个微批次(microbatches)累积的统计信息)上实现更均匀的专家负载,而不是仅仅关注单个微 批次内的均衡。这种设计思路被认为更能鼓励 LLM 的专家在更广阔的数据视 野下发展出真正有意义的、互补的特化能力,而不是仅仅为了满足局部均衡性 而进行同质化学习。 2) 直接负载控制机制的细化:除了通过损失函数进行软性引导外,直接控制专家 负载的硬性机制也在不断细化。专家容量因子(Expert Capacity Factor,CF) 通过设定每个专家能处理的 token 数量上限,直接防止了部分专家过载。然而, 固定的 CF 值可能难以适应不同训练阶段或不同数据集的动态需求。因此,一 些研究开始探索动态调整 CF 值的策略,或者设计更智能的 token 丢弃策略来 处理溢出的 token(例如,优先丢弃那些对当前任务贡献度较低或信息量较少 的 token),而不是简单地将其旁路或随机丢弃。专家选择路由(Expert Choice Routing)则从另一个角度解决了负载均衡问题:它让每个专家主动选择固定 数量的 token 进行处理,从而天然地实现了完美的计算负载均衡。这种机制对 于简化 LLM 训练中的负载管理、保证所有专家得到同等强度的训练具有显著 优势,但也需要处理 token 可能被多个专家选中或不被任何专家选中的新问 题。 3) 系统级与动态自适应负载均衡:近期的研究趋势是将 MoE LLM 的负载均衡视 为一个需要算法与系统协同优化的系统级问题,并强调动态自适应能力。在此 趋势下,研究者们探索了多种先进的动态算法。斯坦福大学联合 OpenAI 的工作人员提出的 SwiftMoE 等工作探索了在训练过程中根据专家负载情况动态 复制“热门”专家或合并“冷门”专家的高效方法。华为团队提出的 EfficientMoE 则利用对未来负载的预测来进行动态的专家调度。更有研究如协作约束路由 (Collaborative Constrained Routing,C2R),通过分析 LLM 中不同专家间的协 作模式(哪些专家经常被同时激活处理相似的 token),来优化专家在分布式硬 件环境中的部署位置,以期最大限度地减少跨设备通信,从而间接改善因通信 瓶颈导致的实际负载不均。这些系统级支持与动态自适应算法的协同,是 MoE LLM 实现高效、稳定运行并智能管理其庞大专家资源的关键,进一步巩固了 MoE 作为 LLM 核心架构的地位。
4.2.3. 专家剪枝、合并与动态调整等技术致力于提升 MoE 模型的参数效率与部署 灵活性
除了优化路由和负载均衡机制外,直接对 MoE 大语言模型(LLM)中的专家集合 本身进行优化——例如移除冗余或贡献较小的专家、合并功能相似的专家,或在 训练及推理过程中动态地调整专家数量或其内部结构——也是提升模型效率、降 低部署成本的关键途径。这些技术的核心目标是在不显著牺牲 LLM 核心性能(如 知识容量和推理能力)的前提下,有效减小模型尺寸、降低实际计算与存储开销, 并增强模型对不同任务和资源环境的自适应能力,从而提升 MoE 架构作为 LLM 核心基石的整体参数效率与应用灵活性。
1) 专家剪枝(Expert Pruning):精简 MoE LLM 的专家团队。专家剪枝旨在识 别并移除 MoE LLM 中冗余或贡献较小的专家或其内部参数,以压缩模型、减 少计算量。例如,IBM 团队提出了一种基于路由器?2范数变化(change in router's ?2 norm)且具有理论保证的剪枝方法。其核心思想是,在模型针对下游任务 微调后,优先剪除那些路由权重相较于预训练模型变化较小的专家。该方法从 理论上证明了此举能够保留测试集准确率,同时显著降低模型大小和计算需 求,并成功在 V-MoE 等大型视觉 MoE 模型上进行了验证。另一项由港中大 多媒体实验室(MMlab)与上海人工智能实验室合作的代表性工作则首次系统 性地探索了 MoE LLM 中的专家级稀疏性,并提出了名为后训练专家剪枝 (Post-training Expert Pruning)的硬件友好方案。该方法通过在少量校准数据 上评估不同专家组合的重构损失(reconstruction loss),以逐层枚举的方式启发 式地搜索并永久移除贡献最小的专家。该研究还首次探讨了任务无关(taskagnostic)和任务相关(task-specific)的专家剪枝,实验表明,剪枝后的 Mixtral 8x7B 模型能显著减少内存占用并提升推理速度。此外,更激进的 LayerDrop 等技术通过移除整个 MoE 层或模块,也证明了 MoE LLM 因其较高冗余度而 对层剪枝具有更强的弹性。
2) 专家合并(Expert Merging):优化 MoE LLM 的专家结构与计算足迹。专家 合并技术旨在将功能相似或可以互补的多个专家融合成数量更少或结构更优 的专家,以减少 LLM 的总参数数量和实际计算需求。近期的研究趋势主要分 为两大类:一是构建持久化的统一 MoE 模型,二是进行动态的推理时优化。 在构建统一模型方面,Meta FAIR 团队提出的 Branch-Train-Mix(BTX)框架 是一个代表性工作。它通过“分支-训练-混合”三阶段流程,先并行地将一个 通用种子模型在多个专业领域(如代码、数学)上训练成独立的专家模型,再 将这些专家的前馈网络(FFN)作为新 MoE 模型的专家库,并将其余参数(如 自注意力层(Self-Attension Layer))进行平均合并,最后通过少量微调来学习 路由策略。然而,简单的参数平均会遭遇参数干扰(parameter interference)问 题。为此,后续工作如马里兰大学和亚马逊联合构建的MergeME框架则提出, 在合并非 FFN 层时采用更先进的 DARE 或 TIES 等算法来代替简单的平均法, 通过智能地修剪和缩放任务向量来减少参数冲突,从而更好地保留各专家的 能力,并减少后续微调的计算开销。而在动态推理优化方面,MEO(Merging Experts into One)则另辟蹊径,它并非创建固定的新专家,而是在推理时动态 地将多个被激活的专家压缩成一个临时的“超级专家”,从而将多个专家的计 算成本降低到近似单个专家的水平,显著降低了运行时的 FLOPs。无论是离 线构建还是在线优化,这类技术的核心挑战都在于如何在合并专家的同时,最 大限度地保留原有专家集合的多样性和特化知识,避免对 LLM 的综合能力造 成较大损害。
3) 专家动态调整(Dynamic Expert Adjustment):赋予 MoE LLM 自适应的专 家管理能力。动态调整技术允许 MoE LLM 在训练或推理过程中根据实际需 求和环境条件,自动改变专家的数量或配置,从而实现更高级别的自适应性。 例如,香港中文大学(深圳)和腾讯 AI 实验室联合提出的 DynMoE 包含一种 新颖的门控机制,不仅能够为每个 token 自动确定激活的专家数量,还带有一 个自适应过程,可以在训练期间根据专家利用率等指标自动调整专家总数,例 如通过跟踪未被路由的 token 来初始化新的专家,或移除利用率过低的专家。 这种动态调整机制有望消除为 MoE LLM 手动调整专家数量和 Top-k 等超参 数的繁琐过程,并使得 LLM 能够在激活较少参数的情况下达到有竞争力的性 能,从而更好地适应动态变化的输入数据和任务需求。 这些针对专家集合本身的优化技术,从减少冗余、整合功能到动态调整等多个层 面,共同推动 MoE LLM 向更高效、更紧凑、更智能的方向发展,是提升其作为 核心架构的参数利用率和环境适应性的重要研究方向。
4.2.4. 高效训练与推理框架的全面支持,为 MoE 模型的规模化与实用化铺平了道 路
训练和部署参数规模庞大的 MoE 大语言模型(LLM)面临着独特的系统级挑战, 包括管理分布式部署的众多专家、高昂的 All-to-All 通信开销、海量参数的内存管 理以及在多设备/节点上实现高效并行化等。为了应对这些挑战,学术界和产业界 开发了一系列专门的软件框架和系统级优化技术。这些框架与优化技术的出现和 不断演进,为 MoE LLM 的规模化训练和高效、经济的实际部署提供了关键的系 统级支撑,是推动 MoE 架构从理论走向广泛应用、夯实其作为 LLM 核心基石地 位的重要保障。
4.2.4.1. DeepSpeed、Megatron 等主流 AI 计算框架已提供对 MoE 的全面优化与支 持
为了降低开发和部署 MoE LLM 的门槛,主流的大规模 AI 计算框架均提供了对 MoE 架构的专门支持。 DeepSpeed-MoE 作为微软 DeepSpeed 库的一部分,通过其强大的 ZeRO 优化器(对 模型参数、梯度和优化器状态进行分区以降低内存冗余)和灵活的混合并行策略 (支持专家并行、张量并行、流水线并行和数据并行的组合),为大规模 MoE LLM 的训练和推理提供了卓越的效率和可扩展性。它还集成了动态负载均衡、内存优 化(如激活检查点、参数卸载至 CPU)以及高效通信等功能,构成了一套完整的 MoE 解决方案。 NVIDIA Megatron-Core 是一个专为在数千个 GPU 上进行大规模模型训练而设计 的开源库,对 MoE 也提供了丰富的支持。它不仅支持灵活的并行策略组合,还提 供了多种路由与负载均衡算法选项(如 Sinkhorn、辅助损失、Z-loss),以及 token 分发机制(有/无token丢弃)的配置。其独特的MoE并行折叠(MoE Parallel Folding) 优化,通过解耦 MoE 层与稠密计算层的并行配置,能够显著提升模型浮点运算利 用率(MFU)和训练效率。
Colossal-AI 作为一个集成化的大规模深度学习系统,同样提供了 MoE 并行支持, 并能够与数据并行、多种张量并行和流水线并行相结合。它提供了易于使用的 MoE 组件,并通过 All-to-All 通信在 MoE 张量组内交换 token,同时支持多种分 布式优化器和梯度裁剪功能。 专注于 LLM 推理和服务的工具包与库 vLLM 也对 MoE 模型的推理提供了支持, 并针对 AMD ROCm 等硬件平台进行了优化,能够高效服务于 Mixtral、DeepSeekMoE 等主流开源 MoE LLM。这些主流框架的共同特点是,它们都致力于通过系 统级优化,解决 MoE LLM 在内存、计算和通信方面的核心瓶颈,从而使其训练 和部署更具可行性和经济性。
4.2.4.2. 学术界与产业界正通过系统级创新,积极探索解决 MoE 特定通信与内存 瓶颈的方案
除了上述主流框架的通用支持外,研究者们还针对 MoE 的特定瓶颈(特别是通信 和内存)提出了许多新颖的系统级优化方案。 在通信优化方面,为了降低专家并行中昂贵的 All-to-All 通信开销,涌现了多种创 新策略。例如,华为团队推出的 Speculative MoE(s-MoE)通过预测 token 的路由 路径并预先调度 token 和专家,来重叠计算与通信,从而减少通信延迟。北大团队 的 NetMoE 则利用同一训练样本内 token 路由的局部性,通过动态调整样本在设 备间的放置来最小化通信成本;该团队与字节跳动合作提出的 LSH-MoE 利用局 部敏感哈希(LSH)对相似 token 进行聚类,在 All-to-All 通信中仅传输聚类中心, 从而大幅减少通信量。 在内存与推理优化方面(尤其针对资源受限场景),相关研究也取得了诸多进展。MoESys 系统由百度和中科大团队联合设计,提出了弹性 MoE 训练策略,采用 2D 预取和分层存储上的融合通信,并在推理时为大于 GPU 显存的模型构建 CPUGPU 内存的环形分区加载方案。MoE-Infinity(爱丁堡团队开发)则专注于在资源 受限的 GPU 环境(如单 GPU)中服务 MoE LLM,通过将不活跃的专家卸载到主 机内存,并利用专家激活追踪、激活感知的专家预取和缓存等技术来最小化卸载 开销。微软的 Pre-gated MoE 是一种创新的算法-系统协同设计,其核心思想是在 计算第 N 层时,提前预测并开始从 CPU 向 GPU 预加载第 N+1 层将要激活的专家 参数,从而将数据迁移延迟与当前层的计算执行重叠起来,在单 GPU 上实现低内 存消耗和高性能的 MoE LLM 推理。这些针对特定瓶颈的系统级优化,极大地拓 展了 MoE LLM 在不同硬件条件和资源预算下的应用可能性,是推动其走向更广 泛、更普适应用的关键。

4.2.5. 软硬件协同设计通过跨层优化,致力于从物理层面释放 MoE 架构的全部潜 能
MoE 大语言模型(LLM)的成功,不仅依赖于算法层面的创新,更离不开底层硬 件与系统级优化的强大支撑。MoE 架构对内存容量、通信带宽和稀疏计算效率的 独特需求,正驱动着 AI 芯片、通信基础设施和系统框架的协同进化。一个高效的、 为 MoE 量身定制的软硬件生态,是克服其固有瓶颈、将其巨大的理论模型容量转 化为真实世界智能的关键,是夯实 MoE 作为 LLM 核心架构物理基石的必要条件。
4.2.5.1.新一代 TPU 等专用硬件加速器正朝着为 MoE 计算与内存模式量身定制的 方向演进
为了应对 MoE LLM 在训练和推理中面临的巨大计算与数据移动挑战,业界正在 开发专门优化的硬件加速器。 1) TPU 的持续迭代:以专为推理设计的 Google Ironwood TPU 为例,新一代 TPU 在架构层面充分考虑了 MoE 等复杂模型的计算与通信需求。其增强的 SparseCore 旨在高效处理与 MoE 门控及专家输入相关的超大规模嵌入表;大 幅增加的高带宽内存(HBM)容量(每芯片 192GB)与带宽(每芯片 7.37 TB/s), 直接满足了 MoE 模型加载海量专家参数的需求;而增强的芯片间互连(ICI) 带宽(1.2 TB/s 双向),则为大规模专家并行提供了高速、低延迟的通信保障。结合其 Pathways 软件栈,TPU Pod 能够在高达 9216 个芯片的集群规模上,通 过协调同步的通信执行分布式推理,旨在最小化数据移动延迟,高效执行大规 模张量操作。 2) 面向边缘场景的 FPGA 加速器探索:除了数据中心级硬件,学术界也在探索 面向边缘设备的 MoE 加速方案。例如,佐治亚理工学院团队设计的 Edge-MoE 是一个专为采用 MoE 的多任务视觉 Transformer(ViT)设计的端到端 FPGA 加速器。它通过新颖的自注意力重排序机制、快速单遍 softmax 近似、低成本 高精度 GELU 近似、统一计算单元以及图像块重排序等一系列创新,旨在消 除内存访问开销,实现高能效的 MoE 模型推理。与 GPU 和 CPU 相比,其能 效分别提升了 2.24 倍和 4.90 倍,展示了在资源受限环境下部署 MoE 模型的 潜力。
4.2.5.2. 高效通信硬件与系统级优化算法相结合,共同致力于攻克 All-to-All 的效 率难题
专家并行策略中昂贵的 All-to-All 通信是制约 MoE LLM 扩展性的主要瓶颈。高效 的通信基础设施是解决该问题的第一步,而其上的算法与系统级优化则是关键。 1) 硬件层面的基础支持:高效的 All-to-All通信原语是专家并行得以实现的基础。 具备高带宽、低延迟互连能力的硬件,如 TPU 的 ICI 网络和 NVIDIA 的 NVLink, 为在不同计算单元间快速分发 token 和聚合专家输出提供了物理保障。 2) 软硬件协同的通信优化策略:仅有硬件支持尚不足以完全解决通信瓶颈,因 此涌现了多种旨在减少通信量的系统级优化方法。例如,NetMoE 通过对训练 样本进行动态布局重排,将通信问题建模为整数线性规划问题并求解,以最小 化跨节点的 All-to-All 通信。LSH-MoE 则利用局部敏感哈希(LSH)对相似的 token 进行聚类,在通信时仅传输聚类中心,从而大幅压缩通信数据量。这些 方法的有效性,既依赖于底层硬件对剩余通信的高效执行,也受益于能够快速 完成其辅助计算(如哈希、求解规划问题)的硬件能力。
4.2.5.3. 算法、系统与硬件的跨层深度协同设计,是实现 MoE 整体性能最优的关 键路径
MoE 架构优化的最高境界,在于实现算法、系统和硬件层面的深度协同设计,通 过跨层联合优化来突破单一层面优化的局限。微软团队提出的 Pre-gated MoE 是 这一理念的典型案例。它首先在算法层面进行修改:在计算第 N 层时,引入一个 轻量级的预门控函数,提前预测并确定第 N+1 层需要激活的专家。这一算法上的 调整,使得在系统层面可以实现颠覆性的优化:将从 CPU 向 GPU 加载下一层专 家参数的过程,与当前层在 GPU 上的计算过程完全重叠。这种协同设计,最终使 得在内存容量有限的单个 GPU 上高效推理大规模 MoE LLM 成为可能,有效解决 了 MoE 部署的核心痛点之一。与纯 GPU 方案相比,该设计使峰值 GPU 内存占用 降低了 4.2 倍,而推理延迟仅增加了 23%。
4.2.6. 模型压缩技术在 MoE 中的应用,旨在实现模型“小”与“快”的同时保持 其“专”与“博”
尽管混合专家(MoE)大语言模型(LLM)通过稀疏激活有效控制了单次前向传 播的计算量,但其巨大的总参数量带来了庞大的存储开销和内存占用,对模型的 实际部署构成了严峻挑战。因此,应用模型压缩技术,如量化、知识蒸馏和剪枝 等,对于平衡 MoE LLM 的模型质量与运行效率至关重要。然而,将这些技术应 用于 MoE 架构时,必须应对其特有的挑战,核心在于如何在实现模型“小”与 “快”的同时,不损害其赖以成功的专家特化性(“专”)和知识广度(“博”),特 别是要维护专家特化性(Expert Specialization)和路由保真度(Routing Fidelity)。
4.2.6.1.MoE 感知的量化技术旨在通过混合精度等策略,在低精度世界中有效保留 专家智慧
量化技术旨在通过降低权重和/或激活值的数值精度来减小模型尺寸并加速计算, 是提升 MoE LLM 部署效率的直接手段。 1) MiLo(Mixture of Low-rank compensators):UIUC 团队提出来该方法专为应 对 MoE 模型的极端量化(如低于 4-bit)场景。其核心思想是,在量化造成精 度损失后,通过引入一个低秩补偿器来恢复模型性能。MiLo 采用量化-补偿的 迭代优化过程,并能根据 MoE 模型的混合稠密-稀疏结构特性自适应地选择 补偿器的秩。此外,该工作还开发了对硬件(Tensor Core)友好的 3-bit 核函 数,以实现可测量的实际延迟加速。其优势在于无需校准数据即可有效恢复极 端量化带来的精度损失,具有良好的泛化能力。 2) MxMoE(Mixed-precision Quantization):为了给 MoE LLM 推导出一套最优 的混合精度量化配置,上海交大与上海人工智能实验室联合推出了该框架。它 将位宽分配问题建模为一个整数线性规划(ILP)问题,综合考虑模型各部分 的参数敏感性、专家的激活动态以及硬件资源限制,从而为不同层或专家分配 合适的位宽。MxMoE 还能自动生成优化的混合精度 Group-GEMM 核函数, 支持不同精度 GEMM 在硬件上的高效并行执行。其优势在于能够比均匀量化 策略在同等模型质量下实现更优的加速效果,充分挖掘硬件潜力。
4.2.6.2.知识蒸馏策略被应用于 MoE 模型压缩与专家间知识增强,以实现高效迁移 与内部协同
知识蒸馏通过让一个小型“学生”模型学习一个大型“教师”模型的输出来迁移 知识,是获得轻量化、高性能模型的有效途径。在 MoE 领域,蒸馏策略不仅用于 模型压缩,也用于增强 MoE 模型内部的知识协同。 1) 跨模型蒸馏(LLaVA-MoD):来自阿里集团的工作探索了如何将一个大型多 模态语言模型(l-MLLM)的知识高效地蒸馏到一个基于 MoE 架构的小型学 生模型(s-MLLM)中。它将稀疏 MoE 结构集成到学生模型的语言模型部分,并采用一种渐进式知识迁移策略:首先进行模拟蒸馏(最小化师生模型输出分 布的 KL 散度),然后进行偏好蒸馏(将教师模型作为偏好优化(PO)的参考 模型)。实验证明,这种方法能让学生模型以更少的参数和数据超越更大的模 型,对通用知识和特定知识(如幻觉缓解)的迁移均有效。 2) 专家间相互蒸馏(MoDE):蚂蚁集团提出的方法则着眼于改善 MoE 模型内部 的知识共享。它在 MoE 的专家之间应用适度的相互蒸馏,让每个专家能够学 习其他同行的特征表示,从而解决单个专家因只处理部分数据而导致的视野 狭窄问题。其机制是在主任务损失之外,额外添加一个专家间的蒸馏损失项 (如均方误差)。这种内部增强策略有助于提升单个专家在其主导任务域上的 性能、增强门控网络的路由准确性,并最终改善整个 MoE LLM 的泛化能力。
4.2.6.3. 专家剪枝与分解是实现 MoE 模型压缩的核心手段,旨在精确剔除参数冗 余
如前文 4.2.3 节已详细论述,专家剪枝、合并与分解本身亦是实现 MoE 模型压缩 的核心手段。例如,最新的研究通过追踪路由器?2范数的变化或最小化重构损失 等更根本的指标,来为专家重要性提供量化依据,从而精确地移除冗余专家。MEO (Merging Experts into One)等方法则探索如何将多个专家的功能合并,以降低计 算成本。研究表明,由于其结构特性,MoE 模型通常比稠密模型具有更高的参数 冗余度,因此对 LayerDrop 这类激进的剪枝方法也表现出更强的弹性。然而,这 些技术面临的核心挑战始终是如何精确地区分出真正的参数冗余与有价值的、不 可替代的特化知识,避免在压缩过程中对模型的核心能力造成永久性损害。

-
标签
- AI
- 热门文档
- 热门文章
- 本年热门
- 本季热门
- 本月热门
- 1 关于2025年国民经济和社会发展计划执行情况与2026年国民经济和社会发展计划草案的报告——2026年3月5日在第十四届全国人民.pdf
- 2 中国网络视听协会:中国网络视听发展研究报告(2026) .pdf
- 3 市场监管局:2025直播电商行业发展白皮书.pdf
- 4 房地产行业第8_9周周报(2026年2月14日_2026年2月27日):26年春节新房成交量低于23_25年,二手房成交量高于23_25年;上海优化限购、公积金和房产税政策.pdf
- 5 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 6 中国股票策略:中国最佳商业模式研究(第二版).pdf
- 7 互联网行业:第57次中国互联网络发展状况统计报告.pdf
- 8 2026年政府工作报告.pdf
- 9 中国2026年展望:探索新动能.pdf
- 10 2025中国新就业形态报告.pdf
- 1 中国新就业形态研究中心-2025中国蓝领群体就业研究报告.pdf
- 2 腾讯研究院-从超级个体到超级团队:AI时代组织变革的涌现路径.pdf
- 3 兰花科创-600123-优质无烟煤龙头,煤化一体静待周期反转与技改红利释放.pdf
- 4 机械设备行业:拥抱科技,重视AI为主线的设备及硬件等投资机会.pdf
- 5 TGV玻璃基板行业动态报告:玻璃基板崛起,赋能先进封装.pdf
- 6 电力设备行业跟踪周报:锂电储能业绩亮眼、拓展AI第二增长曲线.pdf
- 7 玻璃基封装行业专题:玻璃基板有望成为先进封装新平台.pdf
- 8 投资策略-激光通信行业深度:行业现状、终端结构、市场规模及相关公司深度梳理.pdf
- 9 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 10 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 1 锐翔智能-920178-北交所首次覆盖报告:FPC整线“小巨人”深度绑定头部客户,向光模块固晶机设备延伸成长边界.pdf
- 2 纺服行业周报:运动品牌Q2流水放缓,安踏、361度表现韧性强.pdf
- 3 产业深度:生根与重构——2026年全球人工智能技术、政策、产业与投融资趋势全景洞察报告.pdf
- 4 房地产行业专题报告:城市更新推动高质量发展.pdf
- 5 千瓜数据-消费行业:2026年上半年热门行业数据简报.pdf
- 6 AI医疗行业2026年6月月报:AI诊断与药研资本化提速,医疗智能体加速落地.pdf
- 7 厄尔尼诺如何影响资产价格:气候风险传导、历史复盘与2026年展望.pdf
- 8 投资策略:这一次,是金银的拐点吗?.pdf
- 9 风电行业2026年中期策略报告:短期招标承压,看好“十五五”两海成长空间.pdf
- 10 宏观专题:俄乌冲突最新进展如何?.pdf
- 本年热门
- 本季热门
- 本月热门
- 1 2026年莱特光电公司深度报告:“一核双擎”打造中国电子材料领军企业
- 2 2025年医药行业2026年度策略报告:创新药产业链景气度持续提升
- 3 2026年大族激光公司研究报告:PCB消费电子利好有望助力2025_27年盈利持续增长
- 4 2026年分众传媒公司深度报告:基本盘稳固,格局优化+“碰一碰”开启成长新周期
- 5 2026年春季港股及海外中资股投资策略:分化与回归
- 6 2026年航空行业夏航季民航时刻计划详解:稳中求进,国内控总量、国际促复苏
- 7 2026年春季A股投资策略:为第二阶段上涨蓄力,时代资产不退场
- 8 2026年中银香港公司研究报告:高股息护航,财富与出海共促成长
- 9 2026年春季北交所化工新材料行业投资策略:周期迎拐点,成长正当时
- 10 2026年固收增厚产品系列报告之一:可转债基金的再定位与再解析
- 1 2026年6月人形机器人行业月报:资本化提速与量产渐近
- 2 2026年全球人工智能技术、政策、产业与投融资趋势全景洞察
- 3 2026年6月A股市场研判:AI引领向上,聚焦算力与景气延伸
- 4 2026 AI重塑影视产业:漫剧爆发与产业链重构深度解析
- 5 2026年7月A股量化择时:AI识图聚焦半导体与芯片赛道
- 6 氧化锆断供与HBM瓶颈:全球产业趋势跟踪周报(2026年6月29日)
- 7 2026 ASCO年会国产创新药双抗ADC临床数据梳理
- 8 2026年中期医药生物行业投资策略:AI新药加速推进
- 9 A股2026年6月策略:景气强化与震荡上行配置建议
- 10 宁德时代发布钠电储能方案,7月中国电池排产环比增长
- 1 2026年上半年小红书六大热门行业消费趋势洞察
- 2 2026年8月A股策略:否极泰来蓄势进攻,科技修复与业绩高增方向并重
- 3 2026年7月A股回调归因与底部布局策略分析
- 4 2026上半年小红书六大热门行业消费数据洞察
- 5 2026年A股中报业绩预告点评:全A盈利延续改善,结构性景气主导
- 6 2026年8月A股静态指标:资产联动回撤与市场情绪降温下的反攻酝酿
- 7 2026年8月煤炭行业:旺季需求带动去库,煤价上行动力渐强
- 8 2026上半年国内AI剧漫剧行业数据报告
- 9 2026年8月投资组合报告:从极致抱团到均衡修复
- 10 2026年7月费城半导体回撤超20%:2024年调整周期复盘与跨市场启示
