如何看待dLLM的出现?

如何看待dLLM的出现?

最佳答案 匿名用户编辑于2025/07/18 09:00

dLLM 的出现引发了业界对于技术路线的热烈讨论。一方面,它被寄望为打破 AR 模型垄断的潜力路径;但另一方面,也有声音质疑其内核的创新性。

1. 观点一:dLLM 是掩码生成模型的自然演进

持此观点的研究者认为,dLLM 并非凭空出现的新范式,其核心思想与双向掩码 模型一脉相承。他们主张,dLLM 本质上是掩码生成(Masked Generation)范式在 大模型时代的自然演进与规模化升级,是一次成功的“新瓶装旧酒”。

1.1. dLLM 的生成思想一脉相承,其根基是 BERT 的掩码预测与 MaskGIT 的迭 代求精

这一技术路线的源头可追溯至 2018 年 Google 发布的 BERT 模型。BERT 开创性 地提出了掩码语言建模(Masked Language Model,MLM)任务,通过随机遮盖输 入文本中 15%的 token,并利用其左右双向的全部上下文信息来预测被遮盖的内 容。这一机制使得模型能学习到深度的双向语境表示,但其设计初衷是服务于自 然语言理解任务,而非直接的文本生成。 将“掩码预测”思想真正推向生成任务的,是同样来自 Google 的图像生成模型 MaskGIT。它所采用的“并行解码、置信度筛选、迭代求精”的生成范式,在理念 上与后来的 dLLM 高度一致。可以说,dLLM 在文本领域的成功,正是 MaskGIT 范式的一次高效复现与规模化应用。 与此同时,对 dLLM 理论内核的探索并未停留在简单的应用层面,其与掩码模型 的内在联系很快催生了对其理论内核的建设性简化。在另一项同期工作 RADD (Reparameterized Absorbing Discrete Diffusion)中,同样来自中国人民大学的 GSAI-ML 组从理论上证明了,掩码扩散模型中的时间变量可以被解析地分离出来, 其核心预测任务等价于一个与时间无关的、对干净数据的条件概率建模。基于这 一发现,RADD 顺势提出了一个更简洁、且能通过缓存机制大幅提升采样效率的 优化框架。这一系列工作表明,dLLM 的本质可以被理解为一个经过概率化包装 的、可迭代优化的掩码模型,而其扩散外衣下的时间依赖性在理论上是可以被剥 离的。

1.2. 部分研究从理论、性能和实用性三大维度,对 dLLM 的创新性提出了三大质 疑

对 dLLM 更深层次的质疑,来自英伟达团队在 ICLR 2025 上发表的一篇题为 《Masked Diffusion Models are Secretly Time-Agnostic Masked Models and Exploit Inaccurate Categorical Sampling》的论文。论文的观点即为论文标题,掩码扩散模 型本质上是时间无关的掩码模型,其性能优势则利用了不准确的分类采样机制。 该研究从理论和实践层面,对 dLLM 的技术内核提出了三大质疑。 1) dLLM 的扩散理论的根基受到挑战,被证明在数学上等价于一个更简单的、 与时间无关的掩码模型。该研究从理论上严谨地证明,作为扩散模型“关键标 志”的时间变量(Time Variable),在掩码扩散模型(MDM)的训练和采样中 并非必要。论文指出,MDM 的训练目标在数学上等价于一个与时间无关的、 更简单的掩码模型的目标。其设计的首达采样器(First-Hitting Sampler,FHS) 也证明了,dLLM 看似复杂的迭代采样过程,在理论上等价于一个更高效的、 类似掩码模型的逐 token 解码过程。这直接挑战了 dLLM 自称“扩散”模型的 理论根基,暗示其更像是一个包装精良的掩码模型。 2) dLLM 宣称的性能优势被揭示可能源于数值精度 BUG,是以牺牲多样性为代 价换来的。该论文进一步揭露,先前研究声称 dLLM 在生成困惑度(Perplexity, PPL)上超越 AR 模型的结论,很可能源于一个普遍存在但被忽视的数值精度 BUG。在常用的 32 位浮点数下,Gumbel 采样会出现数值“截断”,这无意中 起到了降低采样温度的效果,导致模型倾向于选择更高概率的 token,从而牺 牲了生成多样性来换取异常低的困惑度分数。当英伟达团队将采样精度修正 为 64 位后,dLLM 的困惑度大幅反弹,显著落后于同等规模的 AR 模型。这 一发现表明,dLLM 此前宣称的性能优势可能并非来自模型或架构的优越性, 而是一个由数值问题导致的虚假繁荣。 3) dLLM 的双向注意力架构被指存在重大缺陷,无法兼容主流 AR 模型的 KV 缓存技术,对长文本推理的扩展性构成根本性制约。KV 缓存是当今所有主流 AR 大模型在处理长文本、实现高效推理时不可或缺的核心技术。无法使用 KV 缓存,意味着 dLLM 在处理长上下文任务时,其推理成本将远高于 AR 模型, 这为其在长文本任务上的实用化与规模化扩展,构成了根本性的制约。论文甚 至犀利地指出,这一点“在大多数关于扩散语言模型的研究中被忽视或被有意 淡化了”。 这一派观点认为,dLLM 并非一个全新的范式革新。其核心思想根植于 BERT 的 掩码建模,生成策略与 MaskGIT 同源。其所披的扩散外衣,在被深入解构后,显 示出时间无关的掩码模型本质。同时,其宣称的性能优势被证明可能源于数值陷 阱,而其架构本身则存在着难以兼容 KV 缓存的实用性缺陷。因此,这更像是一 次成功的“新瓶装旧酒”,但其双向注意力的设计可能天然不适合大规模长文本推 理的场景。

2. 观点二:dLLM 是并行生成时代的新范式

将 dLLM 简单归为“新瓶装旧酒”,忽视了其在理论完备性、实践规模化、高级 能力对齐和技术生态融合等方面的一系列根本性突破。支持者认为,扩散大型语 言模型(dLLM)的崛起,是生成式 AI 在并行计算时代一次意义重大的范式革新。 它不仅为长期停滞的非自回归生成路线注入了全新的理论合法性,更在短时间内 展现了从理论到实践、再到高级对齐和生态融合的快速演进速度。它代表了一条 充满活力且正在高速迭代的新技术路线。

2.1. dLLM 以完备的概率生成理论为基石,实现了从表示学习到可度量生成的根 本跨越

支持者认为,将 dLLM 简单归因于 BERT 的复兴,是混淆了表示学习与概率生成 两个根本不同的目标。BERT 通过掩码语言建模(MLM)学习深度双向语境表示, 在自然语言理解任务上取得了巨大成功。然而,BERT 的原始设计使其难以定义 一个完整序列的联合概率分布,因此也无法像真正的生成模型那样从中直接采样 出一条全新的、连贯的句子。这一根本性的“生成能力缺位”,解释了为何业界拥 有多年 BERT 的深厚积累,但最终仍需要 AR 模型或像 Gemini Diffusion 这样的新 架构来实现高质量生成。这正是 dLLM 与 BERT 的本质区别:前者是一个完整的 生成模型,而后者是一个卓越的编码器与理解模型。 以斯坦福大学 Stefano Ermon 等人提出的 SEDD(Score Entropy Discrete Diffusion) 为代表的理论工作,通过引入得分熵损失函数,为离散的掩码生成过程提供了可 计算的证据下界(ELBO)。这一理论突破是决定性的,它意味着 dLLM 的训练拥 有了和 AR 模型一样的度量衡,即对数似然。这使得 dLLM 彻底摆脱了之前的模 型无法评估生成质量好坏的困境,成为一个可以在语言模型困惑度等金标准上与 AR 模型直接比较的、理论完备的概率生成模型。

2.2. dLLM 的出现激发了与 AR 生态的融合探索,为高效模型构建开辟了混合范 式新路径

除了自身迭代,dLLM 的出现也激发了学界对于“混合范式”的全新思考。近期, 来自香港大学和 UIUC 合作团队的工作,探索了如何利用一个已经预训练好的强 大 AR 模型(如 LLaMA/GPT-2)的权重,来高效地初始化一个高性能的扩散模型 (DiffuLLaMA/DiffuGPT)。它表明 dLLM 与 AR 模型并非只能是“你死我活”的 竞争关系,二者完全可以互相借鉴、融合。dLLM 的出现,不仅开辟了一条并行的技术路线,更激发了盘活现有 AR 模型资产、探索更高效模型构建方式的新思 路,为整个生成式 AI 生态带来了新的可能性。 展望未来,dLLM 与 AR 模型最可能的关系是分工与互补,而非替代与颠覆。AR 模型凭借其成熟的生态和 KV 缓存等优势,将继续在通用长文本任务中占据核心 地位;而 dLLM 则以其极致的生成速度和可控性,在代码生成、创意辅助、文本 内嵌编辑等场景中,成为不可或缺的效率引擎和专用工具,共同构成一个更多元、 更繁荣的 AI 技术生态。

参考报告REPORT

扩散大语言模型(dLLM)开启并行新范式:大模型领域的重要技术路线试水.pdf

扩散大语言模型(dLLM)开启并行新范式:大模型领域的重要技术路线试水。扩散大语言模型(dLLM)采用并行生成新范式,其迭代求精与全局规划的独特机制,驱动下一阶段AI在代码生成、可控编辑等领域实现能力跃迁:面对日益增长的推理成本与速度要求,dLLM通过并行解码从根本上改变了当下流行的AR模型顺序解码token-by-token生成文本的模式,在同等生成质量的前提下,实现生成速度数倍提升。2025年以来,dLLM已从理论探索迅速走向产业实践:开源大模型领域,LLaDA率先在数十亿参数规模上验证了其与AR模型竞争的潜力,MMaDA则以统一架构展现了其在多模态领域的强大融合能力。商业化大模型领域,I...

我来回答
分享至