dLLM 正以其效率与功能优势,在代码生成等赛道率先开 启商业化。
1. dLLM 的并行范式,正推动评估标准从传统指标向任务导向与新能 力衡量偏移
dLLM 的出现,不仅带来了新的技术范式,也对传统的语言模型评测体系提出了 挑战。如何科学、公正地衡量一个并行迭代模型的优劣,是一个重要议题。 传统的语言建模核心指标,困惑度(Perplexity,PPL),在评估 dLLM 时面临着 理论与实践的双重困境。理论上,dLLM 的训练目标是优化一个证据下界(ELBO), 而非精确的对数似然,因此其计算出的 PPL 是一个理论上的上限,这使得 dLLM 与 AR 模型在 PPL 上的直接数值比较并非完全公平。实践中,正如英伟达团队的 研究所揭示的,32 位浮点数下的 Gumbel 采样存在“数值陷阱”,会无意中降低生 成多样性从而人为地压低困惑度分数,这进一步说明单纯依赖困惑度可能会对 dLLM 的真实能力产生误判。 鉴于 PPL 的局限性,业界正日益转向以任务为导向的基准测试和人类偏好评估, 以衡量 dLLM 的真实应用价值。一方面,下游任务基准(如 HumanEval、MBPP 等)通过实际的代码编译和单元测试来评判生成结果的正确性,标准客观,更能 反映模型的真实能力。另一方面,人类偏好对战平台(如 Copilot Arena)则通过 真人盲测和偏好投票,为 dLLM 提供了与主流 AR 速度优化模型进行实战检验的 机会,这类评估超越了自动化指标,直接衡量了模型生成结果对人类用户的实际 价值。 传统评测体系难以捕捉 dLLM 展现出的许多独特优势,呼唤着全新评测标准的建 立。例如,如何量化评估一次代码重构的优劣、如何衡量模型在数学推理中的自 我修正能力、以及如何为受控生成(如风格迁移、内容填充)的精准度打分,这 些都是当前评测体系中的空白。为这些新能力设计全新的、有针对性的评测标准, 是一个重要的研究方向。
2. dLLM 的性能质量在中小规模下可与同等参数 AR 模型媲美,但绝 对高度尚待验证
在生成结果的质量和准确性方面,dLLM 经过近期的发展,已经展现出与 AR 模 型在同等规模下竞争的实力。在学术基准上,LLaDA-8B 在多个零样本/少样本任 务中的性能,已被证明足以与强大的开源 AR 模型 LLaMA3-8B 旗鼓相当;在更 严格的概率指标上,以 SEDD 为代表的理论模型,其语言模型困惑度也已能达到 GPT-2 的同级水平,这说明 dLLM 已攻克了此前非自回归路线在核心精度上的瓶 颈。在工业评测中,Mercury Coder 在保持极高速度的同时,代码生成质量可与 GPT-4o Mini、Claude 3.5 Haiku 等模型媲美;而 Google 的 Gemini Diffusion 同样 在代码基准上实现了与自家速度优化模型 Gemini 2.0 Flash-Lite 相当的性能;来自 苹果公司的开源研究模型 DiffuCoder,同样在多个代码基准上展现了与开源 AR 代码模型(如 Qwen2.5-Coder)相当的性能。这些事实共同传递出一个信息,dLLM 已经走出质量不如人的初级阶段,进入了可以正面比拼的竞赛场。 在绝对性能的上限上,dLLM 与业界主流大规模 AR 模型之间仍存在显著差距。 例如,在通用常识问答、开放创意写作等复杂任务上,像 Qwen3 或 DeepSeek-V3 这样经 RLHF 调校、拥有数千亿乃至万亿级参数的 AR 模型展现出难以企及的综 合能力。相较之下,当前公开的 dLLM 最大参数规模仍停留在百亿以下,其在超 大规模下的能力上限,以及能否通过大规模类 RLHF 等方法实现同等级别的对齐, 仍有待验证。这部分差距不仅是模型规模和数据量的差异,也可能源于 AR 模型 在 RLHF 对齐技术生态上的高成熟度。经过多年的发展,针对 AR 模型的对齐技 术(如 DPO 等)已相当成熟,而针对 dLLM 的对齐算法(如 VRPO)仍处于早期 探索阶段。
若跳出传统评估维度,dLLM 在某些特定任务上已展现出独特质量优势。 1) 逻辑与结构化任务:由于 dLLM 具备双向注意力,能看到全局上下文,这使 其在需要瞻前顾后的任务中表现更佳。例如,LLaDA 能有效应对“逆转诅咒”,在中文古诗词反向补全任务中表现优于 GPT-4o。同样,Gemini Diffusion 在演 示中展现的数学解题能力,也得益于其能够对解题步骤进行迭代求精和自我 修正,这是严格单向的 AR 模型难以做到的。然而,这种“并行修正”的机制, 是否能真正复现主流 AR 模型那种线性展开、自我辩驳的复杂推理过程,仍是 一个开放性问题。 2) 可控生成与编辑:dLLM 的掩码-预测机制天然适合需要精确控制的生成任务。 例如,Mercury Coder在代码填充任务中展现了超越同类AR模型的卓越性能, 模型能够根据代码的前文和后文精准生成中间部分,这是 AR 模型难以高效 实现的。 3) 多模态融合能力:MMaDA 的统一扩散架构,通过在同一个概率空间中对文本 和图像进行建模,在需要深度图文融合的推理和生成任务上,取得了超越众多 专用模型的表现。 因此,当我们谈论模型质量时,除了传统的流畅度与准确性,dLLM 在可控生成、 结构化推理和多模态融合等维度上,正开辟出 AR 模型难以企及的新优势。 综合来看,目前 dLLM 的性能质量已经达到够用乃至称职的水准。随着技术演进 和规模提升,其有望在更高参数规模上继续缩小与最强 AR 模型的差距。在此过 程中,更关键的是发挥其独特优势,与 AR 模型形成互补,共同服务于更多元的 AI 应用场景。
3. 并行解码在颠覆推理延迟的同时,也带来了总计算量与长文本处理 的新挑战
推理效率和计算成本是 dLLM 相较于 AR 模型最核心的战略价值所在,但其优势 背后也伴随着新的技术挑战。 dLLM 最直观的长处,在于从根本上打破了 AR 模型的串行生成瓶颈。传统 AR 模型必须逐个 token 生成,其推理延迟与输出长度大致成线性关系,在追求实时 交互的应用中是不可接受的。dLLM 则将生成过程解耦为固定(且通常很少)轮 次的并行迭代,无论目标文本多长,理论上都可以在一个固定的迭代步数内完成。 这使得 dLLM 能够充分利用现代 GPU 的并行计算能力,将端到端的 Wall-clock Time 缩短一个数量级。例如,Mercury Coder 在 H100 上实现了超过 1000 tokens/ 秒的吞吐量 ,而 Google 的 Gemini Diffusion 同样宣称能达到 1479 tokens/秒的生 成速度,这对于 AR 模型而言是难以企及的。这种速度上的跃迁,直接转化为推 理成本和能耗的显著降低,为 dLLM 在代码助手、实时内容创作等对延迟敏感的 场景中赋予了决定性的竞争优势。然而,这种效率优势并非在所有场景下都成立。 dLLM 的生成时间由一个基本恒定的启动开销(即固定的迭代步数)主导,而 AR 模型则是严格的线性增长。这意味着在生成极短文本(如聊天中的一两个词)时, AR 模型可能凭借更低的总计算延迟拔得头筹。 dLLM 还提供了一种 AR 模型不具备的灵活的计算与质量动态权衡能力。开发者 可以根据应用场景,自由调整扩散模型的采样迭代步数。在需要快速响应的场景, 可使用较少步数(如 8-16 步)快速获得足够好的结果;而在追求最高质量的离线 任务中,则可增加迭代步数来进一步精炼输出。如 SEDD 等研究明确展示,dLLM 的生成质量(以困惑度衡量)与其迭代步数(即计算量)之间存在着平滑、可预 测的权衡曲线。这种“丰俭由人”的特性,为开发者在实际部署中优化成本和用 户体验提供了宝贵的控制手段。

dLLM 同样面临着不容忽视的总计算量与工程挑战。 1) 总计算量(FLOPs)的挑战:并行解码的代价是,在每一轮迭代中,模型都需 要对整个序列进行一次完整的 Transformer 前向计算。这意味着 N 轮迭代的总 计算量(FLOPs)约等于完整序列计算量的 N 倍。因此,dLLM 虽然快,但并 不省算力,其效率优势高度依赖更先进的采样算法(如 RADD 的缓存机制和 英伟达团队的 FHS 采样器)来降低总计算次数。 2) KV 缓存不兼容的致命伤:正如英伟达团队的研究所指出的,dLLM 所依赖的 双向注意力机制,从根本上无法兼容 KV 缓存这一 AR 模型的关键优化。这意 味着在处理长上下文时,dLLM 每一步迭代的计算成本不会像 AR 模型那样得 益于 KV 缓存而大幅降低,这为其在超长文本任务上的扩展性带来了巨大挑 战。 3) 对高效工程实现的依赖:无论是 Mercury 的专有推理引擎,还是 Gemini Diffusion 背后的优化,都表明 dLLM 的高效并非唾手可得,它高度依赖于包 括动态批处理、自定义计算核、高效缓存等在内的复杂系统工程优化。
4. 在功能和可用性层面,dLLM 与 AR 模型各具特色,体现出互补关 系
AR 模型经过多年的发展,在连贯性和渐进式生成方面有天然的强项,而 dLLM 则在可控性和全局一致性上展现出新优势。 在连贯性与顺序逻辑上,AR 模型具备天然优势。AR 模型按自然语言的顺序逐字 生成,仿佛人类说话一样,这使它非常善于保持上下文的连贯和逐步展开复杂逻 辑。这种顺序生成符合人类思维的线性过程,因此在讲故事、写文章等需要一步 步铺陈的任务中,AR 模型更容易生成结构合理、衔接紧密的内容。而 dLLM 因 为并行填充,输出的局部顺序并非严格由左至右依赖,其生成过程中缺少一个“从 头到尾”的构思过程。因此,有人担心 dLLM 会否在非常复杂的长篇章叙事上出 现整体结构不如 AR 严谨的情况。目前尚无证据表明 dLLM 在这方面存在明显问 题,但在极端长上下文或者需要渐次引入前提的推理任务中,AR 的逐步生成可能 更符合逻辑链条。 在可控性与编辑能力上,dLLM 则展现出颠覆性优势。由于 dLLM 使用掩码机制, 它天然支持在上下文中进行局部编辑和定制。具体体现在:
1) 填空式生成(In-filling):dLLM 可以在一个已有段落的中间插入合理的文本, 只需将插入位置用[MASK]标记,模型即可基于双向上下文进行填充。无论是 LLaDA 的演示,还是 Mercury Coder 在代码填充基准测试中的卓越表现,都 证明了这一强大能力。 2) 受控文本约束:如果希望生成结果包含某个词语或满足某种格式,dLLM 可以 将这些元素作为已确定部分输入,仅对剩余部分进行扩散生成,确保要求的元 素不变,这是 AR 模型难以实现的硬约束。 3) 纠错与重写:dLLM 非常适合对已有文本做改写或纠错,例如 Gemini Diffusion 演示的模型能够通过迭代求精自我修正数学解题步骤中的错误。AR 模型虽然 也能通过读入全文再重写来做到,但效率和一致性都不如 dLLM 直接对局部 进行操作来得自然。
在全局一致性上,dLLM 的并行机制有助于避免长程依赖问题。dLLM 的并行生 成意味着模型每一步都看到全局上下文,这有助于确保输出的整体一致性,例如 在长文中保持术语统一,或者在对话中保持风格一致。AR 模型有时会因长程依赖 衰减而自相矛盾,而 dLLM 通过多轮全局优化,可以减少这种不一致。例如,LLaDA 模型能够有效解决困扰许多 AR 模型的“逆转诅咒”问题,正是在需要全局、非 顺序性理解的任务中,其双向注意力机制优势的体现。可以说,dLLM 的架构没 有生成到此即定型的特性,在最后一步完成前,它始终拥有“回头看”并调整全 局的机会。 在流式生成与交互体验上,AR 模型目前更胜一筹。AR 模型可以像打字一样逐字 输出,让用户流式地看到内容生成过程,这在聊天互动中体验很好。dLLM 目前 通常是一次性输出整段,在出结果前用户需要等待所有步骤完成。虽然其总速度 快可以部分弥补,但缺少中间逐字的反馈可能在交互上稍逊一筹。 在训练与对齐生态的成熟度上,AR 模型暂时领先。从开发者角度看,AR 模型的 训练及对齐流程已非常成熟。而 dLLM 在对齐人类偏好上仍处于探索阶段。例如, LLaDA 1.5 和 MMaDA 等模型,不得不开创性地提出 VRPO 和 UniGRPO 等全新 算法,来解决 dLLM 在强化学习中的独特挑战,这本身就证明了该领域的对齐生 态远未成熟。 AR 和 dLLM 各有长短板。AR 模型胜在顺序逻辑清晰、已有丰富的对齐优化, 适合需要一步步推理的开放式任务;dLLM 强在并行全局规划、易于控制编辑, 适合需要满足特定约束的任务和需要快速多方案生成的场景。未来的 AI 应用生 态,很可能是两者根据任务需求协同工作,而非一方完全取代另一方。
5. dLLM 正以其独特优势,在代码生成、生命科学等多个领域展现出 巨大潜力
dLLM 独特的技术特性,并行解码、全局注意力和可控生成,决定了其应用潜力 远不止于通用的文本续写。它在多个对效率、精度和可控性有特殊要求的垂直赛 道中,正展现出独特的、有时甚至是超越 AR 模型的价值。 1) 代码生成、文本编辑与结构化写作:这是 dLLM 最先大放异彩的领域,其核 心优势在于对结构和约束的深刻理解与精准控制。在代码生成与重构方面, dLLM 的并行性显著提升了代码自动补全的效率(如 Mercury Coder),其代码 填充和编辑能力,则天然适用于代码重构、调试和添加新功能等复杂的软件工 程任务。在文本编辑与摘要领域,dLLM 的掩码-重写机制使其成为强大的文 本编辑器,例如 EdiText 框架可实现对文本风格、情感等属性的精准调整;而 TermDiffuSum 等模型则能利用其全局注意力,生成专业性更强的领域摘要。 在风格化与约束性写作中,PoetryDiffusion 等项目已证明其可联合控制诗歌的 语义和格律,生成满足特定要求的创意内容。 2) 知识理解与复杂推理:dLLM 的迭代求精机制,被认为是一种潜在的反思过 程,这使其在复杂推理任务中展现出新的可能性。例如,Diffusion-of-Thought (DoT)等研究表明,可将 dLLM 的迭代步骤与思维链的推理步骤相对应,模 型通过对初步推理路径的全局修正与完善,模拟动态的、可修正的思考过程。 而在知识图谱等领域,DiffuCOMET 等工作也已开始利用 dLLM 从文本中生 成和推理常识知识图谱。dLLM 的并行性允许模型一次性考虑多个相关实体 及其关系,可能比 AR 模型更适合处理图状的知识结构。 3) 多模态与物理世界交互:得益于其处理并行数据的能力,dLLM 在多模态和与物理世界交互的任务中潜力巨大。一方面,如 MMaDA 所示,dLLM 可以通 过统一的扩散框架处理文本、图像等多种模态,在图文理解和文生图等任务上 取得 SOTA 级表现。另一方面,DiffVLA 等研究将 dLLM 应用于自动驾驶的 规划任务,而 VPDD 则将其用于机器人的动作策略生成。dLLM 的并行性和 全局视野正好契合了智能体根据全局环境信息进行并行规划的需求。 4) 药物发现与分子设计:这是 dLLM 最具前瞻性的应用领域之一,有望极大加 速新药研发的进程。在新药研制中,dLLM 可以处理 SMILES 串等分子序列, 通过掩码扩散来生成大量新颖的分子变体,并且可以整体上调整分子的功能 基团,使其同时满足亲和力、毒性、溶解度等多个性质约束。GenMol 和 PepTune 等项目已在多属性分子优化和治疗性肽设计等方向上展示了dLLM的有效性。 在更复杂的蛋白质工程中,DPLM-2 等模型正致力于实现蛋白质序列和 3D 结 构的联合生成与理解,未来有望根据自然语言描述的功能需求,直接设计出全 新的蛋白质序列及其 3D 构型。 5) 情感分析与数据增强:除了复杂的生成和推理任务,dLLM 在传统 NLP 任务 中也展现了作为数据增强引擎的独特价值。例如,CDA²框架利用 dLLM 的编 辑能力生成反事实样本(如将正面评论中的关键词替换为负面词汇并生成通 顺的负面评论),为跨领域情感分析提供高质量的增强数据;而 DiffusionCLS 则直接利用 dLLM 为情感分类任务生成大量带有明确情感倾向的伪样本,有 效提升了小样本场景下的模型性能。这些研究表明,dLLM 的可控生成能力使 其成为一种强大的数据增强工具,有望在金融、电商、舆情分析等领域发挥重 要作用。
dLLM 凭借其独特的技术优势,正在从代码和文本编辑等领域开始,逐步渗透到 推理、多模态交互乃至生命科学等更深、更广阔的垂直赛道,其应用前景充满想 象力。