Files
xbtlin--ai-berkshire/reports/大模型技术/diffusion-LLM技术路线综述-与AR对比-20260706.md

13 KiB
Raw Permalink Blame History

扩散语言模型(diffusion LLM)技术路线综述:与自回归(AR)路线的对比

研究日期:2026-07-06 方法说明:本报告基于多路并行网络检索(5 个角度、23 个来源),对 25 条关键论断做了三票对抗验证(22 条确认、3 条被证伪并在文末列出)。所有结论截至 2026 年 7 月初;该领域月度级快速演进,结论有时效性。


一句话结论

扩散语言模型已经从学术玩具走到商业验证阶段(速度是真优势),但在综合能力上仍系统性落后于同规模自回归模型,且并行解码存在信息论层面的质量下界。短中期内两条路线是互补而非替代关系,"取代 AR 成为主流"目前缺乏证据支持——扩散路线的真实机会在极致低延迟推理、可调"质量-速度"权衡、生成中纠错和多约束规划这几个缝隙市场。


一、技术原理对比

自回归(AR)路线

从左到右逐个 token 生成,每个 token 以之前所有 token 为条件。这是 GPT、Claude、Gemini、DeepSeek 等所有主流大模型的路线。优点是完美建模了 token 之间的依赖关系(链式法则无损分解联合概率);缺点是生成本质上是串行的,速度受限于逐 token 解码,且写出去的 token 无法回头修改。

扩散(diffusion)路线

借鉴图像生成的思路:从全掩码(或噪声)状态出发,经过若干去噪步骤"由粗到细"地并行细化出整段文本,而非从左到右逐个生成。当前主流实现是掩码扩散语言模型(MDLM

一个重要的技术谱系认知:扩散语言模型在原理上与 BERT 式掩码语言建模直接相通。NeurIPS 2024 的 MDLM 论文证明,简化后的扩散训练目标(Rao-Blackwell 化)就是经典 MLM 损失的加权混合——可以粗略理解为"会迭代生成的 BERT"。这条路线的困惑度已接近 AR 模型(且扩散的困惑度是上界估计,实际可能更接近)。

核心机制差异

维度 自回归(AR 扩散(diffusion
生成方式 从左到右逐 token 全局并行、迭代去噪
依赖建模 完整(链式法则) 块内条件独立(有损)
纠错能力 写出即定,无法回改 生成过程中可修改已出内容
速度-质量权衡 基本固定 可通过去噪步数连续调节
推理优化生态 KV 缓存、投机解码等非常成熟 缺标准 KV 缓存,生态早期

二、优劣势实测:速度、质量、成本

速度:商业模型的优势是真的,但要打引号

  • Mercury CoderInception Labs):经第三方 Artificial Analysis 在 H100 上独立实测,Mini/Small 分别达 1109 / 737 tokens/秒;官方称对比约 200 tok/s 的速度优化型 AR 模型快约 5 倍。2026 年的 Mercury 2 实测 711-1196 tok/s,在 132 个模型中速度第一。(置信度:高,有第三方独立实测)
  • Gemini DiffusionGoogle DeepMind):官方自报 1479 tokens/秒(不含约 0.84 秒启动开销);独立上手实测约 857 tok/s。(注意:自报值)
  • 合理表述是"约 700-1500 tok/s、比速度优化型 AR 快 5-10 倍",而不是网上流传的"每秒数千 token"。

重要澄清(对抗验证中被证伪的流行说法):"扩散模型推理速度普遍显著快于 AR"这一说法被 3-0 否决。实际情况是:速度优势高度依赖工程和解码配置,开源扩散模型在缺标准 KV 缓存的情况下,通用场景中实际推理常常慢于 AR。商业模型的速度是"扩散架构 + 大量专有工程优化"的综合结果,不是架构本身的免费午餐。

质量:仍系统性落后,且有理论天花板

这是本次研究最重要的发现,两条证据链:

1. 大规模实证:58 基准评测(arXiv 2601.15593512 GPU 实证研究) 覆盖知识、数学、推理、语言理解、智能体、编程六大维度 58 个基准,评测 8 个主流掩码扩散模型(含 100B 参数的 LLaDA2-flash),结论:MDLM 仍系统性落后于同规模 AR 模型,主因是并行概率建模削弱了 token 间依赖关系。这是截至 2026 年中最全面的实证证据。

2. 信息论下界:并行解码的质量损失是架构性的,不是容量不足 块内并行解码假设 token 条件独立,由此产生的 KL 散度被"条件总相关(CTC)"从下方约束——即使模型学到每个位置的最优边缘分布也无法消除,且块越大误差下界越高。

实践中的直接后果非常说明问题:为达最高精度,当前最先进的扩散模型(OpenPangu-Diffusion、SDAR、Trado)实际采用块尺寸 4、每步只解一个 token 的保守配置——接近退化为自回归,等于放弃了并行性这个核心卖点。华为 openPangu 官方也只宣称最多 2.5 倍加速。

限定:该下界针对"块内一次性条件独立采样",先生成再编辑(Generate-then-Edit)类迭代修正解码理论上可以绕开,所以这是对"朴素并行解码"的判决,还不是对扩散路线的终审。

成本:训练侧没有定论,但有一条捷径

  • "扩散训练成本与 AR 基本持平"的说法在对抗验证中被 3-0 否决(依据的实验是玩具规模)。
  • 但有一条已验证的降本路径:用 AR 模型权重初始化扩散模型。Dream 7B 用 Qwen2.5-7B 权重初始化,只用 5800 亿 tokens(约为从零训练的 LLaDA 的 1/4 数据量)就全面超过了 LLaDA-8B,且有受控消融实验支持。这也意味着一个略带讽刺的事实:目前最强的开源扩散模型是"站在 AR 肩膀上"练出来的。
  • 推理成本:现有对比多为扩散阵营自报,在 AR 侧推理优化(KV 缓存、批处理、投机解码)全部拉满的公平对比下,扩散的单 token 成本优势还剩多少,缺乏中立研究。

扩散独有的两个真优势

  1. 多约束规划任务显著占优Dream 7B 在 Countdown 数字游戏上 16.0 对 Qwen2.5-7B 的 6.2、数独 81.0 对 21.0、行程规划 17.8 对 3.6,部分场景甚至超过大两个数量级的 DeepSeek-V3-671B。双向注意力 + 全局迭代细化在"需要同时满足多个约束"的任务上有结构性优势。(作者自报,任务高度结构化,置信度中等)
  2. 可调质量-速度权衡:通过去噪步数在速度和质量之间连续折中,AR 没有这个旋钮。
  3. (较弱证据)小规模受控实验显示扩散输出的结构多样性显著更高93.4% 对 3.3% 的唯一五词开头比例),且在数据受限场景下更不易过拟合——方向获 CMU 同行评审工作佐证,但实验是玩具规模,不可外推为范式级结论。

三、全球做得最好的团队盘点

第一梯队(商业验证)

1. Inception Labs(美国,斯坦福 Stefano Ermon 等创立)—— Mercury 系列 首个商业规模扩散 LLM。Mercury Coder 代码质量达到 GPT-4o Mini / Claude 3.5 Haiku 级(HumanEval 88-90、MBPP 77 左右),Copilot Arena 独立排名速度第一、质量第二。2026 年已迭代到 Mercury 2。这是目前扩散路线商业化最坚决、验证最充分的团队。

2. Google DeepMind —— Gemini Diffusion / DiffusionGemma 2025 年 5 月 I/O 发布,官方定位"最先进的实验性文本扩散模型"。注意:截至 2026 年 7 月,它仍然只是实验性演示,不是可调用的正式产品(开发者文档模型列表中没有它);但 DeepMind 已衍生出 DiffusionGemma,说明方向仍在推进。Google 是大厂中对这条路线下注最明确的。

第二梯队(开源与学术,中国团队为主力)

3. 蚂蚁集团 + 人民大学高瓴 —— LLaDA 系列(开源扩散路线的旗手)

  • LLaDA-8B2025 年初):首个证明"从零训练的 8B 扩散模型可与 LLaMA3-8B 相当"的工作。
  • LLaDA2.02025 年 12 月):业内首个 100B 参数量级扩散语言模型16B mini / 100B flashMoE 架构,100B 版激活约 61 亿参数),权重和训练代码已开源;自报推理 535 tok/s、比同级 AR 快约 2.1 倍。
  • dInfer2025 年 10 月开源):自称业界首个高性能扩散 LLM 推理框架,8 卡 H800 上自报比英伟达 Fast-dLLM 平均快 10.7 倍。
  • (注:LLaDA2.0 与 dInfer 的性能数字为蚂蚁自报,来自媒体报道,未经本次对抗验证流程独立核实。)

4. 香港大学 NLP 组 + 华为诺亚方舟实验室 —— Dream 7B 发布时最强开源扩散 LLM,通用/数学/代码全面超越 LLaDA-8B,可匹敌同规模顶级 AR 模型;其"AR 权重初始化 + 上下文自适应噪声重调度"是重要方法论贡献。

5. 华为 —— openPangu-Diffusion 7B 级扩散模型,官方宣称最多 2.5 倍加速;其保守解码配置(块尺寸 4)恰好成为"理论下界在实践中真实存在"的例证。

6. 其他值得关注:SDAR、Trado 等混合式(半自回归/块扩散)模型代表了两条路线融合的方向;学术奠基工作是 Cornell 等的 MDLMNeurIPS 2024)。

一个值得注意的格局特征:开源扩散 LLM 的主力几乎全是中国团队(蚂蚁、人大、港大、华为),美国的力量集中在闭源商业化(Inception Labs)和大厂实验(Google)。


四、能否取代 AR?判断框架

业界主流判断:互补而非替代

  • AR 继续主导:流畅性与连贯性优先的主流场景(对话、翻译、摘要、长文写作、复杂推理)。
  • 扩散的缝隙机会:极致低延迟推理(代码补全、实时交互)、需要在速度和质量间灵活折中的场景、多约束规划/结构化生成、需要多样性的生成(创意、数据增强)。
  • Gemini Diffusion 发布一年多仍停留在实验性演示,本身就是一个信号:连最有资源的下注者也还没把它推到生产级。

看多方的核心论据

  1. 商业模型已证明"GPT-4o Mini 级质量 + 5-10 倍速度"是可实现的组合,推理成本在 AI 应用大规模落地时代是核心竞争维度。
  2. AR 初始化把扩散模型的训练成本砍到 1/4,追赶曲线可能比想象中陡。
  3. 规划/纠错/多样性是 AR 的结构性弱点,不是工程可弥补的。
  4. 参数规模仍在快速爬坡(8B → 100B 只用了一年)。

看空方的核心论据

  1. 58 基准大规模评测显示质量差距是系统性的,且 100B 级仍未收敛。
  2. CTC 信息论下界意味着"并行度"和"质量"存在架构级的对偶:想要质量就得退化成准自回归,想要并行就得掉质量——目前最强的扩散模型全都选择了前者,等于自己承认了这一点。
  3. 速度优势严重依赖专有工程,开源模型在公平配置下常慢于 AR。
  4. 最强开源扩散模型靠 AR 权重初始化,说明这条路线尚未证明独立的规模定律。

关键观察指标(判断路线拐点用)

  1. 能否在块尺寸远大于 4 的真并行配置下,于前沿规模保持与 AR 相当的质量——这是唯一的胜负手。Generate-then-Edit 类迭代修正解码能否实用化绕开 CTC 下界,是核心技术悬念。
  2. 扩散 LLM 的规模定律是否成立:500B-1T 规模下与 AR 的差距是扩大还是缩小(目前无公开证据)。
  3. Google 是否将 Gemini Diffusion / DiffusionGemma 产品化开放 API。
  4. 中立第三方在 AR 推理优化拉满条件下的端到端成本对比。

我的综合判断

未来 2-3 年内,扩散路线不会取代 AR 成为主流,但会在低延迟推理市场(尤其代码补全、端侧、实时应用)拿下一块真实份额;更可能的终局是混合架构——块扩散、半自回归、AR 骨干 + 扩散加速头等融合方案(SDAR、Trado 已是雏形),而不是纯扩散对纯 AR 的路线胜利。对这条路线的正确态度:当作"推理加速技术 + 特定任务特化架构"来跟踪,而不是当作下一代范式来押注。


附录一:被对抗验证证伪的三个流行说法

流行说法 验证结果 实际情况
"扩散通过并行生成在推理速度上普遍显著优于 AR" 0-3 否决 速度优势高度依赖工程与解码配置;开源扩散模型缺 KV 缓存时常慢于 AR
"扩散训练成本与 AR 基本持平" 0-3 否决 依据实验为玩具规模,不足以支撑该结论
"Gemini Diffusion 质量与 Gemini 2.0 Flash-Lite 大体相当" 1-2 否决 官方自报基准,独立验证不足,不宜引用

附录二:主要参考来源

一手来源(论文/官方)

  • Mercury 技术报告:arXiv 2506.17298
  • 扩散语言模型综述:arXiv 2508.10875
  • Dream 7B 论文:arXiv 2508.15487
  • 58 基准大规模评测与 CTC 理论下界:arXiv 2601.15593
  • MDLMNeurIPS 2024):arXiv 2406.07524
  • AR 与 MDLM 受控对比:arXiv 2603.22075CMU 数据受限场景研究:arXiv 2507.15857
  • Gemini Diffusion 官方页:deepmind.google/models/gemini-diffusion
  • Inception Labs 官方博客:inceptionlabs.ai/blog/introducing-mercury

二手来源(媒体,主要覆盖中国团队进展)

  • IT之家:蚂蚁开源 LLaDA2.0(业内首个 100B 扩散语言模型)
  • 量子位:蚂蚁开源 dInfer 推理框架
  • The New StackMercury 2 实测报道