扩散语言模型崛起:DiffusionGemma实测速度碾压自回归模型

引言:语言模型的新范式之争
大语言模型(LLM)长期以来的主流架构,是基于Transformer的自回归(Autoregressive)生成方式——逐个token地预测下一个词。Transformer架构自2017年Google「Attention Is All You Need」论文发布以来,凭借多头自注意力机制(Multi-Head Self-Attention)彻底改变了NLP领域。自回归语言模型(如GPT系列)在此基础上引入因果掩码,使模型只能关注当前位置之前的token,从而实现左到右的顺序生成。然而,一场关于生成速度的对比测试,让扩散语言模型(Diffusion Language Model)再次成为社区热议的焦点。
一位Reddit用户对DiffusionGemma与Deepseek Flash进行了生成速度的横向对比,结果令其"完全震惊于扩散模型的速度之快"。这一实测反馈,重新点燃了业界关于语言模型底层生成范式的深层讨论。
自回归 vs 扩散:两种截然不同的生成哲学
自回归模型的固有速度瓶颈
以Deepseek、GPT系列为代表的自回归模型,采用严格的"从左到右"顺序生成。每生成一个token,都需要将前面所有token作为上下文重新输入模型进行前向计算。
从数学原理上看,自回归模型将联合概率P(x₁,x₂,...,xₙ)拆解为逐步条件概率的乘积(即链式法则:P(x₁,...,xₙ) = ∏P(xᵢ|x₁,...,xᵢ₋₁)),通过因果注意力掩码(Causal Attention Mask)确保每个token只能"看到"左侧的历史信息。这一设计在训练阶段可借助"teacher forcing"技术并行计算损失,但在推理阶段则必须严格串行执行——每步生成都依赖上一步的输出作为新的输入条件,形成不可打破的顺序依赖链。
这种机制生成质量稳定、逻辑连贯,但劣势同样明显:生成过程是串行的,无法并行。当输出文本较长时,token数量直接决定推理耗时,构成了自回归模型速度上的天然上限。
在工程层面,随着序列长度增加,KV Cache(键值缓存)占用线性增长,显存带宽成为制约速度的硬件天花板。KV Cache通过将已计算的Key、Value张量缓存到显存来避免重复计算——对于一个拥有32层、32头注意力的典型7B模型,每个token需约0.5MB显存存储KV Cache,生成1000个token则需额外约500MB显存。在大批量并发推理时,这一压力成为制约服务吞吐量的核心硬件瓶颈,也是FlashAttention、PagedAttention等工程优化技术相继涌现的直接动因。即便是标榜"Flash"(快速)的版本,本质上仍受制于这一逐token生成的架构约束。
扩散模型的并行生成优势
扩散模型的思路则完全不同。它借鉴图像生成领域(如Stable Diffusion)的成功经验,将文本生成视为一个"从噪声到清晰"的去噪过程。模型可以同时对整个序列的所有token进行并行预测与迭代优化,而非逐个输出。
扩散模型最初以DDPM(Denoising Diffusion Probabilistic Models,2020年)为代表在图像生成领域崛起,其核心思想是通过学习逆向去噪过程(Reverse Diffusion Process)从高斯噪声中逐步恢复数据。值得注意的是,将图像扩散迁移至文本并非易事。图像像素属于连续数据域,而文字token是离散的,无法直接进行连续插值。学界主要通过两条路径解决这一难题:一是在连续嵌入空间(Embedding Space)执行扩散过程(如Diffusion-LM),将token映射至连续嵌入向量后执行扩散,生成后再做最近邻解码;二是定义离散马尔可夫转移矩阵,直接在token空间进行掩码与替换操作(如D3PM、MDLM),前向过程为逐步掩码或随机替换token,反向过程学习预测被掩码的原始token。DiffusionGemma采用的离散扩散路径,正是近年来文本扩散模型取得质量突破的关键技术选择。
这正是DiffusionGemma速度惊人的核心原因——扩散模型通过固定的迭代步数(steps)完成生成,其计算模式更接近图像生成中的批处理推理,能够充分利用GPU的并行计算能力。且这些步数与输出长度并不呈线性正相关,换言之,无论输出100个token还是500个token,扩散模型的耗时增长都远比自回归模型平缓。
速度实测背后的技术含义
DiffusionGemma的探索意义
DiffusionGemma是将Google Gemma模型架构与扩散生成范式结合的实验性项目,代表了一种值得关注的趋势:开源社区正在尝试将成熟基础模型的能力,迁移到更高效的生成框架之上。
从实测反馈来看,扩散范式在推理延迟(latency)上的优势非常显著。在工程评估中,推理性能通常由两个核心指标刻画:**首token延迟(TTFT, Time To First Token)**衡量从请求到第一个输出token出现的等待时间,直接影响用户感知的响应速度;**生成吞吐量(Throughput)**以tokens/秒为单位,衡量模型持续生成的速率,决定长文本任务的总耗时与服务的并发处理能力。自回归模型的吞吐量受制于逐token串行解码;扩散模型由于并行预测整个序列,其性能特征更接近「一次性批处理」,在长序列场景下吞吐量优势尤为突出。对于低延迟响应场景——例如实时对话、代码补全、批量文本处理——这种速度提升具有直接的商业落地价值。
需要理性看待的能力权衡
速度并非唯一的评判维度。当前扩散语言模型仍面临几项待解挑战:
- 生成质量:在复杂推理、长文本连贯性等任务上,扩散模型能否全面追平成熟的自回归模型,仍需更多基准测试验证。
- 可控性:自回归模型在指令遵循、逐步推理(如思维链 CoT)方面具有天然优势。思维链(Chain-of-Thought, CoT)由Google 2022年提出,通过引导模型在输出最终答案前生成中间推理步骤来提升复杂推理准确率。CoT的有效性与自回归的顺序生成机制高度耦合:模型在生成「步骤N+1」时,能够将「步骤N」的输出作为上下文条件,实现真正的逐步逻辑推演。而扩散模型的并行全局生成机制面临结构性挑战——理论上需要在尚未确定前文推理步骤的情况下同时预测后续内容,可能导致推理过程的逻辑自洽性下降。目前研究者正探索"分块扩散"(Chunk-wise Diffusion)等方法缓解这一问题,即将序列切分为若干有序块,块间保持依赖关系,块内并行扩散,但尚未形成成熟方案。
- 生态成熟度:自回归模型拥有完善的工具链、微调方法与部署优化方案,扩散语言模型的配套生态目前尚处早期阶段。
因此,单纯的速度对比虽令人振奋,完整的能力评估仍需结合质量、成本与稳定性等多个维度综合衡量。
扩散语言模型的未来前景
从Inception Labs的Mercury到各类研究型扩散LLM,业界对这一方向的投入近年来明显增加。其核心吸引力在于:在推理成本持续成为AI落地关键瓶颈的当下,任何能够大幅降低延迟和算力消耗的架构创新,都可能重塑竞争格局。
Inception Labs发布的Mercury系列模型是当前商业化程度最高的扩散语言模型代表,宣称在代码生成任务上实现了超过1000 tokens/秒的生成速度。值得关注的是,Mercury并非追求纯粹的全并行扩散,而是采用「半自回归扩散」(Semi-Autoregressive Diffusion)设计——将输出序列切分为多个固定大小的块(Chunk),块内所有token并行执行扩散去噪,块间按照自回归顺序依次生成。这一折中架构的工程逻辑在于:纯粹的全并行扩散在长文本连贯性和逻辑依赖处理上存在质量损失,而引入块间的自回归依赖,可以在牺牲少量并行度的前提下显著提升输出质量与可控性。Mercury的成功验证了「混合架构」路线的可行性,也为DiffusionGemma等探索性项目提供了重要参照。
若扩散模型能在保持速度优势的同时,逐步逼近自回归模型的生成质量,我们或许正处在语言模型生成范式变革的前夜。DiffusionGemma这类探索性项目,正是这场变革的重要先行者。
结语
Reddit社区的这次速度实测,虽源于个体用户的直观体验,却折射出一个值得深思的技术信号:自回归不再是语言模型的唯一答案。扩散范式凭借并行生成带来的速度优势,正为高效AI推理开辟一条全新路径。
对于开发者而言,现在或许是关注并尝试扩散语言模型的好时机——尤其在对响应速度有较高要求的应用场景中。当然,最终的技术选型仍应建立在速度与生成质量的全面权衡之上,而非单一维度的实测结果。
相关推荐

抗投毒概念锚定:防御AI数据污染的新思路
深入解析Poison-Resistant Concept Anchoring方案,通过签名锚点与有界更新机制防御数据投毒攻击。实验显示该方法可隔离62%投毒数据,同时保持0%正常数据误拦率,为联邦学习和开源模型协作提供可行的安全防御框架。

匈牙利算法详解:原理、复杂度与工程实现指南
深入解析匈牙利算法(Hungarian Algorithm)的核心原理、O(N³)时间复杂度优势及工程实现方法。涵盖分配问题定义、算法步骤详解、Python/C++实用工具库推荐,以及在多目标跟踪、资源调度等场景中的应用实践。

Hermes Control Deck:用手机远程操控Codex的开源硬件控制台
Hermes Control Deck是一个开源微型控制台项目,支持通过实体按钮和手机远程界面控制Codex编程助手,提供会话恢复、实时状态监控、远程审批等功能,为AI编程交互带来全新体验。