LLM 推理速度极限被彻底粉碎!DFlash 狂飙 6 倍:并行扩散重塑投机采样,SOTA 已成往事!

感恩过去一年与我们共赴技术长河的每一位读者。
原标题:
DFlash: Block Diffusion for Flash Speculative Decoding
论文地址:
https://arxiv.org/abs/2602.06036
代码地址:
https://github.com/z-lab/dflash
在大语言模型(LLM)如火如荼的今天,一个核心的痛点始终困扰着开发者和用户:推理速度太慢。这背后的“元凶”是LLM普遍采用的自回归(Autoregressive)生成方式——模型必须像猜谜一样,一个接一个地生成令牌(Token),整个过程是严格串行的。
这不仅导致响应延迟高,也使得强大的GPU在解码时利用率低下,造成巨大的计算资源浪费。
为了破解这一瓶颈,“推测解码”(Speculative Decoding)技术应运而生,并成为当前的研究热点。
简单来说,它用一个快速的“草稿模型”先猜出一段文本,然后让笨重但精确的“目标模型”一次性并行验证这些猜测。如果猜对了,就大大节省了时间。
然而,现有的推测解码方法(如EAGLE)仍然使用小型自回归模型作为草稿模型,其生成过程本身还是串行的,这限制了加速潜力的天花板。
今天我们要解析的论文提出了一项颠覆性的思路:用扩散模型来代替自回归模型做草稿生成。
这项研究声称实现了超过6倍的无损加速,最高能达到当前最先进方法(EAGLE-3)的2.5倍。这究竟是如何做到的?让我们一探究竟。

现有技术的瓶颈
要理解DFlash的突破,我们首先要看清现有推测解码的局限:
自回归草稿模型的串行瓶颈:即使草稿模型很小,它生成N个令牌也需要N步顺序计算。这仍然是串行的,只是计算量变小了。
草稿质量与速度的权衡:太小的草稿模型猜得不准,导致目标模型的“接受率”低,验证时常失败,加速效果大打折扣。而稍大一点的模型虽然猜得准,但生成速度又变慢了。
有没有一种方法,可以一次性并行地生成高质量草稿呢?DFlash的答案是将目光投向了另一类生成式模型——扩散模型。
DFlash的核心创新:
DFlash的框架非常巧妙,其核心是两个关键设计:
块扩散模型:轻量级块扩散模型替代自回归草稿模型,扩散模型通过多步并行“去噪”,可直接生成完整的令牌块(如8个Token),彻底打破序列生成瓶颈。该模型参数量极小,推理极快。
目标模型特征条件化:为确保草稿质量,DFlash将目标LLM的中间层特征(如Key-Value缓存)作为条件输入块扩散模型。这相当于让“小学生”(草稿模型)在“大学教授”(目标模型)的指导下生成文本,从而大幅提升了草稿与目标模型后续结果的一致性。

DFlash的工作流程
结合以上两点,DFlash的一次推理步骤可以简化为:
特征提取:将当前已生成的文本输入目标LLM,获取其内部的特征表示。
并行起草:将特征作为条件,输入轻量级块扩散模型。该模型通过一次前向传播,直接生成一个候选令牌块。
并行验证:将生成的候选块和原始上下文一起,输入目标LLM进行一次性并行验证。这与标准的推测解码流程一致。
接受与继续:根据验证结果,接受第一个不匹配令牌之前的所有正确令牌,然后以该位置为起点,重复上述过程。
为何DFlash能实现显著加速?
由于草稿生成过程受到了目标模型特征的强力引导,DFlash产生的草稿块与目标模型本身将会生成的内容高度一致。
这意味着在验证阶段,更多的草稿令牌被接受,减少了浪费的计算,加速效率更高。
块扩散模型的单次前向传递速度,比自回归模型生成同等长度序列所需的N次顺序传递要快得多。
尽管单次前向计算可能稍慢,但整体的并行优势巨大。
推测解码是一种“无损”加速技术,DFlash继承了这一优点,其输出结果与原始目标模型完全一致,没有任何质量损失。

总结
DFlash将扩散模型的并行生成能力与推测解码的验证机制相结合,为LLM推理加速开辟了一条全新的、充满潜力的道路。
它巧妙地绕开了自回归生成的固有序列瓶颈,并通过特征条件化确保了草稿的高质量,最终实现了性能的显著飞跃。
这项研究的意义不仅在于其展示的惊人加速比,更在于它证明了:在文本生成领域,扩散模型并非只能作为自回归模型的替代品,它可以成为一种强大的互补工具,在特定的子系统(如草稿模型)中发挥其独特的并行优势。
