技术博客
LLM 大语言模型

dLLM:统一扩散语言模型框架

liam2026-07-08 18:26
dLLM:统一扩散语言模型框架

原文链接:

https://arxiv.org/abs/2602.22661

代码链接:

https://github.com/ZHZisZZ/dllm




dLLM 是一个开源框架,它把目前主流扩散语言模型(尤其是 Masked Diffusion 和 Block Diffusion 风格)的训练、推理、评测做到了模块化、可复现、可扩展,并且把门槛降到了“用几百张A100就能玩得转”的程度。



dLLM框架核心设计


dLLM的核心价值在于其统一架构,将扩散语言模型的关键流程整合为三个标准化模块:

  • 训练模块 - 支持从零开始训练和微调现有模型

  • 推理模块 - 提供高效的生成和部署能力

  • 评估模块 - 包含全面的性能评估指标


其次是其模型兼容性,框架支持复现、微调和评估开源大模型(如LLaDA、Dream),将BERT风格编码器转换为扩散语言模型,并将自回归语言模型转化为扩散模型。


资源友好性体现在框架提供了“最小化配方”,使得研究者能够在有限计算资源下构建小型DLMs,大大降低了研究门槛。




技术亮点


dLLM通过定义清晰的接口规范,使得不同组件可以模块化替换和扩展。这种设计既保证了现有研究的可比性,又为创新方法提供了灵活空间。


最让人眼前一亮的部分是:你可以直接把一个现成的 BERT 或 autoregressive LM 转成扩散模型,而且基本不需要改动模型权重结构

  • 示例转换路径(Qwen-3 0.6B → dLLM):

  • 用 HuggingFace transformers 加载原模型

  • 加一个 data collator:随机 mask token(线性 t ~ U(0,1))

  • logits right-shift 处理(让 AR 模型适配 bidirectional 预测)

  • Prepend BOS wrapper 等小trick

  • 直接用 SFT 数据继续训练(不需要从头 pretrain)


论文里给出了 ModernBERT-Chat 和 Tiny-Qwen-A2D 这两个小规模转换案例,性能已经能打平甚至超过一些从头训的扩散模型。





dLLM 的真正价值在哪?


dLLM降低了扩散语言模型的研究门槛,现在一个硕士生/独立研究员用几百 A100 小时就能从零玩通 MDLM/BD3LM,而不是只能跑 toy experiment。


并且提供了可靠的复现基线,论文展示了 LLaDA 和 Dream 的复现结果几乎和官方一致,证明框架可靠性。




总结


dLLM 本身不是一次模型能力的飞跃,而是一次基础设施的降维打击。


当大家还在为“怎么复现 LLaDA 的训练代码”头疼的时候,这个框架直接把问题变成了“在 dLLM 里改哪几个 hyperparameter 最优”。


对于想入坑扩散语言模型、或者想把现有 AR 模型转扩散玩一玩的同学,dLLM 可能是 2026 年初最值得 clone 下来的 repo 之一


如果你已经在玩 LLaDA、Dream、或者自己从头训扩散 LM,欢迎留言分享你的使用体验~

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发