dLLM:统一扩散语言模型框架

原文链接:
https://arxiv.org/abs/2602.22661
代码链接:
https://github.com/ZHZisZZ/dllm
dLLM 是一个开源框架,它把目前主流扩散语言模型(尤其是 Masked Diffusion 和 Block Diffusion 风格)的训练、推理、评测做到了模块化、可复现、可扩展,并且把门槛降到了“用几百张A100就能玩得转”的程度。
dLLM框架核心设计
dLLM的核心价值在于其统一架构,将扩散语言模型的关键流程整合为三个标准化模块:
训练模块 - 支持从零开始训练和微调现有模型
推理模块 - 提供高效的生成和部署能力
评估模块 - 包含全面的性能评估指标
其次是其模型兼容性,框架支持复现、微调和评估开源大模型(如LLaDA、Dream),将BERT风格编码器转换为扩散语言模型,并将自回归语言模型转化为扩散模型。
资源友好性体现在框架提供了“最小化配方”,使得研究者能够在有限计算资源下构建小型DLMs,大大降低了研究门槛。
技术亮点
dLLM通过定义清晰的接口规范,使得不同组件可以模块化替换和扩展。这种设计既保证了现有研究的可比性,又为创新方法提供了灵活空间。
最让人眼前一亮的部分是:你可以直接把一个现成的 BERT 或 autoregressive LM 转成扩散模型,而且基本不需要改动模型权重结构。
示例转换路径(Qwen-3 0.6B → dLLM):
用 HuggingFace transformers 加载原模型
加一个 data collator:随机 mask token(线性 t ~ U(0,1))
logits right-shift 处理(让 AR 模型适配 bidirectional 预测)
Prepend BOS wrapper 等小trick
直接用 SFT 数据继续训练(不需要从头 pretrain)
论文里给出了 ModernBERT-Chat 和 Tiny-Qwen-A2D 这两个小规模转换案例,性能已经能打平甚至超过一些从头训的扩散模型。

dLLM 的真正价值在哪?
dLLM降低了扩散语言模型的研究门槛,现在一个硕士生/独立研究员用几百 A100 小时就能从零玩通 MDLM/BD3LM,而不是只能跑 toy experiment。
并且提供了可靠的复现基线,论文展示了 LLaDA 和 Dream 的复现结果几乎和官方一致,证明框架可靠性。
总结
dLLM 本身不是一次模型能力的飞跃,而是一次基础设施的降维打击。
当大家还在为“怎么复现 LLaDA 的训练代码”头疼的时候,这个框架直接把问题变成了“在 dLLM 里改哪几个 hyperparameter 最优”。
对于想入坑扩散语言模型、或者想把现有 AR 模型转扩散玩一玩的同学,dLLM 可能是 2026 年初最值得 clone 下来的 repo 之一。
如果你已经在玩 LLaDA、Dream、或者自己从头训扩散 LM,欢迎留言分享你的使用体验~
