技术博客
多模态

当扩散模型遇上多模态大模型:深入解读 LLaDA2.0-Uni

sky2026-07-09 10:57
当扩散模型遇上多模态大模型:深入解读 LLaDA2.0-Uni

论文链接:

https://arxiv.org/abs/2604.20796

代码地址:

https://github.com/inclusionAI/LLaDA2.0-Uni


如果你一直关注大模型领域,你会发现一个有趣的现象:图像生成领域的霸主一直是扩散模型(Diffusion Models),比如 Stable Diffusion、FLUX;而多模态理解领域的王者是自回归(Autoregressive)的视觉语言模型,比如 Qwen-VL、InternVL。


那能不能用一个统一的模型同时把这两件事都做好?这就是"统一多模态模型"(Unified Multimodal Model)一直在追求的目标。


过去的尝试,比如 BAGEL、OmniGen2,主要走的是"自回归 + 扩散"的混合路线,让模型用自回归生成文字、用扩散生成图像。但这种做法本质上还是在两套机制之间打补丁。


而 Inclusion AI 团队提出的 LLaDA2.0-Uni 则给出了一条全新的思路:用一个纯粹的离散扩散语言模型(dLLM)来统一处理文字和图像


它就像一台只用一种"语言"的翻译机器,无论输入是文字还是图像,都被翻译成同一种"离散符号",再由同一个大脑去理解和生成。这个思路非常优雅,而且在性能上已经能与最先进的专用模型掰手腕了。




整体架构:三个核心组件如何协同工作



让图像和文字共享同一个大脑的第一步,是把图像也变成离散 token。这里有个关键设计决策。


以前的统一模型(如 MMaDA、Lumina-DiMOO)使用重建型 VQ 分词器,目标是"还原像素",能把这些 token 重新拼回原图就行。问题是这种 token 只关心"长得像不像",不关心"内容是什么",结果在视觉理解任务上效果很差。


LLaDA2.0-Uni 的做法是基于 SigLIP2-g(一个为"看懂图片"而设计的视觉编码器)训练分词器。这样得到的 token 天然带有"这是一只柯基犬"、"这里有一段文字"这样的高级语义。具体使用的码本词汇量是 16,384,维度是 2,048。


但这带来一个新问题:既然这些 token 是为"理解"设计的,怎么把它们还原成图像?答案是配套训练一个专门的扩散解码器,这是第三个组件的工作。


中间的大脑使用 LLaDA2.0-mini,一个总参数量 16B 的 MoE 扩散语言模型。MoE 的好处是模型有很多专家,每次只激活其中一部分,能同时拥有大容量和高效率。论文特别强调这是模态无关的 MoE,没有特意区分"文字专家"和"图像专家",由路由机制动态分配工作。


为了让这个原本只懂文字的模型理解图像 token,研究者把 SigLIP-VQ 的码本(16,384 个视觉词)连同一些特殊 token 一起加进了大模型的词汇表。文字部分继承预训练权重,新增的视觉 token 嵌入随机初始化后由训练慢慢调优。


这里有两个值得展开的设计。


一是分块注意力,理论上扩散模型应该用全双向注意力让并行解码效率最高,但前人发现这样训练不稳定。LLaDA2.0-Uni 把序列切成若干个块,块内用双向注意力,块之间用单向(因果)注意力,在并行速度和训练稳定性之间取得平衡。


二是1D RoPE + 尺寸 token,很多模型为图像引入 2D RoPE,但 LLaDA2.0-Uni 反其道而行之,坚持用最简单的 1D RoPE,把图像展平后在序列开头加上 <height> 和 <width> 两个特殊 token 显式告诉模型形状。这种设计天然支持任意分辨率,只要改这两个 token 的值就行。


由于 SigLIP-VQ 的 token 没法直接还原图像,研究者基于 6B 的 Z-Image-Base 文生图模型构建了一个扩散解码器。dLLM 主干生成的图像 token 被当作"条件"输入给它(替代了原本的文字 prompt),再通过几轮去噪迭代输出像素图,并自带 2× 超分辨率。


传统扩散模型有个老问题是推理慢,一次生成往往需要 50 步迭代加 CFG。LLaDA2.0-Uni 用模型蒸馏把这个 50 步解码器压缩成只需 8 步、不需要 CFG 的"涡轮版"。后面实验数据会显示,8 步版本速度提升 11.4 倍,图像质量几乎没有任何损失



推理加速:SPRINT 框架


光有架构还不够。要让这个庞然大物真正能用,必须解决推理速度问题。LLaDA2.0-Uni 提出了一个无需重新训练的加速框架 SPRINT,包含两个互补的技巧。


  1. 稀疏前缀保留
    扩散模型每生成一个块都要做 T 次去噪,每次都要对前面所有内容做完整的注意力计算,前缀越长成本越高。SPRINT 的做法是第一步去噪时正常算注意力,同时给每个前缀位置打"重要性分数"(基于 key 范数和预测置信度的加权和),后续步骤只对高分位置做注意力。更巧妙的是它模态感知,文字 token 全保留(因为承载指令和推理链),图像 token 只保留 80%(因为有大量空间冗余)。


  2. 非均匀 token 解掩
    标准扩散解码每步解开固定数量的 token,但有些 token 模型早就胸有成竹,硬要拖到最后是浪费,有些 token 一直犹豫不决,却没多花心思琢磨。SPRINT 的做法是每步只看置信度,所有置信度超过阈值(如 0.93)的位置立刻解开,剩下的留到下一步。这样模型自然把更多迭代花在"难解"的 token 上。


两个技巧合起来整体推理速度提升约 1.6 倍,性能几乎不损失。



总结


LLaDA2.0-Uni 在多模态理解上追平了专用 VLM Qwen2.5-VL,在图像生成、编辑和交错推理任务上则全面领先所有现有的统一模型,证明了纯离散扩散语言模型这条路完全有能力同时做好"看懂"和"画好"两件事。


如果说之前的统一模型还在"跟上专用模型"的阶段挣扎,LLaDA2.0-Uni 已经迈出了"在某些方面超越专用模型"的关键一步。


它向我们展示了一个有吸引力的未来,也许通向 AGI 的路上我们真的不需要那么多专用模型,一个会"填字游戏"的大脑就够了,只是这次填的不只是文字,还有图像、视频,乃至所有可被离散化的模态。





点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发