技术博客
CV 计算机视觉

英伟达 LongLive-2.0 论文精读:NVFP4 并行架构如何让长视频生成训练快 2.15 倍

Mr.黄先生2026-07-09 10:24
英伟达 LongLive-2.0 论文精读:NVFP4 并行架构如何让长视频生成训练快 2.15 倍

论文原标题:

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

论文链接:

https://arxiv.org/abs/2605.18739

项目主页:

https://nvlabs.github.io/LongLive/LongLive2/

代码地址:

https://github.com/NVlabs/LongLive






长视频生成的两座大山




想象一下让 AI 生成一段 60 秒甚至 4 分钟的视频。模型需要一帧一帧往下推演,而且每一帧都要和前面的内容保持一致,人物不能突然换脸,场景不能瞬间瞬移。


视频越长,需要存储的"历史信息"越多,计算量呈倍数增长,于是出现两个挥之不去的瓶颈:生成速度太慢显存爆炸


LongLive 系列正是冲着这两个问题去的。1.0 版本(2025 年 9 月)已经在单张 H100 上做到 20.7 FPS 实时交互生成,而这次的 2.0 版本把目光投向了一个更激进的方向:用 4 比特浮点数 NVFP4 重构整个训练和推理流水线






什么是 NVFP4?




要看懂这篇论文,得先理解 NVFP4。简单说,这是 NVIDIA 在 Blackwell 架构 GPU(B200、GB200 等新一代显卡)上原生支持的一种 4 比特浮点格式


一个数字原本要用 16 位(BF16)或 32 位(FP32)存,现在压缩到 4 位,存储省 4 到 8 倍,GEMM(矩阵乘法)计算也快得多。


但精度从 16 位掉到 4 位,模型会不会崩?这正是 LongLive-2.0 要解决的核心工程问题。过去几年大家习惯了用 INT8、FP8 加速推理,但训练时通常还得用 BF16 保稳定。


这篇论文的特殊之处在于:它把 NVFP4 用在了训练的全流程,而不是只用于推理





训练阶段的关键创新:Balanced SP




LongLive-2.0 在训练上提出了"Balanced SP"(平衡序列并行)。要理解这个设计,先要把两个概念讲清楚。


第一个概念叫 teacher forcing。训练自回归视频模型时,模型理论上应该用自己之前预测的帧来推下一帧,但这样训练初期一旦预测错,误差会滚雪球。Teacher forcing 的做法是:训练时直接喂真实的历史片段给模型,这样训练更稳定。


第二个概念是序列并行(Sequence Parallelism, SP),把一段很长的视频切成几块,分给不同 GPU 同时处理,这样单卡显存压力就小了。


Balanced SP 的巧思在于,它把"干净的历史片段(clean history)"和"带噪声的目标片段(noisy target)"成对地放在同一张 GPU 上


这样既保留了 teacher forcing 的稳定性,又让多 GPU 并行计算变得自然,每张卡都有一对完整的训练样本,而不需要在卡之间频繁交换数据。



配合 NVFP4 精度,训练显存大幅降低,GEMM 计算被显著加速。论文给出的结果是,训练速度最高提升 2.15 倍,而且视频越长,GEMM 在总计算量中的占比越高,加速效果越明显。





简化训练流程




这是 LongLive-2.0 一个被作者强调的亮点。来对比一下现有方法的复杂路径。


之前主流的 Self-Forcing 系列走的是一条曲折路,先用 ODE(常微分方程求解器)做初始化,再做 DMD(Distribution Matching Distillation,分布匹配蒸馏),才能把扩散模型转成可用的自回归视频模型。这条流水线步骤多、调参难。


LongLive-2.0 直接说:不用这么麻烦,我直接把一个扩散模型微调成"长视频、多镜头、可交互的自回归扩散模型"就行,跳过 ODE 初始化和 DMD 蒸馏


作者把这个能力归功于"高质量的基础设施和数据集",当训练系统足够稳定、数据足够干净时,复杂的中间步骤就可以省掉。


更妙的是,训练完成后,模型可以通过一个独立的 LoRA 权重转换成实时生成模式,把去噪步数从 4 步降到 2 步,这意味着同一个模型可以根据需求在"高质量慢速"和"实时快速"之间切换。





推理阶段




推理这边,论文做了个聪明的分流设计:新硬件吃精度优化,老硬件吃并行优化。


在 Blackwell GPU 上,启用三件套。

  • W4A4 NVFP4 推理(权重和激活都用 4 位浮点)。

  • KV cache 量化成 NVFP4(KV cache 是自回归模型用来缓存历史信息的关键结构,占显存大头)。

  • 异步流式 VAE 解码,不等整段视频生成完再解码,而是边生成边解码,让两个阶段的计算重叠起来,提升端到端吞吐。


在非 Blackwell GPU(比如 H100、A100)上没法用 NVFP4,作者就用序列并行(SP)推理来达到接近 Blackwell 的速度。而且量化后的 KV cache 还有个附加好处,GPU 之间通信的数据量也变小了,SP 的通信开销随之降低。






最终结果




论文的核心数字值得单独拎出来:

训练速度最高 2.15 倍提升,推理速度 1.84 倍提升,LongLive-2.0-5B 模型推理达到 45.7 FPS。要知道,实时视频的标准通常是 24 到 30 FPS,所以 45.7 FPS 远远超过实时门槛,这意味着模型在生成视频的同时,还有富余的计算资源用于交互式响应。






总结




如果只看 FPS 数字,容易低估这篇论文的意义。它的价值其实在更高的层面。


第一,它代表了一个趋势:低精度数值格式正在从推理扩展到训练。 过去 FP8、INT8 主要用于推理加速,训练通常还需要 BF16 保证梯度稳定。NVFP4 能在训练全流程中可用,意味着未来更大的模型可以用更少的硬件训出来。论文明确说这是"首个用于长视频生成的 NVFP4 训练和推理系统",这个"首个"分量不轻。


第二,系统优化驱动 AI 进步是一条被低估但极其重要的路线。 长视频生成是当前生成式 AI 的前沿战场,OpenAI 的 Sora、Google 的 Veo 都在竞争。LongLive-2.0 没有发明新的模型架构,而是通过基础设施层面的优化把现有架构榨出更多性能,这种"从工程上推动 AI 进步"的思路在工业界尤为珍贵。


第三,实时长视频交互正在成为可能。 当生成速度超过实时门槛,用户就能在视频生成的同时输入新指令,改变剧情走向。这打开了游戏、教育、影视制作等全新场景的大门。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发