技术博客
其他

把视频大模型改造成"实时可玩"的世界模型:minWM 论文解析

Truman2026-07-09 14:51
把视频大模型改造成"实时可玩"的世界模型:minWM 论文解析

论文原标题:

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

论文链接:

https://arxiv.org/abs/2605.30263

代码地址:

https://github.com/shengshu-ai/minWM




这篇来自生数科技团队的新工作有意思的地方在于:它不是又一个炫技新模型,而是一份开源 recipe,教你怎么把现成的视频扩散基础模型,一步步改造成可以实时响应玩家操作的视频世界模型。



01

它解决的是什么问题


Wan2.1、HunyuanVideo 1.5 这种视频扩散基础模型,离"可交互世界模型"之间隔着三道墙:

  1. 双向 (bidirectional):一次性出整段视频,不是边生成边输出;

  2. 多步去噪:几十步采样,延迟极高;

  3. 不可控:不响应用户的相机/动作输入。


要把这三件事都解决,需要"数据 → 可控微调 → 自回归训练 → 少步蒸馏 → 流式推理"一整套流水线。之前这些技术散落在不同论文里,minWM 把它打通成一套可复现的开源 pipeline。




02

两阶段pipeline


Phase 1:让模型听懂"相机"

给 T2V/TI2V 模型加上相机控制能力,用的是 PRoPE (Projective Positional Encoding)这是 NeurIPS 2025 工作。


注意全称是 Projective Positional Encoding,常被误传成 "Projective Rotary",其实并不是。


具体做法:把每帧相机的内参  和外参  写成一个 4×4 投影矩阵 ,塞进 self-attention 里,让两个 token 之间的注意力交互显式依赖于相对相机变换。这样模型自然编码了相机内外参的相对几何关系。


Phase 2:从"双向多步"蒸馏到"自回归少步"

走 Causal Forcing / Causal Forcing++ 的三阶段蒸馏:

  • Stage 1:AR Diffusion Training

    用 Teacher Forcing(把干净视频和带噪视频拼接 + 因果注意力 mask)把双向模型微调成自回归扩散模型。


  • Stage 2(二选一):
    1. 2a:Causal ODE 初始化 - 离线生成 PF-ODE 轨迹,回归监督少步模型;
    2. 2b:Causal CD 初始化 - 用 consistency distillation 在线训练,省掉 ODE 数据的存储开销;

    这两条路在论文里被论证为数学上等价,工程上各有取舍。


  • Stage 3:Asymmetric DMD

    学生模型自滚出(self-rollout)完整序列,用双向 teacher 提供 real / fake score,通过 DMD loss 把学生分布对齐到双向高质量分布。



03

实验结果


最直观的对比就是首帧延迟(单张 A800,不计 VAE 时间):



一点澄清:"首帧延迟"≠"总生成时间"。AR 模型的真正价值是"边生成边播",用户感知的等待时间大幅下降,而不是总算力下降。




04

三个值得记住的工程经验


论文消融做得相当务实,直接告诉你哪些坑会让你训不出来:


  1. 数据要"真"相机位姿:直接用 SpatialVid(感知估计的位姿)训不出可靠的可控性,改用 DL3DV 3D 重建 + 渲染、或 WorldPlay 按指定轨迹合成的 ground-truth 轨迹才行。



  1. 训练步数要够:HY1.5 大约 5K 步开始出现可控性,8K 步才稳定。



  1. Batch size 不能太小:Wan2.1 上 batch < 4 学不会,batch = 8 不稳,batch ≥ 16 才能稳定跑完整个 pipeline。




05

总结


minWM 的差异化定位很清楚:不是 SOTA 竞赛者,是 infrastructure。它把 Causal Forcing、Self Forcing、DMD、PRoPE 这些散落的技术整合成一条可复现的开源 pipeline,还公开了"没人写在论文里、但你不知道就训不出来"的工程坑(数据 ground-truth、最小 batch、训练步数门槛)。


对想入场实时视频世界模型方向的研究者来说,这种"铺路工作"的价值常常比一个新 SOTA 模型更高。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发