把视频大模型改造成"实时可玩"的世界模型:minWM 论文解析

论文原标题:
minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models
论文链接:
https://arxiv.org/abs/2605.30263
代码地址:
https://github.com/shengshu-ai/minWM
这篇来自生数科技团队的新工作有意思的地方在于:它不是又一个炫技新模型,而是一份开源 recipe,教你怎么把现成的视频扩散基础模型,一步步改造成可以实时响应玩家操作的视频世界模型。
01
它解决的是什么问题
Wan2.1、HunyuanVideo 1.5 这种视频扩散基础模型,离"可交互世界模型"之间隔着三道墙:
双向 (bidirectional):一次性出整段视频,不是边生成边输出;
多步去噪:几十步采样,延迟极高;
不可控:不响应用户的相机/动作输入。
要把这三件事都解决,需要"数据 → 可控微调 → 自回归训练 → 少步蒸馏 → 流式推理"一整套流水线。之前这些技术散落在不同论文里,minWM 把它打通成一套可复现的开源 pipeline。

02
两阶段pipeline
Phase 1:让模型听懂"相机"
给 T2V/TI2V 模型加上相机控制能力,用的是 PRoPE (Projective Positional Encoding)这是 NeurIPS 2025 工作。
注意全称是 Projective Positional Encoding,常被误传成 "Projective Rotary",其实并不是。
具体做法:把每帧相机的内参 和外参 写成一个 4×4 投影矩阵 ,塞进 self-attention 里,让两个 token 之间的注意力交互显式依赖于相对相机变换。这样模型自然编码了相机内外参的相对几何关系。
Phase 2:从"双向多步"蒸馏到"自回归少步"
走 Causal Forcing / Causal Forcing++ 的三阶段蒸馏:
Stage 1:AR Diffusion Training
用 Teacher Forcing(把干净视频和带噪视频拼接 + 因果注意力 mask)把双向模型微调成自回归扩散模型。
Stage 2(二选一):
1. 2a:Causal ODE 初始化 - 离线生成 PF-ODE 轨迹,回归监督少步模型;
2. 2b:Causal CD 初始化 - 用 consistency distillation 在线训练,省掉 ODE 数据的存储开销;这两条路在论文里被论证为数学上等价,工程上各有取舍。
Stage 3:Asymmetric DMD
学生模型自滚出(self-rollout)完整序列,用双向 teacher 提供 real / fake score,通过 DMD loss 把学生分布对齐到双向高质量分布。
03
实验结果
最直观的对比就是首帧延迟(单张 A800,不计 VAE 时间):

一点澄清:"首帧延迟"≠"总生成时间"。AR 模型的真正价值是"边生成边播",用户感知的等待时间大幅下降,而不是总算力下降。

04
三个值得记住的工程经验
论文消融做得相当务实,直接告诉你哪些坑会让你训不出来:
数据要"真"相机位姿:直接用 SpatialVid(感知估计的位姿)训不出可靠的可控性,改用 DL3DV 3D 重建 + 渲染、或 WorldPlay 按指定轨迹合成的 ground-truth 轨迹才行。

训练步数要够:HY1.5 大约 5K 步开始出现可控性,8K 步才稳定。

Batch size 不能太小:Wan2.1 上 batch < 4 学不会,batch = 8 不稳,batch ≥ 16 才能稳定跑完整个 pipeline。

05
总结
minWM 的差异化定位很清楚:不是 SOTA 竞赛者,是 infrastructure。它把 Causal Forcing、Self Forcing、DMD、PRoPE 这些散落的技术整合成一条可复现的开源 pipeline,还公开了"没人写在论文里、但你不知道就训不出来"的工程坑(数据 ground-truth、最小 batch、训练步数门槛)。
对想入场实时视频世界模型方向的研究者来说,这种"铺路工作"的价值常常比一个新 SOTA 模型更高。
