WAM 世界模型教程其他

从 World Model 到 World Action Model:具身智能正在进入“先想象,再行动”的时代(续集)

coffee co.2026-08-28 11:32
从 World Model 到 World Action Model:具身智能正在进入“先想象,再行动”的时代(续集)

4. MuZero:世界模型不一定要“还原世界”

如果说 Dreamer 的思路是:

在一个压缩的 latent 世界里模拟未来,

那么 MuZero 又往前推了一步。

它问了一个很狠的问题:

做决策时,我们真的需要把整个世界预测出来吗?

很多时候,其实不需要。

比如一个智能体在玩棋类游戏。

它并不需要生成一张高清的“未来棋盘图片”,也不需要完整重建每一个视觉细节。

它真正关心的是:

  • 这个状态值多少钱;
  • 执行某个动作之后 reward 怎么变;
  • 接下来哪些动作更有希望。

所以 MuZero 并不强调恢复真实观测,而是学习一个对决策有用的隐空间动力学

可以粗略理解成:

当前观测
   |
   v
Representation Network
   |
   v
Latent State
   |
   + action
   |
   v
Dynamics Network
   |
   +----> Reward
   |
   +----> Next Latent State
   |
   v
Prediction Network
   |
   +----> Value
   |
   +----> 策略先验

这件事对后来 World Model 的影响非常大。

因为它提醒大家:

“预测得像不像”不一定等于“对控制有没有用”。

一个模型可以生成非常漂亮的视频,但如果它对接触、力学、可执行性判断错误,那对机器人控制来说价值有限。

反过来,一个 latent model 可能根本没法把预测结果画出来,但只要它能稳定预测任务进展、可达性和动作后果,它就可能非常有用。

所以从这里开始,World Model 慢慢分成两种审美:

第一种更关注:

世界未来看起来是什么样。

第二种更关注:

哪些未来信息对决策真正有用。

这个分歧,到今天依然存在。


5. JEPA:也许我们根本不该预测像素

沿着第二种思路继续往下,就会碰到 JEPA。

JEPA,全称 Joint-Embedding Predictive Architecture。

它背后的想法其实很直白:

真实世界里,大量像素细节和智能决策没有直接关系。

假设一个机械臂正在把金属插销装进孔位。

真正决定任务成败的变量,可能是:

  • 插销和孔的位置关系;
  • 姿态误差;
  • 接触状态;
  • 插入深度;
  • 当前是否卡住。

但像素空间还包含一堆东西:

  • 金属表面高光;
  • 背景颜色;
  • 旁边工作人员衣服的颜色;
  • 相机噪声;
  • 灯光阴影。

如果一个模型花大量容量,把这些视觉细节都预测得非常精确,它未必学到了真正有用的物理结构。

于是 JEPA 的思路是:

过去的观测
    |
    v
Context Encoder
    |
    v
抽象表征
    |
    v
Predictor
    |
    v
未来表征

它不一定要求:

未来 RGB 像素

而是要求:

未来 observation 的 representation

和真实未来观测编码后的 representation 对齐。

这其实是一种很“老哥式”的工程思路:

既然最终是为了决策,那就别逼模型把所有不重要的东西都画出来。

因此,今天讲 World Model,千万不要把它和视频生成模型画等号。

视频生成只是其中一条路线。

World Model 更本质的问题是:

模型有没有学到“世界如何演化”。

至于这个“世界”究竟表示成 RGB、latent、3D geometry、occupancy、object graph,还是某种抽象特征,是另外一回事。

你上传的第二篇材料也采用了类似的区分:它把今天的 World Model 分成视频生成、latent prediction、结构化 dynamics、3D world 和物理引擎等多条路线,而不是简单把 World Model 等同于视频生成。


6. 为什么这两年 World Model 突然又火了?

World Model 不是新概念。

Dreamer 也不是 2025 年才出现。

为什么偏偏到了 2024~2026 年,World Model 突然又成了“显学”?

我觉得主要有三个原因。


6.1 第一件事:视频生成能力跨过了一个坎

以前做视频预测,最大的问题是:

预测出来的东西很快就崩。

短时间还能看。

一旦多步预测序列拉长:

  • 物体消失;
  • 形状漂移;
  • 空间关系错乱;
  • 动作和视觉不同步。

所以很长时间里,“用视频生成模型做 World Model”听起来挺酷,但真正拿去做控制的人并不多。

后来 Transformer、Diffusion、DiT、Flow Matching 这些技术成熟之后,视频模型的时空建模能力上了一个台阶。

于是产业界开始认真问:

如果视频模型已经能学会这么多视觉动态,那它是不是也在学某种粗粒度物理规律?

这也是 Genie、Cosmos 等路线重要的地方。

它们把 World Model 从:

小规模 RL 环境里的 dynamics model

慢慢推到了:

大规模 World Foundation Model。

第二篇材料就把这条线总结成:

小规模 latent dynamics
      ->
model-based RL
      ->
Transformer / diffusion 视频世界模型
      ->
JEPA
      ->
foundation world model
      ->
robot world model / WAM

6.2 第二件事:机器人真的太缺数据了

大模型时代有一个很残酷的现实:

语言模型的数据来自互联网。

视觉模型的数据也能来自互联网。

但是机器人动作数据没法靠爬网页获得。

你想获得一条高质量机器人轨迹,通常意味着:

机器人硬件
+
真实场景
+
遥操作人员
+
标定
+
动作同步
+
失败恢复
+
人工维护

成本完全不是一个量级。

这也是为什么机器人领域一直在研究:

  • Open X-Embodiment;
  • 多机器人数据混合;
  • 仿真数据;
  • 人类第一视角视频;
  • play data;
  • synthetic trajectory。

World Model 在这里提供了一个很有吸引力的切入点。

因为它不一定要求所有数据都有机器人动作标签。

特别是如果模型的世界预测部分可以先从:

  • 人类视频;
  • 网络视频;
  • egocentric video;
  • simulation video

里面学到“世界怎么变化”,那么后续再用少量机器人数据对动作进行对齐,理论上就能大幅降低机器人动作数据的压力。

这也是为什么在 WAM 里,人类视频和无动作标签视频的重要性被抬得很高。

你上传的 WAM 调研材料把数据来源分成四类:

  • 机器人遥操作;
  • 便携式人类示范;
  • 仿真;
  • 互联网级 / 第一视角人类视频。

其中后两类尤其重要,因为它们规模大,而且可以提供大量“世界如何变化”的先验。


6.3 第三件事:VLA 开始碰到“反应式策略”的天花板

过去几年的 VLA 路线已经非常清楚了:

Image / Video
+
Language
+
Robot State
      |
      v
     VLA
      |
      v
   Action

这条路线很有效。

问题是:

它天然更偏向直接策略映射

也就是:

observation -> action

这并不是说 VLA 完全没有世界知识。

大模型当然可以通过视觉预训练、语言预训练、轨迹数据获得大量隐式先验。

但从建模目标上看,大量 VLA 并没有明确要求模型回答:

如果执行这个动作,未来世界究竟会怎样?

这正是 World Model / WAM 阵营针对 VLA 最核心的批评之一。

WAM 综述里的表述非常直接:

传统 VLA 学习的是一种反应式 observation-to-action mapping,而没有显式建模“物理世界在干预后如何变化”。

这句话基本把 WAM 为什么会出现讲透了。


7. 一个更实际的例子:装配机器人为什么需要 World Model?

为了避免一直拿抓杯子举例,我们换一个更实际的场景。

假设工厂里有一个双臂机器人,需要完成:

把一个软排线插进连接器,然后压下锁止结构。

这个任务看起来不复杂。

但真正做过机器人装配的人都知道,这里面坑很多。

机器人第一步可能是:

抓住排线

第二步:

调整排线姿态

第三步:

插入连接器

第四步:

压下锁止结构

一个纯 策略模型 模型可能每一步都局部预测动作。

问题是:

第一步抓的位置稍微偏一点,第三步可能就永远对不准。

或者:

插入角度偏了 2°,继续往下压可能会损坏接口。

这时候一个拥有 world prediction 能力的模型可以在执行前想象:

候选动作 A:
继续向前推进 3 mm

预测结果:
排线边缘与连接器发生干涉
失败风险高

再看:

候选动作 B:
先向上抬 1 mm
再旋转 1.5°
然后插入

预测结果:
连接器切入点对齐
后续可执行

这就是 World Model 的价值。

关键不是“生成一段排线插进去的视频”。

关键是:

预测不同动作之后的状态变化。

如果这个预测还能直接和动作生成统一起来,那么就进一步进入 WAM。


8. 从 World Model 到 World Action Model

现在终于可以讲 WAM 了。

World Action Model,简称 WAM。

如果用一句话概括:

WAM 就是把“未来世界”和“未来动作”放进一个统一建模框架里。

传统 World Model 更像:

当前状态 + 动作
        |
        v
     未来状态

也就是:

s_t + a_t -> s_{t+1}

VLA 则更像:

当前观测 + 语言
        |
        v
       动作

而 WAM 想做的是:

当前观测 + 语言
         |
         v
未来状态 + 未来动作

更正式一点说,就是从:

p(a | o, l)

扩展到:

p(o', a | o, l)

也就是同时建模:

  • future observation / future state;
  • action。

WAM 综述给出的定义非常明确:

WAM 是统一 predictive state modeling 和 action generation 的具身基础模型,其目标是未来状态和动作的联合分布,而不仅仅是动作。

这个定义我觉得非常关键。

因为它把 WAM 和“有 World Model 模块的机器人系统”区分开了。


9. World Model + 策略模型和 WAM 有什么区别?

这里很容易混。

一种经典系统是:

World Model
     |
     v
 Planner
     |
     v
 策略模型

例如:

World Model 负责预测未来。

Planner 负责选方案。

策略模型 负责执行。

这是:

策略模型使用 world model。

而 WAM 更进一步。

它希望:

世界预测和动作生成本身就是统一模型的一部分。

例如:

Observation
+
Language
       |
       v
Unified Model
       |
       +------> Future State
       |
       +------> Action

甚至:

video token
action token
latent state

直接进入同一个 Transformer / DiT。

这意味着“想象”和“行动”不再是两个完全独立模块。

这也是第二篇材料对最近趋势的总结:

过去:
策略模型使用 world model

现在:
world model 和 策略模型 联合建模

未来:
agent 的“想象”和“行动”
可能只是同一个模型的不同推理模式

我个人觉得,这其实是理解 WAM 最好的角度。


10. WAM 并不是只有一种做法

看到这里容易产生一个误解:

是不是所有 WAM 都是:

先生成未来视频,再从视频里面推出动作?

不是。

这是其中一种。

WAM 综述把现有路线先分成两大类:

WAM

├── Cascaded
│
└── Joint

也就是:

  • 级联式;
  • 联合式。

这是理解当前 WAM 论文最重要的一张地图。


11. Cascaded WAM:先想未来,再决定怎么做

Cascaded 是最直观的一类。

逻辑就是:

当前观测
   |
   v
预测未来状态
   |
   v
从未来状态反推动作

也可以写成:

p(o', a | o, l)

=

p(o' | o, l)
×
p(a | o', o, l)

直觉上就是:

先想象任务完成之后应该长什么样,再算怎么做到。

这条路线和早期很多视频规划工作很像。


11.1 显式 Cascaded:真的把未来“画出来”

第一种方案最暴力:

直接生成未来图像或者视频。

比如家庭机器人收到任务:

“把客厅里的折叠椅收起来,给扫地机器人腾出通道。”

模型可以先生成一个目标未来:

当前:
折叠椅挡在过道中央

未来:
折叠椅靠墙收好
过道清空

然后通过:

  • optical flow;
  • pose tracking;
  • keypoint;
  • inverse dynamics;
  • geometry;

把这个视觉变化转换成机器人动作。

这类方法的好处是特别直观。

你可以直接看:

模型到底想实现一个什么未来。

而且因为未来目标通常是视觉/几何空间的,它对具体机器人的动作空间依赖相对没那么强。

同一个目标未来:

“椅子最终靠墙”

可以由:

  • 单臂机器人;
  • 双臂机器人;
  • 人形机器人

用不同方式执行。

这就是显式 future generation 很吸引人的地方。

WAM 调研里把 UniPi、Gen2Act 等工作放在这一类,同时也把 π0.7 归入 Cascaded·Explicit 这一格。


11.2 但显式生成未来有一个致命问题:慢

机器人控制和视频生成有一个天然矛盾:

视频模型喜欢:

大模型
多步 diffusion
高分辨率
长序列

机器人喜欢:

低 latency
高频控制
稳定闭环

两者几乎反着来。

如果每执行一个动作之前,都要:

生成未来 16 帧视频
↓
分析视频
↓
再推出动作

控制频率很容易直接崩掉。

于是大家自然想到:

既然最终需要的是“未来信息”,为什么一定要把 RGB 真正生成出来?

这就有了 latent planning。


12. 隐式 Cascaded:别画视频,在 latent 里想

隐式 Cascaded 的逻辑和前面一样:

先预测未来
再生成动作

但未来不是 RGB。

而是:

latent state

例如:

current observation
       |
       v
video encoder
       |
       v
latent z_t
       |
       v
future latent z_{t+k}
       |
       v
策略模型
       |
       v
action

优点非常明显:

  • 不需要完整视频解码;
  • 计算成本低;
  • 更容易做到实时;
  • 可以过滤大量无关的像素细节。

WAM 综述把 VPP、LAPA 等放在这一类。

从工程角度看,这条路线其实很有竞争力。

因为真实机器人最终需要的不是:

每次决策都生成一部电影。

而是:

一个可靠、快速、足够预测后果的内部状态。


13. Cascaded 最大的问题:误差会一层层传下去

级联系统最大的问题也很经典。

假设:

World Model

预测错了。

那么:

Action Model

会基于错误未来做决策。

例如机械臂准备将一个柔性软管穿过支架。

World Model 预测:

软管会从支架左侧自然下垂

但真实情况由于摩擦:

软管卡在右侧边缘

后续 action decoder 如果完全相信预测未来,就可能输出一串完全错误的动作。

这就是 cascaded pipeline 的问题:

World Prediction Error
       ↓
Action Extraction Error
       ↓
Execution Error

所以后来越来越多工作开始做:

Joint Modeling。


14. Joint WAM:世界预测和动作一起学

Joint WAM 的核心不是:

先预测
再行动

而是:

世界状态
+
动作

在同一个模型里联合生成

也就是说直接学习:

p(o', a | o, l)

而不是拆成两个模型。

从结构上可以想成:

Observation Tokens
Language Tokens
Future Tokens
Action Tokens

        ↓

Shared Transformer / DiT

        ↓

Future State + Action

这带来一个很重要的变化:

动作生成可以直接看到 world prediction 的内部特征。

世界建模也可以受到 action supervision 的影响。

两个任务不是简单串联,而是:

互相约束。

这和我们人类的认知其实也比较像。

我们并不是:

完整模拟整个世界
↓
模拟结束
↓
再单独计算动作

很多时候,“我准备怎么做”和“我觉得会发生什么”本来就是一起变化的。


15. Joint WAM 又分两条主线

目前比较主流的两种技术基底是:

Joint WAM

├── Autoregressive
│
└── Diffusion / Flow Matching

也就是:

  • 自回归;
  • 扩散 / 流匹配。

16. 自回归 WAM:把世界和动作都 token 化

自回归路线很好理解。

既然 LLM 可以:

token -> token -> token

那是不是可以把:

视觉
动作
世界状态

也全部变成 token?

然后统一做:

next-token prediction

例如一个序列可能类似:

[OBS]
视觉 token

[LANG]
任务 token

[ACT]
动作 token

[FUTURE]
未来视觉 token

[ACT]
下一段动作 token

这样一个 Transformer 理论上就能同时:

  • 理解任务;
  • 预测世界;
  • 生成动作。

WAM 综述把 GR-1、WorldVLA、RynnVLA-002 等归在 Joint·Autoregressive 路线中。


16.1 Autoregressive 最大优势:统一

它很适合做“大一统模型”。

因为只要能 token 化,就可以塞进一套序列建模框架。

例如:

language token
+
image token
+
action token
+
future token

对大模型团队来说,这种统一性很有吸引力。


16.2 最大问题:串行生成太慢

Autoregressive 的老问题也很明显:

token 1
↓
token 2
↓
token 3
↓
token 4

机器人控制非常讨厌这种串行 latency。

特别是视觉 token 很多的时候。

另外一个问题是:

如果早期生成了错误 future token,后面的 action token 可能跟着一起错。

也就是:

视觉幻觉
↓
未来状态错误
↓
动作错误

所以扩散路线开始变得越来越重要。


17. Diffusion WAM:世界和动作一起“去噪”

Diffusion / Flow Matching 路线最近非常火。

原因之一就是:

动作本身非常适合连续生成。

机器人动作通常是:

x, y, z
roll, pitch, yaw
gripper
joint state

本质上都是连续值。

Diffusion 策略模型 已经证明:

diffusion 对多模态连续动作分布非常适合。

于是一个很自然的想法就是:

既然视频可以 diffusion,

action 也可以 diffusion,

那能不能:

video + action 一起 diffusion?

于是出现:

Future Video Noise
+
Action Noise

       ↓

Shared DiT

       ↓

Future Video
+
Action

这就是不少 Joint WAM 的基本思路。


18. Unified-Stream:同一个 DiT 同时生成世界和动作

一种很激进的结构叫:

Unified-Stream。

世界变量和动作变量都进入同一个网络。

例如:

current observation
language
noisy future video
noisy action

        ↓

      DiT

        ↓

denoised future
+
denoised action

它的好处是:

世界和动作天然共享 attention。

动作可以看到视觉未来的信息。

视觉未来也可以受到动作约束。

WAM 综述把 UWM、DreamZero、X-WAM 等放在 Joint diffusion 这一大脉络下。


19. Multi-Stream:视频和动作各走各的,但中间交流

另外一种更工程化的方案是:

Video Branch
      |
      | Cross Attention
      |
Action Branch

或者:

Shared Encoder

  /       \
 /         \
Video       Action
Decoder     Decoder

这样做的好处是:

两个模态可以拥有不同的计算预算。

因为机器人实际有个很现实的问题:

视频生成不需要 50 Hz,但动作可能需要。

如果所有东西都强制同步,就很浪费。

所以多流架构可以做:

video:
慢一点
高质量

action:
快一点
低 latency

这也直接引出了 X-WAM 这类工作的核心动机。


20. 代表模型一:UWM,开始真正把 Video 和 Action Diffusion 耦合起来

UWM,全称 Unified World Models。

它属于比较早的一批:

Joint Video-Action Diffusion。

核心思想不是:

video model
+
单独 action head

而是:

把视频扩散和动作扩散真正耦合起来。

从 WAM 的发展史上看,UWM 很重要。

因为它把一个问题正式摆到桌面上:

世界生成和动作生成到底是不是应该分开训练?

WAM 后来的很多工作,都在回答这个问题。

X-WAM 也明确把 UWM 作为前序路线进行讨论,并批评它主要停留在 2D pixel-space 世界建模。

换句话说:

UWM 更像是:

“Video + Action 一起 diffusion”这条线的重要起点。


21. 代表模型二:DreamZero,把 World Model 直接做成 策略模型

DreamZero 是最近这条路线里特别值得注意的一篇。

论文标题直接叫:

World Action Models are Zero-shot Policies

这标题已经把态度写脸上了。

过去 World Model 的角色通常是:

World Model
    ↓
辅助 策略模型

DreamZero 想说的是:

World Action Model
      =
    策略模型

世界预测不是旁路任务。

而是动作能力本身的一部分。


21.1 DreamZero 为什么重要?

它背后的核心假设是:

视频模型里面已经包含大量关于运动、物体变化和物理交互的先验。

那就没必要从零训练一个机器人 策略模型。

可以直接在:

pretrained video diffusion backbone

上长出 action capability。

也就是:

大量视频知识
      |
      v
Video Diffusion Backbone
      |
      +---- Future World
      |
      +---- Robot Action

这样一来,人类视频和互联网视频就有机会真正成为机器人预训练数据。


21.2 一个更直观的例子

假设任务是:

人形机器人把地上的长电缆收好,然后挂到墙上的挂钩上。

这个任务有很多物理细节:

  • 电缆是柔性的;
  • 拿起一端之后另一端会拖动;
  • 电缆可能打结;
  • 摆动会影响最终抓取;
  • 挂钩需要特定空间姿态。

传统 VLA 看到当前画面后,可以输出下一段动作。

而 WAM 路线希望模型内部先形成类似:

如果先抓中间:
电缆两端会拖地
后续整理困难

如果先抓插头端:
电缆可能整体被拉直
更容易后续盘绕

然后动作和未来变化一起生成。

这里真正有价值的不是视频好不好看。

而是:

world prediction 给 action prediction 提供了物理上下文。


21.3 DreamZero 的数字为什么引起关注?

你给的材料里提到,DreamZero 报告了几个很醒目的结果:

  • 新任务 / 新环境泛化相对 SOTA VLA 有超过 2× 的提升;
  • 将 14B 级视频扩散模型优化到 7Hz 闭环控制;
  • 用 10–20 分钟 video-only 数据做跨本体 / 人机迁移;
  • 用 30 分钟 play data 做新 embodiment 适配。

这些都属于论文作者自评,不是统一第三方复现结果,所以应该谨慎看。

但它背后的趋势值得重视:

WAM 阵营正在尝试证明,视频先验真的能减少机器人动作数据需求。

这是一个比单纯 benchmark 提高几个点更重要的问题。


22. 代表模型三:X-WAM,开始认真解决“动作要快,世界要精细”的矛盾

X-WAM 这篇我觉得工程味很浓。

它关注一个非常现实的问题:

如果把未来视频和动作完全同步 diffusion:

视频需要很多去噪步
动作也被迫等很多步

那机器人怎么实时?

于是 X-WAM 提出了:

Asynchronous Noise Sampling,ANS。

直觉上就是:

Action:
少几步
先出来
尽快执行

Video:
多几步
慢慢生成
保持质量

也就是让:

“行动”和“想象”使用不同节奏。

这个设计其实非常符合机器人系统需求。

因为人类本身也不是每 20ms 都做一次高清世界模拟。

很多低层动作可以快速执行。

只有高层规划需要更完整的未来预测。


22.1 X-WAM 还做了 4D world modeling

它另外一个明显方向是:

不满足于 2D RGB。

而是预测:

multi-view RGB-D

也就是把未来世界往:

4D world

推进。

这里的 4D 可以粗略理解为:

3D 空间
+
时间变化

为什么重要?

因为机器人真正操作的是三维世界。

如果只预测单视角 RGB,很容易出现:

画面看起来合理
但几何不一致

例如:

机械臂绕到物体背面时,模型发现:

原来物体背面结构根本没建对。

这对生成视频可能还能糊弄。

对机器人抓取就不行了。

所以 WAM 后续一个很可能的重要方向就是:

2D video prediction
       ↓
3D / 4D world prediction

你提供的材料里,X-WAM 报告了在 RoboCasa 和 RoboTwin 2.0 上的成功率,以及超过 5800 小时机器人数据预训练,但同样属于作者自评,应当和第三方 benchmark 区分开看。


23. GR00T N2:工业界已经开始把 WAM 当下一代机器人架构讲了

NVIDIA 这边也很有意思。

GR00T N1 / N1.5 / N1.7 更偏 VLA 谱系。

而你提供的 WAM 调研材料里提到:

GR00T N2 被 NVIDIA 描述为 built on a world action model architecture。

这件事本身比具体 benchmark 更值得看。

因为它说明:

WAM 已经不是纯学术圈里的 taxonomy。

大厂开始主动用这个词重新定义下一代机器人 foundation model。

NVIDIA 对 WAM 的工程描述里有一个点我非常喜欢:

不一定需要生成完整未来图像,而是预测一个压缩的 intended transition representation,然后直接从这个表征推出机器人动作。

这其实再次印证了前面的观点:

World Model 不等于高清未来视频。

工业系统最后大概率会越来越 latent。

因为控制环对 latency 太敏感。


24. 所以 WAM 真正想解决什么?

讲了这么多模型,其实可以把 WAM 的野心压缩成一句话:

让机器人的动作生成建立在“对动作后果的预测”上。

传统 VLA:

我看到这个状态
所以我输出这个动作

WAM:

我看到这个状态

我知道几种动作分别可能导致什么未来

因此我选择这个动作

这两个范式看起来只多了一步。

但其实差很多。

因为第二种开始具备:

  • counterfactual reasoning;
  • planning;
  • failure anticipation;
  • recovery;
  • uncertainty-aware control;

这些能力的基础。


25. 数据问题:为什么 WAM 特别喜欢视频?

WAM 和 VLA 最大的数据差异之一,是:

WAM 对无动作标签视频更有兴趣。

传统 imitation 策略模型 最喜欢的是:

observation
+
language
+
expert action

因为它要学:

这个状态下应该怎么做

而 World Model 想学的是:

世界是怎么变化的

所以即便没有机器人 action label,大规模视频仍然有价值。


26. WAM 的四类数据来源

按照你提供的 WAM 调研材料,可以把数据大体分成四种。


26.1 Robot Teleoperation

最标准的数据:

image
state
action
language

优点:

动作标签完整。

缺点:

贵。

这类数据最适合训练:

action generation
inverse dynamics
robot-specific dynamics

26.2 Human Demonstration

例如:

  • UMI;
  • 第一视角操作;
  • 手持设备采集。

它们的优势是:

比机器人遥操作便宜很多。

但问题:

人类动作和机器人动作空间完全不一样。

所以通常需要:

retargeting
latent action
inverse dynamics

进行桥接。


26.3 Simulation

仿真数据是 World Model 天然喜欢的数据。

因为:

state
action
future state
physics

全都有。

而且可以疯狂收集:

success
failure
collision
recovery
random exploration

尤其对于 world model 来说:

失败数据其实很有价值。

因为它需要学:

什么动作会导致坏结果。

而不只是模仿成功答案。


26.4 Internet / Egocentric Video

这是最有想象空间的一类。

比如:

一个人收纳折叠桌。

视频里面没有机器人动作标签。

但它包含大量信息:

  • 桌子铰链怎么运动;
  • 什么部位可以抓;
  • 折叠之后几何怎么变化;
  • 人如何处理卡住的问题。

这些都是:

世界动态。

如果模型能从视频中抽取 latent action 或运动表征,就可以把这些视频纳入 world pretraining。

这也是 WAM 相比纯 VLA 最吸引人的地方之一:

它试图把互联网规模的“世界变化数据”转成机器人先验。


27. 为什么 Play Data 可能比纯 Expert Demo 更适合 World Model?

这是一个非常容易被忽略的点。

假设我们要训练机器人打开一个很重的工业箱门。

Expert Demo 可能长这样:

抓住把手
稳定拉开
任务完成

非常干净。

但 World Model 真正需要知道的是:

抓偏会怎样?
力量不足会怎样?
门卡住会怎样?
拉得太快会怎样?
中途松手会怎样?

这些内容通常不会出现在漂亮的专家轨迹里。

所以对于 world model:

失败
试探
随机动作
恢复

反而很有价值。

可以把二者理解成:

Expert Demo:
告诉模型“正确答案是什么”

Play Data:
告诉模型“这个世界的规律是什么”

第二篇材料也用了一个很形象的说法:

expert demo 更像答案,play data 更像物理实验记录。

这个比喻我觉得非常准确。


28. 评测:一个 World Model 看起来真实,不代表它能控制机器人

这是 World Model 最容易掉进去的坑。

做视频生成的人喜欢看:

  • FVD;
  • LPIPS;
  • PSNR;
  • SSIM。

问题是:

视频长得漂亮,

不等于:

物理正确。

更不等于:

动作可执行。

例如机器人要把一块金属板插入狭窄卡槽。

模型生成的视频非常丝滑:

金属板顺利插入

但真实几何里:

厚度比卡槽宽 2 mm

这个未来视频再漂亮也没意义。

所以 WAM 的评测必须比普通视频生成更严格。


29. WAM 的三维评测思路

你提供的 WAM 综述把评测拆成三个维度:

Visual Fidelity

Physical Commonsense

Action Plausibility

我觉得这三个维度非常合理。


29.1 Visual Fidelity

先问:

看起来像不像真的?

例如:

  • 物体有没有突然消失;
  • 图像有没有糊掉;
  • 长时序有没有崩;
  • 多视角是否一致。

这是传统生成模型最熟悉的一层。


29.2 Physical Commonsense

再问:

物理上成立吗?

比如:

机器人把一大摞箱子推倒。

视频生成看起来很真实。

但如果箱子:

穿过地面

那就明显不行。

机器人 World Model 最终需要学习:

  • 接触;
  • 重力;
  • 摩擦;
  • 遮挡;
  • 刚体;
  • 柔性体;
  • 工具交互。

这其实比视觉 realism 难得多。


29.3 Action Plausibility

最后问:

这个动作真的能执行吗?

有些生成模型可能预测:

机械臂下一帧已经移动到目标位置

视觉上完全没问题。

但机械臂:

关节速度不允许

或者:

路径穿过障碍物

那就是 action implausible。

所以机器人 World Model 最终不能只是“未来视频生成器”。

它必须理解:

embodiment constraints。


30. 成功率还重要吗?

当然重要。

最终机器人还是要:

任务成功

所以:

  • LIBERO;
  • CALVIN;
  • RoboCasa;
  • RoboTwin;
  • ManiSkill;

这些传统 success rate benchmark 仍然非常重要。

但 WAM 多了一个要求:

不能只看最终结果。

还要看:

模型为什么认为这个动作会成功?

因为它有一个显式或隐式世界预测过程。

这带来一个很有意思的可能性:

未来机器人 failure analysis 不只是:

任务失败

而可以进一步拆:

世界预测错了?

还是动作解码错了?

还是执行控制错了?

这是 WAM 一个潜在的可解释性优势。


31. WAM 当前最大的几个问题

说了这么多优点,下面该泼点冷水了。

WAM 现在离“统一解决机器人问题”还远。

几个问题都挺硬。


32. 问题一:实时性

这是最直接的。

视频模型:

越大
越慢

机器人:

越慢
越容易出事

Manipulation 有些任务:

5 Hz
10 Hz

还能接受。

Locomotion:

可能需要:

50 Hz
100 Hz

你不可能每次都跑一个几十亿参数的视频 diffusion。

所以未来很可能是:

大 World Model
      ↓
高层规划
      ↓
轻量策略模型
      ↓
快速低层控制

或者:

World Model
训练时用

策略模型
推理时用

这也是为什么像 RynnVLA 那种:

训练阶段用未来预测塑造表征,推理阶段不真正展开未来状态预测

的思路,也非常有竞争力。

你提供的 WAM 调研也专门强调了这种对比:

预测当训练先验

vs

预测当策略主体

这可能是未来几年非常关键的一条分岔路。


33. 问题二:World Model 会幻觉

语言模型会幻觉。

视频模型一样会。

而 World Model 幻觉比语言模型更危险。

语言模型说错一句话:

可能只是答案错。

机器人 World Model 如果“想象错未来”:

错误未来
↓
错误动作
↓
真实硬件执行

可能直接造成碰撞。

所以 WAM 最终一定要解决:

  • uncertainty;
  • confidence estimation;
  • out-of-distribution detection;
  • safety filter。

这不是锦上添花。

这是部署必需品。


34. 问题三:长时序预测很难

短期预测和长期规划完全不是一个难度。

预测:

200 ms 后

很容易。

预测:

20 秒之后

就难很多。

尤其多步骤任务:

打开柜子
↓
取出工具
↓
关柜子
↓
移动到工作台
↓
安装零件

前面一个错误可能影响后面所有状态。

这也是 World Model 长期存在的问题:

compounding error。

未来可能需要:

  • hierarchical planning;
  • subgoal;
  • periodic re-planning;
  • memory;
  • closed-loop correction;

而不是一次性把未来预测到任务结束。


35. 问题四:RGB 远远不够

目前很多 World Model / WAM 强烈依赖视觉。

但真正精细的机器人操作,需要:

  • proprioception;
  • force;
  • tactile;
  • torque;
  • depth;
  • audio。

例如机器人拧紧螺丝。

光靠视觉很难知道:

到底有没有拧紧。

真正决定结果的可能是:

torque curve

再比如:

插孔任务。

视觉上看已经插进去了。

但触觉告诉你:

其实卡在边缘

所以未来 WAM 很可能要从:

Vision-Action Model

变成:

Multimodal World-Action Model

WAM 综述也明确指出,目前的路线整体仍然过度 RGB-centric,而触觉、力觉、本体感知等模态仍然不足。


36. 问题五:跨 Embodiment 真的能统一吗?

这是 WAM 最诱人的梦想之一。

如果模型学到的是:

世界变化规律,

那它应该比纯 action 策略模型 更容易跨机器人。

例如任务:

把一个长纸箱从地面移动到货架。

不同 embodiment:

双臂机器人
人形机器人
移动机械臂

动作空间完全不同。

但是世界结果是类似的:

箱子从地面
移动到货架

这也是视频 / world representation 的优势。

因为:

goal world state

比:

joint action

更加 embodiment-agnostic。

所以很多 WAM 工作都喜欢强调:

  • human-to-robot;
  • robot-to-robot;
  • cross embodiment。

但这件事现在更多还是论文自评。

离真正“一个模型控制所有机器人”还有很大距离。


37. WAM 会取代 VLA 吗?

这是我觉得现在最容易被标题党带偏的问题。

我的判断是:

不会简单取代,更可能是融合。

原因很简单。

WAM 自己也需要输出动作。

所以它没有理由把 VLA 的能力扔掉。

更现实的演化是:

VLA
+
World Prediction
+
Memory
+
Planning

最后融合成更强的 Embodied Foundation Model。

你可以把今天很多技术看成:

VLA:
负责行动能力

World Model:
负责未来预测能力

LLM / VLM:
负责语义和任务理解

Memory:
负责长期状态

RL:
负责在线优化

最终它们可能全部融合在一起。

WAM 只是其中一个非常重要的融合方向。

你给出的 WAM 调研最后也做出了类似判断:

WAM 更可能是 VLA 的扩展与吸收,而不是简单取代。

这个判断我基本同意。


38. 我更看好的最终系统:分层,而不是一个模型全包

虽然现在“大统一模型”很性感,但如果让我猜真实机器人最终工程架构,我反而更看好分层。

可能长这样:

Language / VLM
      |
      v
Task Reasoning
      |
      v
World Model / WAM
      |
      v
Future Prediction
+
High-Level Action
      |
      v
快速机器人策略
      |
      v
Low-Level Controller
      |
      v
Motor

也就是:


高层

负责:

  • 任务理解;
  • 长期规划;
  • 世界想象;
  • subgoal。

频率可能:

0.5 ~ 5 Hz

中层

负责:

  • manipulation skill;
  • trajectory;
  • action chunk。

频率可能:

5 ~ 20 Hz

低层

负责:

  • force control;
  • impedance;
  • locomotion;
  • safety。

频率可能:

50 ~ 1000 Hz

这种架构更符合机器人本身的多时间尺度特性。

并不是所有决策都需要一个 14B World Model。


39. 一个我觉得特别重要的趋势:World Model 正在从 simulator 变成 策略模型

如果把过去十年的路线连起来,会发现一个特别有意思的变化。

最早:

World Model

是 策略模型 旁边的模拟器。

后来:

策略模型

开始在 World Model 里训练。

现在:

World Model + 策略模型

开始合并。

可以粗略画成:

2018

World Model
    ↓
Dream
    ↓
Controller

然后:

2020+

World Model
    ↓
想象式多步预测
    ↓
Actor-Critic

再到:

2025+

World Model
+
Action Model
        ↓
      WAM

也就是说:

“理解世界”和“行动”正在从两个模块,逐渐变成一个统一建模问题。

这也是为什么 WAM 值得关注。

它可能不是最后答案。

但它很可能代表一个非常重要的趋势。


40. 真正的长期目标:Agent 要拥有 Counterfactual World

如果继续往远看,我觉得 World Model 最终最重要的能力不是:

视频生成。

也不是:

next frame prediction。

而是:

counterfactual reasoning。

也就是:

如果我这么做,会怎样?

如果换一个动作呢?

如果失败了呢?

如果环境突然变化呢?

如果另一个 Agent 介入呢?

一个真正强的机器人应该可以:

生成多个可能未来
↓
比较风险
↓
选择行为
↓
观察真实结果
↓
更新内部世界

这时候它才真正拥有一个:

“可交互的内部世界”。


41. World Model、VLA、WAM,到底怎么记?

如果看到这里已经开始概念混乱,可以记一个最简单的版本。


VLA

问:

我现在应该做什么?

Observation + Language
        ↓
      Action

World Model

问:

我这样做以后会发生什么?

Observation + Action
        ↓
   Future State

WAM

问:

未来会怎样,以及我应该怎么做?

Observation + Language
        ↓
Future State + Action

就这么简单。


42. World Model 的几条路线,可以怎么选?

如果你是做研究,其实没必要被“World Model”这个大词吓住。

它下面至少有几条完全不同的路线。


路线一:Video World Model

关注:

未来世界长什么样?

适合:

  • 视频生成;
  • simulator;
  • robot data generation;
  • high-level planning。

路线二:Latent World Model

关注:

未来状态 representation 如何变化?

适合:

  • 高效 planning;
  • control;
  • representation learning。

路线三:State Dynamics

关注:

物理状态如何变化?

适合:

  • locomotion;
  • manipulation;
  • model-based RL;
  • MPC。

路线四:3D / 4D World Model

关注:

空间几何如何长期一致?

适合:

  • robot manipulation;
  • navigation;
  • digital twin;
  • spatial intelligence。

路线五:World Action Model

关注:

世界变化和动作能不能一起建模?

适合:

  • robot foundation model;
  • 零样本策略;
  • cross-embodiment learning。

43. 如果现在入坑,我会怎么学?

如果是刚开始接触这个方向,我不建议第一天就研究 DreamZero 这种十几 B 的 WAM。

那样大概率会:

看论文觉得很牛,代码完全跑不动,最后只剩下读摘要

更合理的路线是:

Dreamer
↓
TD-MPC
↓
简单 Action-Conditioned Dynamics
↓
Video Prediction
↓
VLA
↓
WAM

先真正理解:

state
action
next state

这三个东西之间的关系。

然后再研究:

video token
latent action
joint diffusion

会容易很多。

第二篇材料同样建议新手先从 DreamerV3、TD-MPC2、小规模 action-conditioned dynamics 和 VLA baseline 开始,再读 DreamZero、Motus、DreamDojo 等 foundation-scale 工作。


44. 最后一个问题:WAM 会不会只是又一个新名字?

这个问题其实挺合理。

AI 圈特别喜欢重新命名。

比如:

Dynamics Model
World Model
World Foundation Model
Action World Model
World Action Model
Video Action Model

有时候确实只是 taxonomy 越来越复杂。

但我觉得 WAM 背后有一个真正值得注意的变化:

机器人基础模型的训练目标正在发生变化。

以前:

预测动作

现在开始加入:

预测未来状态
+
预测动作

也就是从:

What should I do?

变成:

What will happen,
and what should I do?

这个变化是真实存在的。

至于最后行业会不会继续叫 WAM,其实没那么重要。


46. 总结

如果把整篇文章压缩成几个核心观点,大概是下面这些。

World Model 最早来自 Model-Based RL。

它解决的问题一直是:

能不能让 Agent 在真实行动之前预测未来?

Dreamer 让智能体在 latent space 中 imagination。

MuZero 告诉我们:

世界模型不一定需要重建真实世界,只要对决策有用。

JEPA 又进一步强调:

与其预测所有像素,不如预测更抽象的未来表征。

后来视频生成模型快速发展,大规模视频开始成为一种新的“世界动态数据”。

与此同时,机器人领域的 VLA 已经证明:

Vision + Language -> Action

是一条有效路线。

但 VLA 的短板也越来越明显:

它更擅长“看到以后做什么”,而不是“做了以后会发生什么”。

于是 World Action Model 开始出现。

它试图把:

World Modeling
+
Action Generation

统一起来。

最终学习:

future world
+
future action

的联合分布。

这也是 DreamZero、UWM、X-WAM、GR00T N2 等最近工作背后的共同方向。

如果说 VLA 给机器人的是:

反应能力。

那么 WAM 想补上的,是:

想象能力。

而一个真正强的物理世界 Agent,最终很可能同时需要:

感知
+
语言理解
+
世界模型
+
记忆
+
规划
+
动作
+
反馈

所以我并不认为未来一定是:

WAM 替代 VLA

更可能是:

VLA
      +
World Model
      +
Planning / Memory / RL

          ↓

更完整的 Embodied Foundation Model

再往后,模型内部也许不会再严格区分:

哪部分是 world model,哪部分是 策略模型。

“想象未来”和“选择动作”可能只是同一个模型的两种推理模式。

到那时候,机器人行为链路可能不再只是:

看到
↓
行动

而是:

看到
↓
理解
↓
想象多个未来
↓
判断后果
↓
选择行动
↓
观察真实结果
↓
修正内部世界

这大概也是 World Model 最值得期待的地方。

它并不是为了让机器人生成一段更漂亮的视频。

而是为了让机器人在真正接触物理世界之前,

先在自己的内部世界里试一次。


延伸阅读

如果希望继续深入,可以优先关注以下几条论文脉络:

  • Ha & Schmidhuber — World Models
  • PlaNet / Dreamer 系列
  • MuZero
  • I-JEPA / V-JEPA / V-JEPA 2
  • Genie / Genie 2
  • NVIDIA Cosmos
  • Unified World Models(UWM)
  • DreamZero
  • X-WAM
  • World Action Models: The Next Frontier in Embodied AI

点赞收藏
// 评论2
0 / 500
NOTA62026-08-31 10:02

很赞,是WM/WAM入门地图

coffee co.2026-09-03 17:02

@NOTA6 感谢,是的,参考了很多很多资料