WAM 世界模型多模态分类技术综述

从 World Model 到 World Action Model:具身智能正在进入“先想象,再行动”的时代

coffee co.2026-08-25 17:47
从 World Model 到 World Action Model:具身智能正在进入“先想象,再行动”的时代

从强化学习里的环境预测,到视频生成里的世界模拟,再到机器人领域的 World Action Model(WAM),AI 正在尝试获得一种新的能力:

不是看到世界后立即反应,而是在行动之前先预测世界会如何变化。

过去几年,具身智能(Embodied AI)领域最热门的关键词之一是 VLA(Vision-Language-Action)。

我们希望机器人能够:

  • 看懂环境;
  • 理解人类指令;
  • 生成对应动作。

例如:

“把桌面上的工具盒整理到抽屉里。”

VLA 的目标是学习:


视觉观察 + 语言指令
|
v
动作输出

模型看到当前状态,然后直接预测下一步动作。

但随着机器人任务越来越复杂,一个问题逐渐暴露出来:

一个真正智能的机器人,仅仅知道“下一步应该做什么”是不够的。

它还需要知道:

  • 如果移动这个物体,会不会撞到旁边的东西?
  • 如果抓取失败,物体会掉到哪里?
  • 如果当前路径被阻挡,换一种策略会不会更好?
  • 如果连续执行五个动作,最终结果是否符合预期?

换句话说:

机器人需要的不只是动作能力。

它需要一种对未来的想象能力。

这也是 World Model(世界模型)重新成为热点的原因。


目录


1. 为什么 AI 开始需要一个“内部世界”

如果观察今天的大模型发展,会发现一个非常明显的趋势:

语言模型学习的是:

世界中的语言规律。

视觉模型学习的是:

世界中的视觉规律。

而具身智能需要学习:

世界如何变化,以及行动如何改变世界。

这三者之间最大的区别是:

机器人必须和世界发生交互。

一个语言模型回答:

“如果把玻璃杯推到桌边,会发生什么?”

它可以根据文本知识回答。

但机器人需要真正知道:

  • 推多少力度?
  • 桌面摩擦如何?
  • 杯子重量是多少?
  • 倾斜角度达到多少会掉落?
  • 掉落过程中是否会碰撞其他物体?

这些问题,本质上都是:

action 会导致什么 consequence?

也就是动作产生的后果预测。


1.1 没有 World Model 的机器人是什么样?

传统策略模型通常类似:


Observation
|
v
Policy Network
|
v
Action

例如:

摄像头看到:

  • 一个散乱的零件盒;
  • 工具散落在工作台。

语言指令:

“整理这些零件。”

模型输出:


移动机械臂
抓取零件
放入盒子

问题在哪里?

它知道:

“现在应该抓。”

但是不知道:

“抓之后会怎样。”

例如:

  • 零件是否容易滑落?
  • 盒子是否已经满了?
  • 放置位置是否稳定?
  • 下一步动作是否还能继续?

因此很多 VLA 模型在短任务上表现很好。

但是到了:

  • 长时间任务;
  • 多步骤任务;
  • 开放环境任务;

性能会明显下降。


1.2 人类为什么可以完成复杂任务?

因为人类大脑并不是简单的:


看到 -> 行动

而更像:


观察当前世界

↓

在脑中模拟多个未来

↓

比较不同结果

↓

选择最优动作

↓

执行

比如一个人整理房间:

他不会马上拿起第一个物品。

他可能会先想:

  • 这个东西应该放哪里?
  • 如果先移动这个,会不会挡住后面的操作?
  • 哪些物品应该一起处理?

这种能力,就是一种内部世界模型。

AI 研究者希望构建类似机制。


2. World Model 的起源:让智能体在梦境中学习

World Model 并不是最近才出现的概念。

早在强化学习(Reinforcement Learning)时期,研究者就已经意识到:

如果智能体能够学习环境规律,那么它就可以减少真实世界交互。

传统强化学习:


Agent

选择动作

↓

真实环境

↓

获得反馈

↓

更新策略

问题:

真实环境交互非常昂贵。

例如:

游戏 AI:

失败一百万次没关系。

机器人:

摔倒一次可能:

  • 损坏机械结构;
  • 重新校准;
  • 人工恢复。

因此研究者提出:

能不能让机器人先在一个模型世界里面学习?

也就是:


真实世界数据


学习 World Model


模拟未来


训练 Agent


部署真实世界

3. 从 World Models 到 Dreamer:让 AI 在“梦里学习”

2018 年,Ha 和 Schmidhuber 提出的:

World Models

是这个方向非常重要的起点。

论文提出:

智能体可以拥有一个内部世界。

这个世界不需要完全复制现实。

只需要能够帮助决策。

整体结构:


视觉输入

↓

Vision Model

↓

Latent State

↓

Memory Model

↓

Future Prediction

↓

Controller

↓

Action

核心思想:

模型先学习:

世界如何变化。

然后:

策略模型在这个内部世界里训练。

这个想法非常重要。

因为它改变了强化学习的基本假设:

过去:

智能来自大量试错。

World Model:

智能来自理解环境,然后进行想象。


3.1 Dreamer:进入真正的 latent imagination

随后 DeepMind 提出的 Dreamer 系列进一步推动了 World Model。

Dreamer 的关键思想:

不要直接预测未来像素。

原因:

真实世界像素太复杂。

例如机器人打开一个抽屉:

视觉变化包括:

  • 光照变化;
  • 背景变化;
  • 纹理变化;
  • 相机运动。

但真正重要的是:

  • 抽屉位置;
  • 机械臂状态;
  • 接触关系;
  • 任务进度。

因此 Dreamer 学习:

latent dynamics。

即:


Observation


Encoder


Latent State

Latent State + Action


Future Latent State

然后策略在 latent space 中进行 imagination rollout。

例如:

机器人准备打开柜门。

模型可以模拟:

方案 A:


抓住把手
拉动
预测:
柜门打开

方案 B:


从侧面推
预测:
柜门偏移
任务失败

方案 C:


调整角度
重新抓取
预测:
成功概率更高

最终选择更好的动作。

这就是 World Model 的核心价值:

不是生成未来,而是帮助决策。


下一篇讲讲
MuZero、JEPA、视频生成 World Model、VLA 局限,以及为什么 WAM 成为下一阶段方向

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发