技术博客
官方精选WAM 世界模型

World Action Models 综述解读

World Action Models 综述解读

原标题:World Action Models: The Next Frontier in Embodied AI

论文链接:https://arxiv.org/abs/2605.12090

项目主页:https://openmoss.github.io/Awesome-WAM/

代码地址:https://github.com/OpenMOSS/Awesome-WAM

从 VLA 到 WAM:为什么需要"会想象"的模型?

要理解 WAMs,我们先要从它的前身,视觉-语言-动作模型(Vision-Language-Action, VLA)说起。

VLA 模型在过去几年取得了惊人的进展。它能看懂图像、理解自然语言指令,然后直接生成机器人动作。给它一句"把红色的杯子递给我",它真的能完成任务。这种语义泛化能力是过去基于规则或纯强化学习的方法难以企及的。

但综述作者敏锐地指出了一个根本缺陷:VLA 学的是"观察到动作"(observation-to-action)的反应式映射,它从未显式地建模物理世界在施加处理之后如何演变。打个比方,这就像一个只靠肌肉记忆开车的司机,他知道在某个场景下该踩刹车,但他并不真正理解"踩了刹车之后车的速度会以怎样的曲线减下来"。一旦遇到训练数据没覆盖的路况,这种反射式驾驶就会出问题。

为了解决这个问题,研究者们开始把世界模型(World Models),即预测环境动态演变的模型,引入动作生成的流程。世界模型源自强化学习领域,核心思想是让 AI 在脑中构建一个"小型物理引擎",能预测"如果我做动作 a,环境状态会从 s 变成 s'"。

当这两条技术路线交汇,就诞生了论文所定义的 WAMs。作者给出的正式定义是:WAMs 是一类具身基础模型,它统一了预测性状态建模与动作生成,目标是建模"未来状态与动作的联合分布",而不仅仅是动作的分布

这个定义看似抽象,但内涵很深。它意味着模型不再只回答"我该做什么",而是同时回答"我做了之后会发生什么"。这两个问题互相耦合,预测得越准,动作选择就越好,动作的实际结果又能反过来校准预测。这正是人类认知中"心理模拟"(mental simulation)的核心机制。

WAMs 的分类学:Cascaded vs Joint

这篇综述最重要的贡献之一,是为碎片化的现有研究建立了一套清晰的分类体系。作者把所有 WAMs 方法分成两大类:级联式(Cascaded WAMs)联合式(Joint WAMs)

级联式 WAMs:采用"两步走"的设计,先用一个世界模型生成对未来的预测(通常是未来的图像帧或视频),然后再用一个动作模型基于这些预测生成动作。这种架构的优点是模块清晰、各部分可以独立优化、训练数据来源也更灵活,比如世界模型可以用海量的互联网视频预训练,动作模型再用相对稀缺的机器人数据微调。缺点是两个模块之间存在信息瓶颈,预测的误差会传递给动作生成。

联合式 WAMs:则把状态预测和动作生成放在同一个模型里联合优化,共享内部表示。这种方法更优雅,理论上能让预测和动作互相促进、共同改进,但训练难度更高,对数据和算力的要求也更苛刻。

在这两大类之下,作者还按三个维度进一步细分:生成模态(模型预测的是像素级图像、潜变量、还是离散 token)、条件机制(用文本指令、目标图像、还是历史观察来引导生成)、动作解码策略(自回归生成、扩散模型、流匹配等)。这种多维度的分类法,让读者能快速定位任何一篇 WAMs 论文在整个领域版图中的位置。

数据从哪里来?WAMs 的数据生态

任何基础模型的成功都离不开数据,WAMs 也不例外。综述系统地分析了支撑这个领域的四大数据来源,每一种都各有特色与局限。

机器人遥操作数据:是最直接、质量最高的数据,由人类操作员远程控制机器人完成任务而生成。它的优势是动作精确、与机器人本体严格对齐,但采集成本极高,规模通常有限。

便携式人类示范数据:通过让人类戴上传感器手套、AR 眼镜等设备直接演示任务来收集。这种方式比遥操作便宜得多,能快速获得大量数据,但存在"人手到机械手"的域差距(domain gap)问题。

仿真数据:通过物理引擎合成,理论上可以无限生成,而且自带精确的状态标签。但仿真与真实世界之间永远存在"sim-to-real"鸿沟,尤其在涉及柔性物体、复杂接触时差距明显。

互联网规模的第一人称视频(egocentric video):是近年最受期待的数据源——YouTube、TikTok 上有海量的人类活动视频,蕴含着丰富的物理和因果常识。但这些视频没有动作标签,如何从纯视觉数据中"反推"出可用于动作学习的信号,是一个核心研究问题。

WAMs 之所以有潜力,部分原因正在于它能跨越这些数据源,用海量视频预训练世界模型部分,用少量机器人数据微调动作部分。这是单纯 VLA 难以做到的。

如何评价一个 WAM 的好坏?

综述把现有的 WAMs 评估协议归纳为三个维度,这三个维度分别回答三个不同的问题。

视觉保真度(Visual Fidelity) 回答:"模型预测的未来画面像真的吗?"用的是图像生成领域熟悉的 FID、PSNR、SSIM 等指标。但这只是表面,一张漂亮的预测图未必符合物理。

物理常识(Physical Commonsense) 回答:"预测符合物理规律吗?"这是更深层的评估。比如,物体在没有支撑时是否会下落?碰撞之后的反弹方向是否合理?这一维度往往需要专门设计的评估场景。

动作合理性(Action Plausibility) 回答:"基于预测生成的动作真能完成任务吗?"这是最终极的检验,通常通过在仿真或真实机器人上的任务成功率来衡量。

一个有趣的观察是:三个维度并非完全相关。有些方法画面生成很惊艳但物理常识薄弱,有些则相反。这提醒研究者,追求像素级真实并不等于追求好的世界模型,重要的是模型是否捕捉到了支配世界运行的潜在规律。

总结

综述在最后讨论了若干开放挑战:如何在长时程任务中保持预测稳定?如何更高效地利用无标签视频数据?如何让 WAMs 在新机器人本体上零样本泛化?这些问题任何一个解决了,都可能催生下一代具身智能的突破。

点赞收藏
// 评论1
0 / 500
Leza2026-07-24 14:45

很有用