技术博客
其他

不按时钟切,按动作切:读懂 WALL-WM 的世界-动作模型

Truman2026-07-09 14:51
不按时钟切,按动作切:读懂 WALL-WM 的世界-动作模型

论文链接:

https://arxiv.org/abs/2606.01955

项目主页:

https://x2robot.com/pages/wm

代码地址:

https://github.com/X-Square-Robot/wall-x




机器人要"听懂话、看懂画面、做对动作",难点在于这三者节奏完全不同:语言讲的是目标和事件,画面是连续流动的,而动作要精确到接触和毫秒级时序。


X Square Robot 团队的 WALL-WM 提出一个看似朴素却关键的问题,学习的"最小单位"到底该怎么切?




老办法卡在哪:用"外部时钟"切动作


现在主流的具身基础模型大多这么做:看一眼当前画面加一句指令,直接预测一段固定长度的动作块(action chunk)。方便是方便,但相当于拿一把秒表去切机器人的行为,一刀可能切在"抓取"动作的中间,也可能把"伸手+抓+放"挤进一个窗口。


论文认为,这会让训练退化成"短时程的相关性拟合":既浪费了从大规模视频里学到的视觉-语义先验,还可能用动作捷径把这些先验覆盖掉,削弱长程任务和组合能力。下图直观说明了三模态在"语义抽象"与"时空精度"上各占一方,需要被对齐而非压成一团。





核心思想:在"事件的关节处"下刀


论文借柏拉图"按事物本来的关节去切分"的说法,主张“固定块是按时钟切的,而语义事件是按行为本身切的”。于是它把最小单位换成"动作落地的语义事件",比如伸手、抓取、抬起、移动、放置这样一段完整行为:语言能命名它,视频能看到它,动作能执行它,且时长随任务而变,而不是被钉死。



这正是 WALL-WM 训练的出发点:把字幕、视频片段、动作片段在同一个事件区间上对齐,让模型去"去噪"还原这段未来的视频和动作。




怎么搭起来:视频塔 + 动作塔逐层耦合


架构上,一个继承自阿里 Wan 系列文生视频模型的视频塔,和一个随机初始化的动作 DiT(动作塔)逐层耦合,预训练编码器冻结,动作流逐块去"读"对应的视频特征,但不反过来改视频流。视频塔还加了多视角注意力、Camera RoPE(给每个相机免标定的身份)和跨视角几何掩码,用 Wan 风格的 v-prediction 流匹配训练。




一个底座,两种用法


同一个事件预训练底座,推理时有两种模式:

  • 事件模式:由一个 VLM、人或 agent 提出"下一个事件"的描述,模型执行对应的变长片段,跟着任务的自然节奏走。

  • 统一模式:仍然输出固定长度的块以便部署,但不再只看全局指令,而是用带 Staircase Decoding(阶梯式解码) 的 VLM 给出事件结构化的隐式推理来引导,同时保持一条"梯度连续"的通路。推理模块构建在 Qwen3.5-9B 之上。




规模化的工程底子


WALL-WM 配了事件级字幕的数据生态、cluster-balanced(按聚类平衡)采样,以及基于 Muon 优化器的大规模预训练设施。Muon 是近一两年兴起的优化器,用矩阵正交化替代 AdamW 的逐元素自适应,在大模型预训练上展现出更高的算力效率。




效果如何


在真机"多样化操作"基准上,事件模式的 WALL-WM 平均 Task Progress 达到 75.86,明显高于从零训练的统一基线(63.00)、π0.5(55.64)、DreamZero(39.97)和 LingBot-VA(29.71)。



作者强调,事件模式的优势不在于每个单项都赢,而在于在一整套差异很大的任务上拿到最稳、最高的总体进度。




总结


WALL-WM 的态度很明确:它不把自己当成视频模型的一次"短期微调",而是面向下一代具身基础模型的、保持先验的规模化方法论。把"在哪里切"这件被长期忽略的小事摆到台面上,可能正是它最有意思的地方。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发