技术博客
WAM 世界模型

【三分钟看懂 ODEWorld】别再一帧一帧猜未来:让世界模型沿真实时间连续“流动”

yiwan-cat2026-08-06 11:54
【三分钟看懂 ODEWorld】别再一帧一帧猜未来:让世界模型沿真实时间连续“流动”

图 1 从离散视频帧走向连续物理时间的 ODEWorld

假设让机器人把一只虾夹起来,再放进锅里。

摄像头看到的世界,是第 1 帧、第 2 帧、第 3 帧;但机械臂真正经历的世界并没有“帧”。夹爪在两张画面之间仍然在移动,物体仍然在改变位置,接触关系也在连续变化。

这正是很多视觉世界模型一个很容易被忽略的矛盾:真实世界的时间是连续的,我们给模型的数据却是一张张离散画面。

传统方法通常学的是“从这一帧跳到下一帧”。而来自清华大学智能产业研究院(AIR)与 UC Berkeley BAIR 的研究团队换了一个问题:

与其不断猜“下一帧是什么”,能不能直接学习“世界此刻正在朝哪个方向、以多快的速度变化”?

这就是论文提出的 Physical-Time Flow(PT-Flow),以及建立在它之上的连续时间潜空间世界模型 ODEWorld

这篇论文真正有意思的地方,不只是“能补帧”。如果把它读懂,你会发现:任意时间分辨率、时间补全、反向预测、连续潜空间规划,其实都是同一条速度场自然长出来的能力。


01 世界明明是连续的,为什么模型总在“跳格子”?

先把最常见的离散预测写得极简一点。

如果当前状态是 $s_t$,传统预测模型大致在学习:

$$
s_{t+\Delta t}=F(s_t,c)
$$

其中 $c$ 可以是目标图像,也可以是语言指令。

问题不在于这个公式“错了”,而在于它天然绑定了一个时间步长 $\Delta t$。训练视频每隔固定时间采一帧,模型学到的就是这些采样点之间的跳转。

于是一个很现实的问题出现了:如果我突然问“0.037 秒时世界是什么样”,而训练帧恰好没有这个时刻呢?

离散模型手里只有一个个节点;ODEWorld 想学的,则是穿过这些节点的一条连续轨迹。

PT-Flow 的核心公式只有这一条最值得记住:

$$
\frac{dz_t}{dt}=v_\theta(z_t,t;z_0,c),
\qquad
z_T=z_0+\int_0^T v_\theta(z_t,t;z_0,c),dt
$$

这里的 $z_t$ 是压缩后的潜状态,$v_\theta$ 是模型学到的“瞬时速度场”。

翻译成人话就是:模型不再直接猜终点,而是先学会当前位置该往哪走、走多快;未来状态则通过沿时间一路积分得到。

图 2 PT-Flow 与 ODEWorld 整体架构

这里还有一个很容易混淆的点:PT-Flow 虽然名字里也有 Flow,而且同样学习速度场、同样可以用 ODE solver,但它和生成模型里的 Flow Matching 不是一回事。

Flow Matching 里的“时间”通常表示从噪声走向数据的生成过程;PT-Flow 里的 $t$ 是真实经过的物理时间。 前者回答“怎样从噪声生成样本”,后者回答“真实系统经过 0.1 秒、0.2 秒后会怎么变化”。论文 Fig.1(a)(b) 专门强调的就是这个区别。


02 第一个难点:像素太复杂,ODE 到底应该对什么建模?

如果直接在整张图像上学习“速度”,会遇到一个很尴尬的问题。

机器人视频里,真正随时间变化的可能只有机械臂、夹爪和少数物体;桌面纹理、墙壁、灯光背景在许多帧里几乎不动。让一个速度场同时负责“背景是什么”和“东西怎么动”,相当于让大量静态信息淹没真正的动力学信号。

ODEWorld 因此做了两层压缩。

第一层,使用冻结的 DINOv2 把原始图像 $x_t$ 编码成视觉特征 $s_t$。论文中的 DINO 特征大小是:

$$
s_t\in\mathbb{R}^{16\times16\times768}
$$

第二层更激进:动态编码器 $f_{dyn}$ 同时看当前状态 $s_t$ 和初始状态 $s_0$,只抽取“相对于初态发生了什么变化”,得到:

$$
z_t=f_{dyn}(s_t;s_0),
\qquad
z_t\in\mathbb{R}^{1\times768}
$$

也就是说,空间 token 从 $16\times16=256$ 个压到了 1 个 token。按特征标量数量算,是从 196,608 个压到 768 个,缩小了 256 倍。

为什么信息没有直接丢光?关键就在 $s_0$。

你可以把初始状态理解成一张“场景底片”:桌子长什么样、背景在哪里,这些静态信息可以随时从 $s_0$ 取;$z_t$ 就不用重复背诵背景,只负责记住“相较于底片,什么东西发生了变化”。解码时再把 $z_t$ 和 $s_0$ 合起来还原当前状态。

这个设计叫 Dynamical Representation Decoupling,静态—动态解耦

它不是单纯为了省显存。更重要的是,它给 ODE 清理出一个“更像动力系统”的潜空间:少一点静态纹理,多一点连续变化。

论文消融也支持这一点:去掉这种解耦后,潜轨迹明显更抖,64 帧预测的 LPIPS 从 ODEWorld 的 0.134 恶化到 0.212

图 3 不同潜空间中的轨迹对比:ODEWorld 的动态潜轨迹更平滑


03 第二个难点:训练视频明明是离散帧,连续“速度”从哪来?

这才是 ODEWorld 最值得仔细看的地方。

我们想让速度网络输出 $\dot z_t$,也就是“潜状态此刻变化多快”。可训练集只给了一帧一帧的 $s_t$,并没有直接告诉你 $\dot z_t$。

最朴素的办法,是先用相邻帧估计视觉特征空间里的速度:

$$
\dot s_t\approx\frac{s_{t+1}-s_t}{\Delta t}
$$

但论文没有简单做两帧相减。DINOv2 是单帧视觉编码器,相邻画面哪怕只动一点点,特征也可能出现高频抖动。ODEWorld 使用 Savitzky–Golay 导数滤波器,在 5 帧局部窗口里做平滑求导;论文实现采用的核为:

$$
\frac{1}{10}[-2,-1,0,1,2]
$$

得到较稳定的 $\dot s_t$ 后,还有最后一道坎:我们需要的是潜空间速度 $\dot z_t$,不是 DINO 空间的 $\dot s_t$。

这时 JVP(Jacobian-vector product,雅可比—向量积)登场了。

因为:

$$
z_t=f_{dyn}(s_t;s_0)
$$

而在一次预测过程中 $s_0$ 固定不动,所以沿时间求导后:

$$
\dot z_t=
\frac{\partial f_{dyn}(s_t;s_0)}{\partial s_t},\dot s_t
=\operatorname{JVP}(f_{dyn},\dot s_t)
$$

JVP 的直觉其实很简单:不要问整个编码器的雅可比矩阵长什么样,只问“如果输入正沿 $\dot s_t$ 这个方向移动,编码结果会沿什么方向移动?”

这样就得到了可以直接监督速度场的目标 $\dot z_t$。

图 4 离散视频如何经 JVP 变成可监督的连续潜速度

最终,轻量速度网络只需要学:

$$
v_\theta(z_t,t;z_0,c)\approx \dot z_t
$$

论文使用的是一个只有 3 层 MLP 的速度网络,时间信息通过 FiLM 注入。推理时再用 RK4 等现成 ODE 求解器沿这个速度场积分。

这一步也解释了论文所谓的 Direct First-Order Supervision:它不是只监督“预测后的 embedding 像不像目标 embedding”,而是直接监督“一阶变化率对不对”。

图 5 速度场与连续潜空间规划:红色规划轨迹沿学习到的速度场向目标演化

一个自然的质疑:只有 1 个 token,会不会表征坍缩?

作者在附录里专门用 RankMe 看了有效秩。在相同采样协议下:

表征

维度

平均有效秩

V-JEPA 2

1024

203.7

DINOv2 CLS

768

376.1

ODEWorld $z$

768

425.2

至少从这项诊断看,这个单 token 并没有塌成一个缺乏变化维度的表示。论文甚至发现去掉速度目标上的 stop-gradient 后仍能稳定训练,而且对应视频指标并未崩掉,这进一步说明“一阶速度约束”本身就在强迫潜空间保留可区分的时间变化。

当然,有效秩高并不等于已经证明表征“包含全部真实物理量”;它只能说明作者所担心的那类低秩坍缩没有明显发生。


04 为什么一条速度场,会自然长出三种以前要分开做的能力?

一旦模型手里不再是固定步长的“下一步函数”,而是一条连续速度场,很多能力就突然统一了。

1. 任意时间分辨率

ODE 求解得到的是连续轨迹。想看 $t=0.05$ 就查 0.05,想看 0.123 就查 0.123;想让视频更密,就多取几个采样点。

这也是为什么项目主页可以把播放速度从 0.1×、0.5×一路切到 4×:模型的基本对象不是固定帧率序列,而是连续时间轨迹。

2. 缺帧补全 / 时间超分辨率

论文把训练序列降采样到原始帧率的 1/3,ODEWorld 仍然可以查询训练时没有给出的中间时间点,并生成连贯状态。

注意,这和传统像素插值的逻辑不同:它不是拿前后两张图“糊”一张中间图,而是在学到的潜空间动力轨迹上查询中间状态,再解码回画面。

图 6 任意时间分辨率生成与时间超分辨率

3. 反向预测

ODE 还有一个很漂亮的性质:把积分方向反过来,也就是沿 $-v_\theta$ 走,同一套速度场便可以生成反向序列。

图 7 同一连续速度场进行前向与反向预测

但这里一定要加一个边界:“能反向积分”不等于“恢复了现实世界唯一真实的历史”,更不意味着所有物理过程都严格可逆。 它证明的是作者学习到的潜空间流能够稳定地沿相反方向数值积分,并生成论文所展示的合理反向运动。

同理,“任意时间分辨率”也不等于“无限帧率都绝对物理正确”,更不等价于机器人的控制频率被无限提高。训练证据仍来自离散视频,连续性来自模型对这些观测之间动力结构的学习。


05 这套设计真的只是“数学上优雅”吗?看 64 帧就知道了

连续时间建模如果只是形式漂亮,却更慢、更糊,那对机器人没有太大意义。

论文在 LIBERO 视频预测中对比了 LDP 和 V-JEPA 2。先看两个指标:PSNR 越高越好,偏像素级还原;LPIPS 越低越好,更接近人类感知层面的差异。

64 帧长程预测时:

  • LDP:PSNR 16.27,LPIPS 0.461,延迟 3.953 s

  • V-JEPA 2:PSNR 16.47,LPIPS 0.166,延迟 0.619 s

  • ODEWorld:PSNR 19.46,LPIPS 0.134,延迟只有 0.072 s

换算一下,0.072 秒大约是 LDP 延迟的 1/54.9,也是 V-JEPA 2 的 1/8.6。论文说明这些推理延迟在单张 A100 GPU 上评估。

为什么会这么快?前面的“单 token”终于在这里兑现成工程收益:ODE solver 主要在 $1\times768$ 的动态潜变量上积分,速度场又只是 3 层 MLP;模型没必要在每一个时间点都重新处理一大张高维视觉状态。

图 8 视频预测、LIBERO-LONG 与真实机器人实验的核心量化结果


06 更关键的是:它不是只会生成视频,还能给机器人“递路标”

对具身智能来说,世界模型最终不该只是视频播放器,而要能帮策略做决定。

ODEWorld 的做法很自然:既然连续轨迹上任意时刻的 $z_t$ 都能取出来,那就把这些未来潜状态当成 subgoal(子目标),告诉低层策略“接下来应该经过哪里”。

论文测试了速度条件、单子目标、连续多个子目标三种方式。其中 sequential subgoals 会沿 ODE 轨迹依次取 5 个潜状态给策略提供更密的未来路标。

在 LIBERO-LONG 的 10 个任务上,论文 Table 2 给出的平均成功率是:

  • VPP:81.0%

  • ODEWorld(Velocity):82.3%

  • ODEWorld(Single subgoal):82.6%

  • ODEWorld(Sequential subgoals):83.6%

这里顺便提醒一个论文 v1 自身的小笔误:Table 2 明确写的是 83.6%,但后面的正文写成了 83.2%。本文采用可以直接逐项核对的表格值 83.6%。

真正让我觉得比“多 2.6 个百分点”更有意思的,是后面的真实机器人实验。

作者在双臂 AgileX 机器人上,以 X-VLA 为策略骨干测试 Shrimp-to-pot、Mouse packing、Pen insertion 和 Bi-manual rearrangement 四项任务。在相同策略骨干和训练协议下:

图 9 四项真实机器人操作任务的初始场景

X-VLA 平均成功率为 55%;加入 ODEWorld 生成的 sequential subgoals 后,提高到 80%

四个任务分别从 80/60/30/50% 提升到 90/80/70/80%

这组结果至少说明:ODEWorld 学到的连续潜状态不只是“能解码成好看的未来画面”,它还能作为规划信息真正进入策略学习。

不过,这仍然是四项特定真实机器人任务上的结果,不能外推成“所有机器人控制都能提升 25 个百分点”。


07 ODEWorld 真正改变的,不是帧率,而是“预测对象”

读完整篇论文,我觉得最值得记住的其实不是 0.072 秒,也不是 1 个 token。

而是这句:

世界模型可以不再把未来看成“一串需要逐帧猜出来的图片”,而把它看成“一条在真实时间中连续演化的状态轨迹”。

静态—动态解耦负责把这条轨迹放进干净的潜空间;JVP 把离散视频里估计出的变化速度投影进去;一阶监督让 3 层 MLP 学会“此刻应该怎么变”;ODE solver 再沿这套速度场向任意时刻积分。

于是,任意时间采样、补中间状态、反向生成、连续子目标规划都不再是四个互不相关的“小功能”,而是同一条连续轨迹的不同读法。

这也是 ODEWorld 相比“再做一个更强下一帧预测器”更值得关注的地方。

它当然还没有从视频中恢复出一套唯一的真实物理方程,也没有证明视觉世界模型已经理解所有连续物理规律。但它把一个很基础、也很重要的问题摆到了台面上:

机器人活在连续的世界里,那么它脑中的世界模型,是不是也应该拥有一只连续走动的“时间表”?

如果答案是肯定的,PT-Flow 可能只是这条路线的第一步。


参考来源

  1. Dongxiu Liu et al., ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow, arXiv:2607.27924v1, 2026.

  2. ODEWorld 官方项目主页:https://dstate.github.io/odeworld_website/

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发