技术博客
WAM 世界模型多模态

【三分钟看懂 PhiZero(上)】AI 不再只猜下一帧:它开始学习一门“物理语言”

yiwan-cat2026-08-02 12:34
【三分钟看懂 PhiZero(上)】AI 不再只猜下一帧:它开始学习一门“物理语言”

上图为根据论文思想生成的概念图:把一段连续运动压缩成离散“物理词”,再用它预测未来变化。

如果给 AI 一张“网球正撞向玩具鸭”的图片,再告诉它“球继续向前滚”,它会生成什么?

普通视频模型可能画出很逼真的球、鸭子和光影,却忘了最重要的一件事:球撞上鸭子之后,鸭子应该动。

这正是当前很多视频世界模型的尴尬:它们越来越会“画”,却不一定真的懂“世界会怎样变化”。

2026 年 7 月 30 日,中国科学院自动化研究所团队发布了预印本 PhiZero: A World Model Built Around Physical Language。这项工作的核心想法很大胆:

不让模型直接从输入画面跳到未来像素,而是先把“世界如何变化”翻译成一串离散符号,完成推理后,再把结果渲染成视频。

作者把这串中间符号称为 Physical Language——物理语言


一、为什么直接预测像素不够?

一段 4 秒视频包含的信息非常多:物体颜色、纹理、阴影、背景、相机视角、运动轨迹、碰撞结果……如果让一个模型把所有信息混在一起预测,它很容易把大量能力花在“画得像不像”上。

但“视觉上逼真”和“物理上正确”不是同一件事。

例如一个杯子从桌边掉落,视频模型至少要同时处理两类问题:

  • 外观问题:杯子是什么颜色,桌面是什么材质,光从哪里照过来;

  • 变化问题:杯子何时失去支撑,怎样下落,落地后是否翻滚或破碎。

传统做法把这两类问题都藏在高维像素或连续视觉特征中。模型即使生成了正确结果,我们也很难知道:它是真的推断出了“失去支撑→下落”,还是仅仅复现了训练视频里常见的画面模式。

PhiZero 的处理方式,是把两件事拆开。

图源:PhiZero 官方项目页。左侧是人类从视觉经验中抽象规律,右侧是 PhiZero 从公开视频中学习“物理语言”。


二、什么是“物理语言”?

先说结论:它不是“重力”“碰撞”“摩擦”这样的自然语言,也不是写在教科书里的物理公式。

PhiZero 的“物理词”是模型自己从视频中学出来的离散编号。单独拿出一个编号,比如 9872,人类目前并不能直接把它翻译成“向左移动”或“液体飞溅”。

更准确地说,它是一套对状态转移的压缩编码。

你可以把视频想象成一本翻页书:

状态 1 → 状态 2 → 状态 3 → 状态 4 → ……

普通视频模型盯着每一页的全部像素;PhiZero 更关心相邻两页之间发生了什么:

静止 → 开始滚动 → 发生碰撞 → 物体倾倒 → 逐渐停止

这些变化经过模型压缩和量化后,会变成一串离散 token。论文把一段 33 帧视频编码为 256 个物理语言符号,符号来自一个大小为 25,000 的词表。

这里的“语言”更像计算机内部使用的动作音节,而不是可直接阅读的汉语或英语。


三、最关键的一步:先推理,再渲染

PhiZero 的总体思路可以浓缩为一句话:

Reason then Render:先确定世界怎么变,再决定画面怎么画。

本文重绘:PhiZero 的核心分工。物理语言推理器负责状态转移,扩散解码器负责视觉细节。

整个过程分为两步。

第一步:推理未来的变化

模型看到当前画面,再接收一句动作意图,例如:

“把酒倒进杯子里。”

一个由视觉语言模型改造而来的 Physical Language Reasoner,不会立刻生成视频,而是先自回归预测一串物理语言 token。这串 token 表示接下来几秒内可能发生的状态变化。

第二步:把变化画成视频

随后,预训练视频扩散模型读取三样东西:

  1. 当前的第一帧,用来确定人物、物体、背景和外观;

  2. 刚刚推理出的物理语言,用来确定运动与状态转移;

  3. 扩散模型已有的视觉生成先验,用来补充纹理、光影和细节。

这样一来,中间的物理语言不必记住杯子花纹、桌面材质等全部信息,它可以把有限容量集中在“液体从瓶中流出、进入杯中、液面上升”这些变化上。

用一个不严格但好记的类比:

物理语言像分镜和动作脚本,第一帧像美术设定,扩散模型像摄影与特效团队。


四、这门语言是怎么学出来的?

有意思的是,团队没有给公开视频逐段标注“这里发生碰撞”“那里受到重力”。物理语言主要通过自监督视频重建学得。

训练时,模型先把完整视频压缩成一串离散符号;然后只给解码器第一帧和这串符号,要求它尽量还原原视频。

如果符号没有记录关键变化,解码器就无法正确重建后续内容。随着训练进行,这套离散词表会逐渐学会承载“世界如何演化”的信息。

这里有两个聪明的设计。

1. 第一帧负责外观

第一帧没有被破坏,直接交给解码器。因此,物理语言没有必要重复记录静态背景、物体颜色等内容,更容易专注于变化。

2. 先用纯噪声“断掉捷径”

预训练扩散模型本身很强,训练初期可能不认真读取新加入的物理语言,仅靠带噪目标和旧有先验猜视频。作者因此加入 pure-noise warm-up:先把未来帧潜变量完全变成噪声,逼迫解码器依赖第一帧和物理语言完成重建。

这有点像考试时把参考答案彻底收走,模型才不得不认真看题。


五、为什么这件事值得关注?

“先推理变化、再渲染像素”的价值,不只在于生成视频更符合物理直觉。

1. 同一段运动可以换一个外观

如果物理语言真的记录“怎么动”,而不是“长什么样”,那么同一串 token 就可以配合新的第一帧重新渲染。

论文展示了一个很直观的实验:先从人类动作视频中提取物理语言,再把第一帧中的人替换成 Unitree G1 人形机器人,模型可以生成机器人执行相似运动的视频;把人手替换成灵巧手,也能迁移手部运动。

2. 它可以成为控制接口

车辆轨迹、机械臂动作或连续的交互指令,都可以先转成物理语言,再渲染成未来视频。相比直接把控制信号映射到像素,中间多了一层专门描述状态变化的接口。

3. 生成与理解使用同一套表示

PhiZero 不只能生成视频。面对一真一假的两段视频,它还可以分别编码成物理语言,计算哪个序列在当前画面和条件下更“可能”,从而判断哪段更符合物理或因果规律。

这意味着它不是单纯的视频生成器,而在尝试把生成、理解和控制放进同一套状态转移表示中。


六、先别把“物理语言”理解得太神

PhiZero 的方向很有启发性,但需要划清三条边界。

第一,它学到的是经验性的离散表示,不是牛顿定律、动力学方程或可验证的符号物理系统。

第二,它主要从可见视频中学习。触觉、受力、材料内部变化、微观粒子运动等看不见或视觉上含糊的现象,仍然很难仅靠视频建模。

第三,论文中的“零样本跨本体迁移”是生成视频中的运动重定向。它证明了状态转移表示具有可迁移性,但还不能等同于真实机器人已经获得可安全执行的控制策略。

因此,更准确的评价是:

PhiZero 还没有学会一套可读、可证明的物理定律,但它找到了一种把“世界如何变化”从像素中单独抽出来的办法。


上篇小结

如果只记住三句话:

  1. 传统视频世界模型直接预测未来画面,视觉生成与物理变化容易混在一起;

  2. PhiZero 把状态转移压缩成离散“物理语言”,先推理 token,再渲染视频;

  3. 这套中间表示让生成、理解、控制和运动迁移有机会共享同一接口。

下篇我们继续拆开模型内部,回答四个更具体的问题:

  • 33 帧视频为什么会变成 256 个符号?

  • Transition-level Q-Former 和 FSQ 分别在做什么?

  • 50K 小时视频是怎样筛成训练数据的?

  • 论文的实验到底证明了什么,又没有证明什么?


资料来源

本文基于论文 v1 与项目页撰写。论文发表于 2026 年 7 月 30 日;截至 2026 年 8 月 2 日,项目页仍标注代码即将发布。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发