技术博客
WAM 世界模型论文解读

【三分钟看懂 PhiZero(下)】从 256 个离散符号,到能推演未来的世界模型

yiwan-cat2026-08-02 12:53
【三分钟看懂 PhiZero(下)】从 256 个离散符号,到能推演未来的世界模型

三分钟看懂 PhiZero(下)】从 256 个离散符号,到能推演未来的世界模型

上图为根据论文方法生成的概念图:当前画面先被翻译为候选状态转移,再被渲染为连续未来画面。

上篇我们用一句话概括 PhiZero:

先用“物理语言”推理世界怎么变,再用扩散模型把变化画成视频。

但这句话还留下了一个关键问题:视频本来是连续、复杂的像素,模型凭什么能把它变成一串离散符号?

这一篇,我们把 PhiZero 拆开来看。


一、整套模型其实由两个学习系统组成

图源:PhiZero 官方项目页/论文图 2。左侧训练 Physical Language Tokenizer,右侧训练 Physical Language Reasoner。

PhiZero 包含两个核心组件。

组件 A:Physical Language Tokenizer

它像一位“物理语言翻译员”:

完整视频 → 状态转移特征 → 离散物理语言 token

训练目标是:这串 token 配合第一帧,能否把原视频重建回来?

组件 B:Physical Language Reasoner

它像一位“未来变化预测员”:

第一帧 + 文字/动作条件 → 预测未来的物理语言 token

预测完成后,再调用已经训练好的扩散解码器生成未来视频。

论文把整个概率过程写成:

$$
p(V,z\mid I^0,c)=p(z\mid I^0,c),p(V\mid I^0,z)
$$

不用怕这个公式。它只是在说:

  • $I^0$:当前第一帧;

  • $c$:动作意图或控制条件;

  • $z$:物理语言序列;

  • $V$:未来视频。

先计算“在当前画面和动作意图下,什么变化最可能”,再计算“给定这种变化,未来画面应该长什么样”。


二、33 帧视频,为什么会变成 256 个符号?

这是整篇论文最值得弄懂的一组数字。

本文重绘。数字来自论文实现细节与表 7。

论文使用一段 33 帧、约 4 秒的视频。它不会直接在原始像素上比较相邻帧,而是先通过 Wan2.2 VAE 的时空编码器,把视频压缩成 9 个潜在时间状态

接下来一共有 $9-1=8$ 段相邻状态转移。

1. Transition-level Q-Former:专门看“两帧之间变了什么”

对每一对相邻潜状态 $(x_i,x_{i+1})$,模型使用同一个 Q-Former,并放入 32 个可学习 query

你可以把这 32 个 query 想成 32 位观察员:有人盯物体位移,有人盯姿态变化,有人盯液体形状,有人盯接触关系。它们并没有人工规定的岗位,但会在训练中学会从两段状态里提取足以重建变化的信息。

每段转移得到 32 个特征,8 段转移合起来就是:

$$
(9-1)\times 32=256
$$

因此,一段视频最终对应长度为 256 的物理语言序列。

2. 为什么不直接对整段视频做一个全局压缩?

因为全局压缩很容易把“谁长什么样”和“谁怎样运动”揉在一起。

PhiZero 对相邻状态逐段提取变化,相当于加入一种局部时间先验:先把每个小变化说清楚,再按顺序拼成完整演化。

消融实验也支持这个设计:把 Transition-level Q-Former 换成全局 Q-Former 后,视频重建 PSNR 从 28.9 降到 28.2


三、FSQ:怎样把连续特征变成 2.5 万个“词”?

Q-Former 输出的仍是连续向量,不能直接成为离散语言。PhiZero 使用 Finite Scalar Quantization,FSQ 进行量化。

它先把每个特征投影到 6 个维度,再分别量化到以下档位:

$$
(8,5,5,5,5,5)
$$

所有组合构成的词表大小为:

$$
8\times5\times5\times5\times5\times5=25{,}000
$$

和需要额外学习码本的传统向量量化不同,FSQ 直接由各维度的有限取值做笛卡尔积,因此不必维护一个单独学习的 codebook。

量化后,每个转移特征都变成 0 到 24,999 之间的一个离散索引。模型再把这些索引当成“原子词”加入视觉语言模型的词表。

一个容易被标题党误导的数字

论文表 7 中,Wan2.2 VAE 表示一段视频需要 44,800 个连续视觉 token;PhiZero 只使用 256 个离散物理语言符号。按数量算,确实相差:

$$
44{,}800 / 256 = 175
$$

但这不能简单写成“视频无损压缩 175 倍”。原因有三点:

  1. PhiZero 还额外使用干净的第一帧;

  2. 扩散解码器本身携带强大的视觉生成先验;

  3. 重建质量并未超过标准 VAE:PhiZero 的 PSNR 为 28.9,Wan2.2 VAE 为 37.7。

准确说法应该是:在不计第一帧条件的口径下,PhiZero 用 256 个符号表达状态转移,并在高压缩 tokenizer 中取得了最好的重建指标。


四、为什么一定要用预训练扩散解码器?

物理语言的容量有限。如果要求 256 个 token 同时记录物体纹理、背景、光照和所有运动细节,它最终仍会退化成另一种视觉压缩格式。

PhiZero 因此使用 Wan2.2-5B 作为 diffusion-prior decoder

  • 第一帧提供静态外观;

  • 物理语言提供状态转移;

  • 预训练扩散模型补回逼真的视觉细节。

作者保留 Wan2.2-5B 的原始架构,只把原来的文本条件替换成物理语言上下文,并用 rank 32 的 LoRA 微调扩散解码器。

消融结果很直观:如果不用预训练扩散解码器,改成普通确定性解码器,PSNR 会从 28.9 降到 26.6,是 Tokenizer 端最明显的性能下降。

这说明 PhiZero 的压缩并不是单靠物理语言完成的,而是依赖一个明确分工:离散瓶颈记变化,生成先验补细节。


五、Reasoner:让视觉语言模型学会“说物理语言”

Tokenizer 只能把已经发生的视频翻译成 token。真正预测未来,还需要 Reasoner。

PhiZero 从 Qwen3-VL-4B 初始化 Reasoner,并在原词表中加入 25,000 个物理语言原子符号。

输入是第一帧与高层动作描述,例如:

“一个机械臂抓住蓝色方块并将其提起。”

输出不是自然语言解释,而是长度为 256 的物理语言序列:

$$
p(z\mid I^0,c)=\prod_{j=1}^{256}p(z_j\mid I^0,c,z_{<j})
$$

也就是说,它像大语言模型逐词写句子一样,逐个预测未来的“物理词”。训练标签则由冻结的 Tokenizer 离线从真实视频中提取。

这里还有一个重要的数据处理:生成训练 caption 时,作者只让 VLM 描述发起动作或高层意图,不允许它提前泄露最终结果。否则 Reasoner 只需照抄文字中的结局,就不是真正在当前画面上推断未来。


六、训练数据有多大?

图源:PhiZero 官方项目页/论文图 3。

数据管线分成逐级收紧的三层。

第一层:学广泛的视觉变化

团队先收集约 50K 小时的真实公开视频,去重并过滤损坏帧、水印、低分辨率、时长不合格和镜头突变,得到约 10K 小时无标注视频,用于 Tokenizer 预训练。

第二层:学可重建的状态转移

真实视频进一步经过美学、运动幅度和状态转移可观察性过滤;同时加入约 1K 小时模拟视频,最终构成约 500 万段、每段 4 秒的视频,用于 Tokenizer SFT 和 Reasoner 持续预训练。

第三层:专门强化物理与运动

再用 VLM 做 rich-motion 和 physical filter,保留约 100 万段运动丰富、物理信息更明确的视频,对 Reasoner 进行 SFT。

这套课程式训练的逻辑是:先看得广,再看得清,最后专攻“发生明显变化的物理交互”。

Reasoner 消融也说明模拟数据有帮助:移除模拟数据后,Physics-IQ 的 IQ-Score 从 41.2 降到 37.7;取消两阶段训练则降到 39.2


七、实验结果到底说明了什么?

本文根据论文表 1–3 重绘,仅选择代表性模型;不同基准不能直接横向比较绝对数值。

论文从“生成”和“理解”两条线评估 PhiZero。

1. 视频生成:更重视物理后果

在 Physics-IQ Verified 上,PhiZero 的 IQ-Score 为 41.2,高于表中 Wan2.2-5B 的 21.2、Sora 2 的 26.5、Grok-Video 的 34.8 和 Cosmos3-Super 的 39.5。

在 PhyGround 上,PhiZero 的 Physics Score 为 3.01,Overall 为 2.97,均为表中最高;但它的 General Quality 为 2.93,并不是最高。这一点很重要:它的优势主要体现在物理一致性,而不是所有视觉质量指标都领先。

在 WorldModelBench 上,PhiZero 的 Physics Adherence 为 4.88,Total 为 8.19,同样是论文表中的最好结果。

定性案例也对应这一点:Wan2.2-5B 能画出球与鸭子的接触,却可能让鸭子保持不动;PhiZero 更容易生成碰撞位移、重力形变、连锁反应和动态阴影。

2. 视频理解:用“序列概率”挑出合理视频

IntPhys2、LikePhys 和 YoCausal 都提供成对视频:一个符合物理或因果关系,另一个经过破坏。

PhiZero 的做法不是回答选择题,而是:

  1. 把两段视频分别编码成物理语言;

  2. 让 Reasoner 计算两串 token 的对数似然;

  3. 选择概率更高的一段作为合理视频。

它在 IntPhys2 的 Overall 达到 56.34;LikePhys 平均错误率为 41.7,为论文表中最低;YoCausal 的综合排名为 2.0,同样是表中最好。

不过,分项结果并非处处领先。例如 LikePhys 的流体和光学分项不是最好,IntPhys2 的 Hard 分项也没有领先所有模型。因此,更稳妥的结论是:物理语言对多类物理与因果判断有效,综合表现有竞争力,但尚未解决所有物理现象。


八、为什么同一串 token 能“换身体”?

PhiZero 最吸引人的展示,是把人类动作迁移到机器人,或把模拟机械臂视频转换为真实视觉风格。

方法其实很统一:

源视频 → 提取物理语言 z
编辑源视频第一帧 → 换成人形机器人 / 灵巧手 / 真实场景
新第一帧 + 原来的 z → 重新渲染视频

如果重新生成的视频仍保留原运动,就说明 $z$ 主要记录了状态转移,而不是原人物的纹理和外观。

论文还分析了驾驶和机械臂视频的物理语言嵌入。静止、直行、左转、右转会形成有结构的流形;机械臂的下降闭合、上升闭合、下降张开和横扫也形成较清晰的簇。这说明物理语言内部确实出现了与运动模式相关的组织结构。

但仍需再次强调:这类实验验证的是表示和视频生成层面的迁移。要让真实机器人执行,还需要把表示接到策略学习、动作解码、安全约束和闭环反馈上。


九、这项成果目前还有哪些边界?

论文自己给出了三类限制,我们还可以进一步把它们解释得更直白。

1. token 可离散,但还不可解释

模型有 25,000 个“词”,但人类还不能直接查看某个 token 就知道它表示多少速度、哪种受力或什么接触关系。它是可操作的中间表示,却不是透明的符号物理语言。

2. 视频规律不等于因果定律

从海量观察视频中,模型能学习“通常怎样变化”,但观察数据天然受拍摄分布限制。罕见事件、反事实结果和隐藏变量仍可能被错误建模。加入模拟数据有所帮助,却没有彻底解决因果识别问题。

3. 当前主要处理固定长度片段

论文主体围绕 4 秒视频建模。长时间交互会积累误差,物体离开画面后能否被持续追踪、多个事件能否稳定衔接,还需要层级化或循环预测来解决。

4. 还不能直接验证工程复现

截至 2026 年 8 月 2 日,官方项目页仍显示代码即将发布。因此,目前可以分析论文和演示,但还不能完整检查训练细节、推理速度、显存需求与跨数据集复现性。


最后:PhiZero 真正重要的,不只是一个更强的视频模型

PhiZero 最值得关注的贡献,不是单独把某个视频榜单提高了几分,而是提出了一种可能的世界模型接口:

看见当前世界
      ↓
用离散状态转移表示“接下来会怎样”
      ↓
用于生成、判断、控制或迁移

自然语言让大模型能够在数字世界中进行显式推理;PhiZero 想做的,是为物理世界寻找一种更细粒度的中间语言。

它目前还不是物理定律,也不是成熟的机器人“大脑”。但如果这种表示能够继续扩展到触觉、力、长时序与闭环控制,那么未来的 Physical AI 可能不再只是在像素里“感觉下一帧”,而是先形成一段可复用的世界演化计划,再决定如何观察、模拟和行动。

这也是 PhiZero 最令人期待的地方。


资料来源

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发