【三分钟看懂 PhiZero(下)】从 256 个离散符号,到能推演未来的世界模型

三分钟看懂 PhiZero(下)】从 256 个离散符号,到能推演未来的世界模型
上图为根据论文方法生成的概念图:当前画面先被翻译为候选状态转移,再被渲染为连续未来画面。
上篇我们用一句话概括 PhiZero:
先用“物理语言”推理世界怎么变,再用扩散模型把变化画成视频。
但这句话还留下了一个关键问题:视频本来是连续、复杂的像素,模型凭什么能把它变成一串离散符号?
这一篇,我们把 PhiZero 拆开来看。
一、整套模型其实由两个学习系统组成

图源:PhiZero 官方项目页/论文图 2。左侧训练 Physical Language Tokenizer,右侧训练 Physical Language Reasoner。
PhiZero 包含两个核心组件。
组件 A:Physical Language Tokenizer
它像一位“物理语言翻译员”:
完整视频 → 状态转移特征 → 离散物理语言 token
训练目标是:这串 token 配合第一帧,能否把原视频重建回来?
组件 B:Physical Language Reasoner
它像一位“未来变化预测员”:
第一帧 + 文字/动作条件 → 预测未来的物理语言 token
预测完成后,再调用已经训练好的扩散解码器生成未来视频。
论文把整个概率过程写成:
$$
p(V,z\mid I^0,c)=p(z\mid I^0,c),p(V\mid I^0,z)
$$
不用怕这个公式。它只是在说:
$I^0$:当前第一帧;
$c$:动作意图或控制条件;
$z$:物理语言序列;
$V$:未来视频。
先计算“在当前画面和动作意图下,什么变化最可能”,再计算“给定这种变化,未来画面应该长什么样”。
二、33 帧视频,为什么会变成 256 个符号?
这是整篇论文最值得弄懂的一组数字。

本文重绘。数字来自论文实现细节与表 7。
论文使用一段 33 帧、约 4 秒的视频。它不会直接在原始像素上比较相邻帧,而是先通过 Wan2.2 VAE 的时空编码器,把视频压缩成 9 个潜在时间状态。
接下来一共有 $9-1=8$ 段相邻状态转移。
1. Transition-level Q-Former:专门看“两帧之间变了什么”
对每一对相邻潜状态 $(x_i,x_{i+1})$,模型使用同一个 Q-Former,并放入 32 个可学习 query。
你可以把这 32 个 query 想成 32 位观察员:有人盯物体位移,有人盯姿态变化,有人盯液体形状,有人盯接触关系。它们并没有人工规定的岗位,但会在训练中学会从两段状态里提取足以重建变化的信息。
每段转移得到 32 个特征,8 段转移合起来就是:
$$
(9-1)\times 32=256
$$
因此,一段视频最终对应长度为 256 的物理语言序列。
2. 为什么不直接对整段视频做一个全局压缩?
因为全局压缩很容易把“谁长什么样”和“谁怎样运动”揉在一起。
PhiZero 对相邻状态逐段提取变化,相当于加入一种局部时间先验:先把每个小变化说清楚,再按顺序拼成完整演化。
消融实验也支持这个设计:把 Transition-level Q-Former 换成全局 Q-Former 后,视频重建 PSNR 从 28.9 降到 28.2。
三、FSQ:怎样把连续特征变成 2.5 万个“词”?
Q-Former 输出的仍是连续向量,不能直接成为离散语言。PhiZero 使用 Finite Scalar Quantization,FSQ 进行量化。
它先把每个特征投影到 6 个维度,再分别量化到以下档位:
$$
(8,5,5,5,5,5)
$$
所有组合构成的词表大小为:
$$
8\times5\times5\times5\times5\times5=25{,}000
$$
和需要额外学习码本的传统向量量化不同,FSQ 直接由各维度的有限取值做笛卡尔积,因此不必维护一个单独学习的 codebook。
量化后,每个转移特征都变成 0 到 24,999 之间的一个离散索引。模型再把这些索引当成“原子词”加入视觉语言模型的词表。
一个容易被标题党误导的数字
论文表 7 中,Wan2.2 VAE 表示一段视频需要 44,800 个连续视觉 token;PhiZero 只使用 256 个离散物理语言符号。按数量算,确实相差:
$$
44{,}800 / 256 = 175
$$
但这不能简单写成“视频无损压缩 175 倍”。原因有三点:
PhiZero 还额外使用干净的第一帧;
扩散解码器本身携带强大的视觉生成先验;
重建质量并未超过标准 VAE:PhiZero 的 PSNR 为 28.9,Wan2.2 VAE 为 37.7。
准确说法应该是:在不计第一帧条件的口径下,PhiZero 用 256 个符号表达状态转移,并在高压缩 tokenizer 中取得了最好的重建指标。
四、为什么一定要用预训练扩散解码器?
物理语言的容量有限。如果要求 256 个 token 同时记录物体纹理、背景、光照和所有运动细节,它最终仍会退化成另一种视觉压缩格式。
PhiZero 因此使用 Wan2.2-5B 作为 diffusion-prior decoder:
第一帧提供静态外观;
物理语言提供状态转移;
预训练扩散模型补回逼真的视觉细节。
作者保留 Wan2.2-5B 的原始架构,只把原来的文本条件替换成物理语言上下文,并用 rank 32 的 LoRA 微调扩散解码器。
消融结果很直观:如果不用预训练扩散解码器,改成普通确定性解码器,PSNR 会从 28.9 降到 26.6,是 Tokenizer 端最明显的性能下降。
这说明 PhiZero 的压缩并不是单靠物理语言完成的,而是依赖一个明确分工:离散瓶颈记变化,生成先验补细节。
五、Reasoner:让视觉语言模型学会“说物理语言”
Tokenizer 只能把已经发生的视频翻译成 token。真正预测未来,还需要 Reasoner。
PhiZero 从 Qwen3-VL-4B 初始化 Reasoner,并在原词表中加入 25,000 个物理语言原子符号。
输入是第一帧与高层动作描述,例如:
“一个机械臂抓住蓝色方块并将其提起。”
输出不是自然语言解释,而是长度为 256 的物理语言序列:
$$
p(z\mid I^0,c)=\prod_{j=1}^{256}p(z_j\mid I^0,c,z_{<j})
$$
也就是说,它像大语言模型逐词写句子一样,逐个预测未来的“物理词”。训练标签则由冻结的 Tokenizer 离线从真实视频中提取。
这里还有一个重要的数据处理:生成训练 caption 时,作者只让 VLM 描述发起动作或高层意图,不允许它提前泄露最终结果。否则 Reasoner 只需照抄文字中的结局,就不是真正在当前画面上推断未来。
六、训练数据有多大?

图源:PhiZero 官方项目页/论文图 3。
数据管线分成逐级收紧的三层。
第一层:学广泛的视觉变化
团队先收集约 50K 小时的真实公开视频,去重并过滤损坏帧、水印、低分辨率、时长不合格和镜头突变,得到约 10K 小时无标注视频,用于 Tokenizer 预训练。
第二层:学可重建的状态转移
真实视频进一步经过美学、运动幅度和状态转移可观察性过滤;同时加入约 1K 小时模拟视频,最终构成约 500 万段、每段 4 秒的视频,用于 Tokenizer SFT 和 Reasoner 持续预训练。
第三层:专门强化物理与运动
再用 VLM 做 rich-motion 和 physical filter,保留约 100 万段运动丰富、物理信息更明确的视频,对 Reasoner 进行 SFT。
这套课程式训练的逻辑是:先看得广,再看得清,最后专攻“发生明显变化的物理交互”。
Reasoner 消融也说明模拟数据有帮助:移除模拟数据后,Physics-IQ 的 IQ-Score 从 41.2 降到 37.7;取消两阶段训练则降到 39.2。
七、实验结果到底说明了什么?

本文根据论文表 1–3 重绘,仅选择代表性模型;不同基准不能直接横向比较绝对数值。
论文从“生成”和“理解”两条线评估 PhiZero。
1. 视频生成:更重视物理后果
在 Physics-IQ Verified 上,PhiZero 的 IQ-Score 为 41.2,高于表中 Wan2.2-5B 的 21.2、Sora 2 的 26.5、Grok-Video 的 34.8 和 Cosmos3-Super 的 39.5。
在 PhyGround 上,PhiZero 的 Physics Score 为 3.01,Overall 为 2.97,均为表中最高;但它的 General Quality 为 2.93,并不是最高。这一点很重要:它的优势主要体现在物理一致性,而不是所有视觉质量指标都领先。
在 WorldModelBench 上,PhiZero 的 Physics Adherence 为 4.88,Total 为 8.19,同样是论文表中的最好结果。
定性案例也对应这一点:Wan2.2-5B 能画出球与鸭子的接触,却可能让鸭子保持不动;PhiZero 更容易生成碰撞位移、重力形变、连锁反应和动态阴影。
2. 视频理解:用“序列概率”挑出合理视频
IntPhys2、LikePhys 和 YoCausal 都提供成对视频:一个符合物理或因果关系,另一个经过破坏。
PhiZero 的做法不是回答选择题,而是:
把两段视频分别编码成物理语言;
让 Reasoner 计算两串 token 的对数似然;
选择概率更高的一段作为合理视频。
它在 IntPhys2 的 Overall 达到 56.34;LikePhys 平均错误率为 41.7,为论文表中最低;YoCausal 的综合排名为 2.0,同样是表中最好。
不过,分项结果并非处处领先。例如 LikePhys 的流体和光学分项不是最好,IntPhys2 的 Hard 分项也没有领先所有模型。因此,更稳妥的结论是:物理语言对多类物理与因果判断有效,综合表现有竞争力,但尚未解决所有物理现象。
八、为什么同一串 token 能“换身体”?
PhiZero 最吸引人的展示,是把人类动作迁移到机器人,或把模拟机械臂视频转换为真实视觉风格。
方法其实很统一:
源视频 → 提取物理语言 z
编辑源视频第一帧 → 换成人形机器人 / 灵巧手 / 真实场景
新第一帧 + 原来的 z → 重新渲染视频
如果重新生成的视频仍保留原运动,就说明 $z$ 主要记录了状态转移,而不是原人物的纹理和外观。
论文还分析了驾驶和机械臂视频的物理语言嵌入。静止、直行、左转、右转会形成有结构的流形;机械臂的下降闭合、上升闭合、下降张开和横扫也形成较清晰的簇。这说明物理语言内部确实出现了与运动模式相关的组织结构。
但仍需再次强调:这类实验验证的是表示和视频生成层面的迁移。要让真实机器人执行,还需要把表示接到策略学习、动作解码、安全约束和闭环反馈上。
九、这项成果目前还有哪些边界?
论文自己给出了三类限制,我们还可以进一步把它们解释得更直白。
1. token 可离散,但还不可解释
模型有 25,000 个“词”,但人类还不能直接查看某个 token 就知道它表示多少速度、哪种受力或什么接触关系。它是可操作的中间表示,却不是透明的符号物理语言。
2. 视频规律不等于因果定律
从海量观察视频中,模型能学习“通常怎样变化”,但观察数据天然受拍摄分布限制。罕见事件、反事实结果和隐藏变量仍可能被错误建模。加入模拟数据有所帮助,却没有彻底解决因果识别问题。
3. 当前主要处理固定长度片段
论文主体围绕 4 秒视频建模。长时间交互会积累误差,物体离开画面后能否被持续追踪、多个事件能否稳定衔接,还需要层级化或循环预测来解决。
4. 还不能直接验证工程复现
截至 2026 年 8 月 2 日,官方项目页仍显示代码即将发布。因此,目前可以分析论文和演示,但还不能完整检查训练细节、推理速度、显存需求与跨数据集复现性。
最后:PhiZero 真正重要的,不只是一个更强的视频模型
PhiZero 最值得关注的贡献,不是单独把某个视频榜单提高了几分,而是提出了一种可能的世界模型接口:
看见当前世界
↓
用离散状态转移表示“接下来会怎样”
↓
用于生成、判断、控制或迁移
自然语言让大模型能够在数字世界中进行显式推理;PhiZero 想做的,是为物理世界寻找一种更细粒度的中间语言。
它目前还不是物理定律,也不是成熟的机器人“大脑”。但如果这种表示能够继续扩展到触觉、力、长时序与闭环控制,那么未来的 Physical AI 可能不再只是在像素里“感觉下一帧”,而是先形成一段可复用的世界演化计划,再决定如何观察、模拟和行动。
这也是 PhiZero 最令人期待的地方。
资料来源
Shuyao Shang, Yuqi Wang, Ruopeng Gao, et al. PhiZero: A World Model Built Around Physical Language. arXiv:2607.28624v1, 2026.