三分钟看懂 Mental World Modeling(下):让 AI 先“脑补”六种未来,再决定人会怎么做

论文:Hao Fei, Yiran Zhao. Mental World Modeling, 2026
项目主页:mental-world.github.io
上篇先讲了核心思想:世界状态不只有物理层,还包含信念、目标、意图、情绪、关系和规范。本篇继续拆解可运行基线 MENTIS 与实验结果。

图 1 MENTIS 完整流程:从联合状态解析、目标人物局部观察,到六个候选动作的分支模拟、价值评分与最终选择。
面对一道“这个人接下来最可能做什么”的选择题,普通大模型通常读完故事就直接给答案。MENTIS 不允许这么做。
它有一条很硬的设计原则:
在为一个候选动作构造出完整未来分支之前,绝不能先选中它。
换句话说,模型不能凭语感猜 C。它必须先回答:当前世界是什么状态?目标人物到底知道什么?C 在物理上做了什么、在社会上意味着什么?执行 C 后,物理世界与每个人的心智会分别怎样变化?这个未来合理吗?
一、MENTIS 的六步流水线
MENTIS 是一个 training-free、fully inspectable 的基线:它不训练新的神经网络,而是通过结构化提示、JSON 约束和多个大模型调用,把现成 LLM/MLLM 组织成一个可审计的心智世界模型。
它的推理链可以写成:
$$
x\rightarrow \hat{s}t\rightarrow \hat{o}t^{\epsilon}
\rightarrow {\hat{a}{t,k}^{\epsilon}}{k=1}^{K}
\rightarrow {\hat{s}{t+1}^{k}}{k=1}^{K}
\rightarrow {r_k}_{k=1}^{K}\rightarrow \hat{k}
$$帽子 $\hat{\cdot}$ 表示这些都是模型预测,不是真实标注。论文的测试题每道有 $K=6$ 个候选动作。
第 1 步:状态解析
把文本、图片或带声音的视频转成联合状态:
物理层:人物、物体、位置、遮挡、动作、声音、环境;
心智层:信念、注意、目标、意图、情绪、偏好、关系、规范和氛围。
这里不是写一段泛泛摘要,而是生成可校验、可比较、可记录的结构化 JSON。
第 2 步:生成目标人物的局部观察
系统从全局状态中“渲染”目标人物真正能看见、听见、记得或推断到的信息。叙述者知道但目标不知道的事实必须过滤掉。
这一步专门防止“上帝视角作弊”。
第 3 步:拆解候选动作
每个自然语言选项被拆成物理动作与心智—语义动作。
例如“请 Lisa 把包移开”包含:
物理载体:放下手中物品、开口说明、提出请求;
心智含义:澄清误会、维护边界、避免侵犯他人物品。
第 4 步:为每个选项模拟未来
系统不只模拟一个答案,而是为 6 个选项分别建立分支,预测每条分支的下一联合状态:
$$
\hat{s}{t+1}^{k}=\left(\hat{s}{t+1}^{k,\mathrm{phy}},;\hat{s}_{t+1}^{k,\mathrm{ment}}\right)
$$物理通道和心智通道分开输出,但都读取当前的联合状态,因此它们是耦合的,而不是互不相干的两套推理。
第 5 步:评价每个未来
每条分支从三个维度评分:
维度 | 要回答的问题 |
|---|---|
心智一致性 | 这个人基于自己的信念与目标,真的会这样做吗? |
物理可行性 | 这个结果在空间、物体和动作上能发生吗? |
社会适当性 | 是否符合关系、礼貌、角色义务、道德与情境规范? |
此外还有一个安全/合法性否决标记。一旦触发,其他得分再高也不能选。
开源配置默认把三项权重设为 0.45、0.35、0.20,即心智一致性、物理可行性、社会适当性依次加权。
第 6 步:确定性选择
最后的排序与平局规则放在语言模型之外,由确定性模块执行。这样同一份评分表能得到可复现的选择,也便于追查到底是哪一阶段出了错。
二、用一个具体例子理解“为什么必须模拟未来”
论文附录给出了一条很有代表性的记录。
Amy 今晚要完成一幅画。Lisa 曾明确说过,不要未经允许移动她的运动装备。后来 Lisa 把运动包放在 Amy 桌前的椅子上,挡住了画板;她还误以为 Amy 今天已经画完。Amy 回来时,双手拿着水瓶和毛巾。
现在问:Amy 下一步应该做什么?
两个很接近的候选是:
A:放下东西,说明画还没完成,请 Lisa 把包移开;
D:自己把 Lisa 的包移走。
如果只看物理结果,两条分支都能清空椅子、恢复画板访问,因此 D 并不差。
但加入心智与规范状态后,差异出现了:
A 会纠正 Lisa 的错误信念,同时尊重“不擅自移动她的装备”这一既有边界;
D 虽然完成了物理目标,却违反之前建立的规范,可能损害两人的关系。
这就是 MWM 的价值:不是给动作贴“礼貌/不礼貌”的静态标签,而是把规范违规和关系变化写进候选未来。
三、Menti-Bench:不只标答案,还标完整过程
为了检验每个中间步骤,作者构建了 Menti-Bench。

图 2 Menti-Bench 的模态、场景与任务构成。
数据集包含:
项目 | 数量 |
总记录 | 448 |
文本 / 图片 / 带声音视频 | 320 / 100 / 28 |
每题候选动作 | 6 |
分支级下一状态标注 | 2,688 |
至少包含两名角色的场景 | 78% |
场景覆盖人际互动、物体/资源、空间/感知、风险/规范四类决策,以及住宅、户外、商业、机构、工作场所五类环境。
作者还刻意控制了几条捷径:正确选项在 A—F 中接近均匀;正确答案与干扰项长度相近;图片经过跨模型与人工检查;制作的 50 段带声音视频中只有 28 段通过质量控制。
但需要看清它的定位:这是一个人工构建、质量控制的小型验证集,所有情境都是虚构的,媒体也是合成的。它适合验证“显式结构是否有用”和定位流水线错误,却还不能代表现实世界中复杂、长期、不可完全标注的人类心智。
四、第一组结果:模型不是想得更久,而是想得更完整
作者在 8 个 LLM-based world models 上设计了一条“必要性阶梯”:
S0:只看选项,不看故事;
S1:读故事后直接回答;
S2:加入自由 CoT;
S3:采样 6 次 CoT,再多数投票;
S4:先写非结构化世界状态;
S5:写成结构化物理—心智状态;
S6:完整 MENTIS,加入目标观察、分支模拟与价值评估。

图 3 从“只看选项”逐步增加结构化状态、视角约束和未来模拟后的性能变化,以及物理—心智双通道消融结果。
8 个模型的平均 F1 从 S0 的 31.3 一路升到 S6 的 87.9:
系统 | 平均 F1 |
只看选项 S0 | 31.3 |
直接回答 S1 | 63.3 |
加 CoT S2 | 74.6 |
6 次自一致性 S3 | 77.9 |
自由文本状态 S4 | 80.3 |
结构化状态 S5 | 82.6 |
完整 MWM S6 | 87.9 |
人类参考 | 98.5 |
最值得注意的不是“多调用几次模型会更准”,而是:S3 已经让模型推理 6 次,仍比 S6 平均低 10.0 分;甚至最弱基座模型上的 S6(84.9)也超过最强模型上的 S3(83.6)。
这说明收益不只是算力堆出来的。反复回答同一道题,不等于先建状态、再限制视角、再逐分支模拟未来。
三个消融也很关键
去掉心智通道:87.9 → 75.8,下降 12.1 分;
去掉物理通道:87.9 → 71.4,下降 16.5 分;
两条转移通道不再耦合:87.9 → 81.5,下降 6.4 分。
这里有个很容易被忽略的结论:去掉物理通道的损失甚至更大。论文不是在说“心理推理取代物理世界模型”,而是在证明物理与心智缺一不可,且必须联合更新。
五、第二组结果:最大瓶颈不是识别现在,而是模拟接下来
为了找出剩余错误来自哪里,作者做了“Oracle 替换”:把某一阶段的模型预测替换成正确标注,再观察最终 F1 能提升多少。

图 4 Oracle 替换实验:下一状态转移是当前系统最大的单项瓶颈。
以 gpt-5.6-sol 为例,完整 MWM 的 F1 是 90.7:
替换为正确标注的阶段 | F1 | 提升 |
动作拆解 | 91.4 | +0.7 |
目标观察 | 92.4 | +1.7 |
当前状态 | 93.5 | +2.8 |
下一状态转移 | 94.2 | +3.5 |
四个阶段全部替换 | 97.0 | +6.3 |
因此,最大的单项瓶颈是 transition simulation(状态转移模拟):模型比较会描述“现在是什么”,却还不够会推演“这个动作之后,每个人的信念、情绪、关系和规范状态会怎样联动变化”。
四个阶段的单独增益相加是 8.7,但一起替换只增加 6.3,说明错误会重叠和传播:当前状态漏掉一个规范,后续模拟自然也会错;不能把它们当成互相独立的误差来源。
全部中间步骤都给正确答案后,系统达到 97.0,与人类 98.5 还差 1.5 分。作者据此估计,最佳系统与人类之间 7.8 分的差距中,约 81% 来自中间状态预测,剩余约 19% 来自价值评价、决策规则或样本本身的难度。
六、哪里提升最大?越需要理解“人”,越有用

图 5 不同决策场景中的性能收益:越依赖信念、关系与规范的人际任务,完整 MWM 的改善越明显。
在人际决策场景中,直接回答只有 66.5,完整 MWM 达到 92.9,提升 26.4 分,是四类场景中最大的。
物体/资源类提升最小,但也有 14.0 分。原因并不神秘:物体类问题更多依赖常识与可供性,直接回答本来就相对容易;人际问题中,隐藏的信念、意图、礼貌和关系才真正决定答案。
跨模态结果也有意思:
模态 | 直接回答 S1 | 完整 MWM S6 | 提升 |
文本 | 70.8 | 90.5 | +19.7 |
图片 | 67.0 | 91.2 | +24.2 |
带声音视频 | 64.8 | 90.9 | +26.1 |
结构化建模几乎抹平了文本、图片和视频之间的差距。作者进一步替换图片为中性描述、删除视频音频或打乱帧顺序,性能都会下降,而且完整 MWM 下降得更多。这至少表明系统确实在利用图像、时序和声音证据,而不只是从选项文字中猜答案。
七、这项工作的真正价值与局限
值得肯定的地方
把“心智推理”从答案变成状态变量。 信念、目标和规范不再是事后解释,而是会随动作变化的世界状态。
把黑盒答案拆成可定位错误。 可以区分状态遗漏、状态幻觉、视角泄漏、动作误解析、物理转移错误、心智转移错误和评价器错误。
实验不是只看最终准确率。 阶梯、消融、Oracle 和模态干预共同支撑“为什么有效、错在哪里”。
仍需保持清醒的地方
它不是读心术。 所谓心智状态是任务相关的外部假设,可能不完整,也可能错。
training-free 不等于低成本。 不需要训练新模型,但要解析状态、生成观察、拆 6 个动作、模拟 6 个未来并统一评分,实际调用量和延迟明显高于直接回答。
基准规模仍小且为合成情境。 448 条数据适合机制验证,不足以证明真实长期交互中的泛化。
当前实现仍依赖手写 JSON schema 和提示词。 当人物更多、时间更长、心智状态存在多种可能时,表示会迅速膨胀。
复现仍有一个现实限制。 代码和公开版 Menti-Bench 已放出,但仓库 README 目前注明中间过程的 gold annotations 不随数据集分发;这会限制外部研究者完整复现论文中的过程级评价与 Oracle 实验。
隐私与伦理风险不能忽视。 一旦系统把对用户情绪、信念和关系的推断当成事实,就可能造成过度干预、操纵或敏感信息泄漏。真正部署时必须保存不确定性,并允许质疑、拒绝和人工接管。
结语:世界模型的下一步,也许不是更会画世界,而是更会理解行动者
过去的世界模型主要学习“如果我推一下,物体会往哪走”。Mental World Modeling 把问题推进了一步:
如果我说一句话、递出一个物体或保持沉默,场景中的人会看到什么、相信什么、感到什么,又会怎样回应?
这篇论文目前给出的还不是一个成熟的“社会智能引擎”,而是一套值得重视的建模框架和可检查基线。它最有价值的地方,不是声称 AI 已经懂人,而是明确指出:只要任务涉及人,世界的真实状态就不等于任何一个人眼中的状态;预测行为必须同时建模现实、视角与意义。
如果未来世界模型要进入家庭机器人、医疗辅助、教育智能体和长期数字角色,它们不仅需要物理一致性,还必须学会维护信念一致性、关系连续性和规范边界。
这可能才是“世界模型”真正从模拟场景走向模拟行动者的一步。