Embody4D 论文解读:一段单目视频,如何扩展成多视角动态世界?

Embody4D 论文解读:一段单目视频,如何扩展成多视角动态世界?
在机器人学习中,摄像头是最常用的感知设备之一。
机器人可以通过摄像头识别目标、判断物体位置,并根据画面生成操作指令。然而,现实中的机器人数据通常只由少量固定摄像头记录。同一个动作换一个观察角度后,机械臂、目标物体和周围环境在画面中的位置都会发生变化,这可能导致模型的识别和控制性能下降。
这个问题的本质在于:机器人获得的通常只是某个视角下的二维图像,而真实环境是一个会随着时间持续变化的三维空间。
2026 年 6 月,研究团队更新了论文 《Embody4D: A Generalist Data Engine for Embodied 4D World Modeling》。该研究提出了一种面向具身智能的 4D 数据引擎,可以将一段单目机器人视频转换成多个目标视角下的视频,为机器人学习补充具有时空一致性的多视角数据。
一、这里的“4D”是什么意思?
Embody4D 中的 4D,可以简单理解为:
三维空间结构,加上随时间变化的运动过程。
普通视频包含宽度、高度和时间,但它只能记录某个摄像机视角下的二维投影。
例如,摄像机从正面记录机械臂抓取物体时,画面可能无法完整展示:
夹爪与物体之间的实际距离;
被机械臂遮挡的物体区域;
机械臂末端与桌面的高度关系;
从侧面观察时的运动轨迹;
物体在空间中的完整形状。
如果能够从同一段视频中生成侧视、俯视或其他位置的观察画面,机器人模型就可以获得更完整的空间信息。
论文将这种在不同视角和不同时间下保持一致的动态三维场景数据称为“4D 具身数据”。它可以为跨视角识别、场景理解、操作推理和机器人策略学习提供更加丰富的监督信息。
二、Embody4D 要解决什么问题?
Embody4D 的核心任务可以概括为:
输入一段单目机器人视频和目标摄像机位置,生成该位置下对应的机器人操作视频。
假设原始数据只有机械臂正面抓取水果的视频,经过 Embody4D 处理后,可以继续生成:
左侧观察视频;
右侧观察视频;
较高位置的俯视视频;
更靠近操作区域的视角;
按指定摄像机轨迹变化的视频。
需要注意的是,Embody4D 并不会重新设计机械臂动作,也不会随意改变原视频中的任务过程。
它保留原来的机器人动作轨迹,只改变摄像机观察位置。这样,已有的动作标签仍然可以继续使用,而同一条操作数据能够获得更多视觉视角。论文将这种方法定位为一个机器人数据扩展引擎,而不仅是普通的视频生成模型。
三、为什么单目视频难以转换成多视角视频?
从表面上看,视角转换似乎只是移动摄像机,实际却需要解决三个关键问题。
1. 多视角机器人数据不足
训练多视角生成模型,需要同一个机器人动作在多个同步摄像机视角下的视频。
但在真实环境中,部署多台摄像机意味着需要完成设备安装、相机标定、时间同步和场地调整。对于大规模机器人数据集,这种采集方式的成本很高。
此外,不同机器人之间的外形差异很大。数据可能来自单机械臂、双机械臂、人形机器人或不同尺寸的夹持设备。如果训练数据只包含少数机器人结构,模型遇到新平台时就可能难以正确生成其遮挡区域。
2. 不同视角之间必须保持一致
假设模型根据正面视频生成侧面视频,生成结果不仅要自然,还必须与原始场景保持对应。
例如:
机械臂的关节数量不能变化;
物体不能在视角切换后突然移动;
夹爪不能穿过物体;
桌面结构不能发生改变;
连续画面中的动作不能出现明显跳动。
普通视频生成模型可能生成视觉上合理的画面,但不同视角之间的三维结构不一定严格一致。
3. 操作区域容易失真
机器人视频中最重要的部分,通常只占画面的一小块,例如夹爪、机械臂末端、被操作物体以及二者的接触区域。
普通生成模型容易优先处理大面积背景,却忽略这些面积较小但决定任务结果的区域。
因此,Embody4D 不仅需要保证整体画面的清晰度,还要尽量保持机器人结构、物体运动和操作过程的准确性。
四、Embody4D 的整体流程
Embody4D 采用了一个可以概括为“先投影,再补全”的技术路线,也就是论文中所说的 warp-then-inpaint。
首先,系统根据原始视频恢复动态场景的空间结构,并估计摄像机参数。
随后,模型将原始视角中的画面投影到目标摄像机视角。
投影完成后,目标画面通常会出现三种区域:
投影准确、可以直接保留的区域;
大致正确,但存在位置偏差的区域;
原视角完全看不到、需要重新生成的区域。
Embody4D 再通过生成模型分别处理这些区域,最终获得完整的新视角视频。
五、核心设计一:组合式 4D 数据合成
由于真实多视角机器人视频不足,研究团队首先构建了一套组合式数据生成流程。
他们从 MuJoCo Menagerie 中选取了 30 种不同形态的机器人模型,其中包括:
人形机器人;
单机械臂;
双机械臂;
小型夹持设备;
不同结构和尺寸的操作平台。
这些机器人会在 MuJoCo 环境中执行不同运动,形成机器人动态前景。研究人员再从真实场景数据中选择具有合适视角变化的背景,将机器人前景与真实背景组合,构造多视角训练视频。
这种方法的优势是,不必完全依赖昂贵的真实多摄像机采集,就可以获得大量机器人形态、运动状态和摄像机视角组合。
简单来说,这一步解决的是:
当真实多视角数据不够时,通过仿真机器人与真实场景组合,构造规模更大的训练数据。
六、核心设计二:置信度感知专家调制
将原始画面投影到新视角后,不同区域的可靠程度并不相同。
例如:
没有发生遮挡的桌面区域通常比较可靠;
机械臂边缘可能存在轻微错位;
新视角下出现的物体背面没有原始信息;
摄像机移动后新出现的背景区域需要重新生成。
如果对整个画面使用同一种生成方式,已经正确的区域也可能被模型意外修改。
为此,Embody4D 设计了三类处理专家:
复制专家:保留可靠的投影内容;
修复专家:调整存在几何偏差的内容;
补全专家:生成原始视角中没有观察到的区域。
模型会估计潜在空间中不同区域的可信程度,再将这些区域分配给适合的专家。高可信区域主要复制,中等可信区域进行修复,低可信或缺失区域则进行补全。
这种机制可以简单理解为:
正确的地方尽量不改,有偏差的地方进行调整,看不到的地方再合理补充。
与对整幅画面统一处理相比,分区处理更有利于保持原视频中的物体结构、纹理细节和运动轨迹。
七、核心设计三:交互感知注意力
机器人操作画面的背景面积通常很大,而真正影响任务的区域可能非常小。
例如,在机械臂拿取水果的过程中,最重要的是夹爪、目标水果和二者之间的位置关系,而不是远处的墙壁或桌面纹理。
如果模型平均处理所有画面区域,可能出现背景生成得很清晰,但夹爪或物体位置不够准确的问题。
因此,Embody4D 加入了交互感知注意力机制,让模型更加关注:
机械臂末端;
夹爪区域;
被操作的物体;
物体运动区域;
机器人与物体的交互位置。
该机制利用分割和运动信息,将操作区域与静态背景区分开,从而提高机器人结构和物体交互过程的保真度。
八、实验结果如何?
论文从视频生成质量和机器人策略训练两个方面进行了实验。
1. 视频生成质量
研究人员逐步加入组合式数据、交互感知注意力和置信度感知专家调制,并对不同版本进行消融实验。
与基础版本相比,完整模型取得了以下改进:
PSNR 提高 24.23%;
SSIM 提高 22.85%;
LPIPS 降低 44.11%;
MEt3R 降低 12.58%。
其中,PSNR 和 SSIM 主要反映画面重建质量与结构相似程度,LPIPS 衡量感知层面的图像差异,MEt3R 则用于评估多视角生成的一致性。
实验结果说明,模型性能提升不仅来自更多训练数据,区域化专家处理和交互区域建模同样发挥了重要作用。
2. 真实机器人策略训练
研究团队还在真实机械臂平台上测试了 Embody4D 对机器人学习的帮助。
实验使用 Franka Research 3 机械臂和 Robotiq 2F-85 夹爪,包含两个固定外部摄像机和一个腕部摄像机。研究者从 100 条人工示范出发,将单视角视频扩展成双视角数据,再训练视觉语言动作策略。
实验包含五个物体放置任务,每个任务测试十次。结果如下:
仅使用单视角数据:平均成功率 32%;
使用 ReCamMaster 扩展:平均成功率 30%;
使用 TrajectoryCrafter 扩展:平均成功率 46%;
使用 Embody4D 扩展:平均成功率 74%。
Embody4D 在训练阶段没有出现的新物体任务上,也表现出较好的适应能力。论文认为,这说明生成的新视角视频不仅具有视觉展示价值,还能实际提升机器人策略的跨视角学习效果。
九、Embody4D 与普通视频生成模型有什么区别?
普通视频生成模型主要关注:
生成结果是否清晰、自然和连贯。
Embody4D 还需要考虑:
新视角视频是否与原始机器人动作、场景结构和物体交互保持一致。
一段视频看起来很自然,并不代表它适合用于机器人训练。
如果夹爪位置、物体运动或机械臂结构发生变化,原来的动作标签就可能与生成视频不再匹配。
因此,机器人世界模型除了视觉质量,还要关注:
几何一致性;
时间一致性;
机器人结构一致性;
动作与画面的对应关系;
操作区域的准确程度。
Embody4D 的特点,是尝试将视频生成能力转化为机器人可以直接利用的数据扩展能力。
十、这篇论文有什么意义?
过去,提高机器人策略的视角适应能力,往往需要增加真实摄像机,并重新采集大量操作数据。
这通常涉及:
安装更多摄像机;
重新完成相机标定;
同步多路视频;
重复执行机器人任务;
整理和标注多视角数据。
Embody4D 提供了另一种思路:从已有的单目视频中生成其他观察视角。
这样,同一条机器人动作轨迹就可以对应多个视觉观测,帮助模型学习更加稳定的空间关系,而不是只记住固定摄像机画面。
这类技术可以应用于:
多视角机器人策略训练;
摄像机位置随机化;
机器人数据集扩充;
仿真数据与真实数据融合;
新机器人结构的视觉适配;
视觉语言动作模型训练;
遮挡区域的辅助观察。
论文还展示了 Embody4D 在推理阶段的应用方式:当目标物体在原始视角中被遮挡时,模型可以生成一个补充视角,为视觉语言动作策略提供更多空间信息,而不需要额外安装摄像机。
十一、Embody4D 有哪些局限?
Embody4D 目前仍然存在一些限制。
首先,当前视频生成模型通常只能生成固定长度的序列,例如 49 帧或 81 帧。
当输入视频较长时,系统需要先将其切分成多个片段,分别生成新视角视频,再将这些片段拼接起来。由于每个片段相对独立,连接处可能出现轻微跳动或时间不连续。
其次,Embody4D 主要扩展摄像机视角,并不会为原始视频创造新的机器人动作。
因此,它可以增加视觉观测的多样性,但不能替代不同任务、不同动作和不同交互过程的数据采集。
此外,在复杂遮挡、快速运动和精细接触区域,生成视频仍可能出现结构偏差。如果生成画面与原始动作标签不一致,反而可能给策略训练带来额外噪声。
在实际应用中,仍需要配合几何一致性检查、数据质量筛选和真实机器人测试。
十二、对机器人研究有什么启发?
Embody4D 的重要启发是:
世界模型不一定只用于预测下一帧画面或下一步动作,也可以成为机器人数据生成工具。
对于机器人模仿学习,可以考虑以下流程:
采集一种主要视角下的真实操作数据;
使用 4D 世界模型生成多个目标视角;
保留原始动作和状态标签;
使用多视角视频训练控制策略;
在部署阶段改变摄像机位置进行测试。
对于轮足机器人,也可以探索类似方向。
例如,根据机器人机载相机或外部相机采集的视频,生成侧面、俯视或其他观察视角,用于:
机器人姿态分析;
楼梯结构理解;
轮足接触区域观察;
运动稳定性判断;
仿真视频数据扩展;
跨摄像机位置的策略训练。
不过,轮足机器人的运动速度和接触变化通常更加剧烈,对生成视频的时间连续性和空间准确性也会提出更高要求。
总结
Embody4D 是一个面向具身智能的 4D 世界模型和机器人数据引擎。
它可以根据一段单目机器人视频,生成由其他摄像机位置观察到的动态视频。
为了解决多视角数据不足、视角转换不稳定和操作区域容易失真的问题,论文提出了三个关键设计:
组合式 4D 机器人数据合成;
置信度感知的复制、修复与补全专家;
面向机器人与物体交互区域的注意力机制。
实验表明,Embody4D 不仅提高了新视角视频的视觉质量和空间一致性,还能通过扩充训练视角,提高真实机器人策略的任务成功率。
这项研究说明,世界模型的作用正在从“预测环境变化”,进一步扩展到“生成可供智能体学习的数据”。
未来,机器人可能不再完全依赖昂贵的多摄像机重复采集,而是利用世界模型,将有限的真实示范扩展成更加丰富的多视角动态数据。