技术博客
其他

NVIDIA最新突破:世界模型让机器人“先思考,后行动”,通用性提升2倍

Truman2026-07-09 14:52
NVIDIA最新突破:世界模型让机器人“先思考,后行动”,通用性提升2倍

本文解读英伟达在26年初发表的一篇论文。该论文是NVIDIA在具身智能基础模型领域的一次关键探索,提出了一种将“视频生成”与“动作预测”深度耦合的新范式,让我们看看它如何突破传统VLA在物理动态理解上的根本瓶颈。





世界动作模型是零样本策略

原文链接:

https://arxiv.org/abs/2602.15922

代码链接:

https://github.com/dreamzero0/dreamzero

项目主页:

https://dreamzero0.github.io/


简要总结

一句话总结:NVIDIA团队提出DreamZero,一个基于14B视频扩散模型的世界动作模型(WAM),通过联合预测未来视频与机器人动作,实现了对未见过任务和环境的零样本泛化,其泛化能力是当前最先进VLA模型的2倍以上,并展示了惊人的跨具身数据迁移效率


核心方法:

  1. 训练一个端到端模型联合去噪视频和动作,确保“视觉未来”与“运动指令”在语义和时空上紧密对齐,而非将视频预测与动作提取分步进行。


  2. 采用自回归架构,在闭环控制中,将真实观测替换预测帧注入KV缓存,从而消除了自回归生成中固有的误差累积,并借助KV缓存实现推理加速。


  3. 设计一套包含“DreamZero-Flash”的深度优化方案,将一个原本需5.7秒推理的14B扩散模型加速至150毫秒,最终实现了7Hz的实时闭环控制。





从“语义理解”到“物理想象”的跨越




当前,基于大型视觉语言模型(VLM)的视觉-语言-动作模型(VLA) 已成为机器人基础模型的主流路线。它们能很好地处理“把可乐递给某人”这类语义清晰的任务,但在面对“解开鞋带”或“熨衣服”这类未见过的、需要精确物理动态交互的新任务时,往往束手无策。


本文想要探索的核心挑战是:如何让机器人模型不仅理解“要做什么”,还能真正想象并规划“应该怎么做”?


VLA模型的根本局限在于其“出身”——它们继承自在静态图像-文本数据上预训练的VLM。虽然获得了丰富的语义知识,但这些知识是“绝缘”的:它们缺乏对物体如何运动、力如何作用、事件如何时序演化的时空先验。因此,VLA模型不得不依赖海量、重复的专家演示数据来强行学习从观测到动作的直接映射。当面对新环境或新技能时,这种“死记硬背”式的学习便显露出泛化力不足的问题。


首先,主流VLA路径在处理物理动态时存在先天缺陷。 它们将动作学习视为纯粹的“状态-动作”模仿学习问题,没有显式建模或理解“动作如何改变世界状态”。这导致模型难以从杂乱、非重复的异构数据中有效学习,因为模型必须隐式地、费劲地从噪声中反推复杂的物理规律。


因此,本文选择了一条更本质的路径:将视频生成模型作为世界模型,并让它与动作预测深度耦合。 视频生成模型(如扩散模型)已在互联网规模数据上学习到了丰富的物理常识——物体如何下落、碰撞、变形,手如何抓取、释放。这种“世界模拟”能力,正是传统VLA所缺失的。通过将视频预测作为动作预测的桥梁,模型可以基于一个符合物理规律的“视觉未来”来规划动作。


具体来说,DreamZero通过以下三步构建其核心竞争力:


第一步:构建联合预测目标,统一视频与动作。

传统思路可能分两步走:先训练视频预测器,再训练一个反向动力学模型(IDM)从预测视频中提取动作。


DreamZero则一步到位,训练一个统一的Transformer模型,同时输出未来视频帧和机器人动作。


这好比让模型同时扮演“导演”和“演员”:它需要先在脑中“执导”一个符合物理规律和指令的视频序列(世界状态预测),然后自己“扮演”出实现这一视觉未来的精细动作。


这种端到端设计确保了“视觉想象”与“运动控制”天生对齐,避免了两个独立模型间可能存在的语义鸿沟。


其训练目标可以形式化表达为一个概率分解:

这个公式直白地告诉我们要点:DreamZero学习的是未来视频与动作的联合分布。右边第一项是视频预测,继承了预训练视频模型的强大物理先验;第二项是IDM,学习从预测的视觉未来中提取动作。两者在同一个模型中联合优化,实现了深度耦合。


第二步:采用自回归架构,破解闭环控制难题。

扩散模型通常采用双向注意力机制处理固定长度序列。这在机器人闭环控制中会带来麻烦:当需要从任务中途某个观测开始规划时,为了匹配语言指令,不得不对视频进行子采样,这会扭曲原本的帧率,破坏动作与视频在毫秒级的精细对齐。


DreamZero创新地采用了自回归扩散Transformer(DiT)。在推理时,模型预测一个动作块,机器人执行后,将真实的观测帧直接替换掉预测的视频帧,并将这些真实帧存入KV缓存。


这样,下一轮预测时,模型总是基于真实、无误差的历史观测来规划未来,完美避免了自回归生成中常见的错误累积问题,同时利用KV缓存技术带来了显著的推理加速。


第三步:系统级工程优化,实现实时控制。

一个14B的扩散模型,原始推理需5.7秒,远不能满足机器人控制需求。团队通过层层优化,实现了惊人的38倍推理加速,最终达到约150毫秒的延迟(即7Hz控制频率)。


  • 系统层面:将“分类器无关引导(CFG)”所需的两个前向传播(条件和无条件)并行分配到两个GPU上。

  • 实现层面:使用 torch.compile、CUDA Graphs、后训练量化(NVFP4)等,榨干硬件性能。

  • 模型层面(DreamZero-Flash):这是最巧妙的优化。在训练时,将视频和动作的去噪时间步解耦:让视频 timestep 偏向高噪声状态(通过Beta分布采样),而动作 timestep 保持均匀。这模拟了快速推理时(如仅需一步去噪)的真实场景——模型必须在视频还未完全清晰时,就预测出精准的动作。这个设计使得在将去噪步数从4步激进地减至1步时,性能下降被大幅抑制。




效果验证:泛化能力的跃升




实验在AgiBot G1(双臂移动操作机器人) 和 Franka(单臂机器人) 两种平台上进行,与最先进的VLA模型GR00T和π0.5对比。结果令人印象深刻:


  1. 零样本泛化至新任务:在10个训练中完全未见的任务(如解开鞋带、熨衣服、从人体模型上摘帽子)上,DreamZero平均任务进度达到39.5%,而最强VLA基线仅为16.3%。在某些任务如“摘帽子”上,进度高达85.7%。


  2. 零样本泛化至新环境:在训练数据中存在的任务但于全新环境、全新物体上评估,DreamZero的平均任务进度达到62.2%,是顶尖预训练VLA(27.4%)的两倍以上。


  3. 高效的跨具身迁移:这是最令人惊喜的发现。

  • 机器人到机器人迁移:仅用另一台机器人(YAM)20分钟的视频数据(无动作标签)进行协同训练,在AgiBot上的未见任务性能相对提升超过42%。


  • 人到机器人迁移:仅用12分钟的人类第一人称视频数据,同样获得了显著提升。

  • 少量数据适应新机器人:将在AgiBot上预训练好的模型,用新机器人(YAM)仅30分钟的“玩耍”数据进行微调,模型即可在该新机器人上执行多种任务,并保留了强大的语言跟随能力。


这些结果表明,WAM所继承的物理世界先验,使其能够以极高的效率利用异构数据,打破了传统机器人学习对“海量、清洁、重复”演示数据的依赖。论文的Figure 9清晰地展示了在未见任务上DreamZero与VLA基线的对比效果,值得重点关注。





结论




DreamZero的成功揭示了一个清晰的信号:视频生成模型是机器人迈向“通用物理智能”的关键桥梁。 


它通过将动作预测与视觉世界模拟深度融合,不仅大幅提升了零样本泛化能力,更开辟了一条高效利用海量人类视频数据、快速适应新形态机器人的新路径。尽管目前计算开销仍大,但其展现的泛化潜力,已然指明了下一代具身智能基础模型的一个重要演进方向。






点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发