技术博客
其他

一个模型干完所有活:读懂 Nvidia Cosmos 3

Truman2026-07-09 14:51
一个模型干完所有活:读懂 Nvidia Cosmos 3

博客:

https://huggingface.co/blog/nvidia/cosmos-3-for-physical-ai

技术报告:

https://research.nvidia.com/labs/cosmos-lab/cosmos3/technical-report.pdf




机器人要收拾饭后的餐桌,在过去的范式里需要把好几个模型串起来。

  • 一个视觉语言模型(VLM)找餐具、出计划;

  • 一个动作模型生成手臂动作;

  • 还有一个"世界模型"预演动作之后场景会变成什么样。

英伟达在 Cosmos 3 的技术报告里直言,这种"东拼西凑"既不优雅,也浪费算力。


Cosmos 3 想回答的问题很直接:能不能用一个统一模型,原生地把物理 AI 需要的所有能力都包下来?



1

它"统一"了什么


Cosmos 3 是一个全模态(omnimodal)世界基础模型,同时处理语言、图像、视频、音频、动作五种模态,理解和生成都做。


此前这些能力分散在多个模型里(Cosmos Predict 做世界生成、Reason 做场景理解、Policy 做策略生成等),Cosmos 3 把它们合进一个模型,在一次前向传播里完成。



一个关键设计,它把"动作"当成一等模态,专设动作 token,把真实世界的控制信号(机器人关节、方向盘、相机位姿、人手动作)和语言推理、视频建模连起来,并用统一的几何表示把不同"身体"映射到同一动作空间。



2

核心架构:Mixture-of-Transformers(MoT)


MoT 是 Mixture-of-Transformers(混合 Transformer),不是更常见的 Mixture-of-Experts(MoE,混合专家)。原版 MoT 按"模态"解耦每层参数但保持全局注意力,Cosmos 3 借用了思路,但改成按"推理 vs 生成"切分。


Cosmos 3 把输入序列拆成两段:

  1. 自回归(AR)子序列:负责理解推理,用逐 token 预测,行为像标准 VLM。

  2. 扩散(DM)子序列:负责生成,用迭代去噪(diffusion)。


每层里两段 token 走各自独立的参数,但通过一个共享注意力算子交流,且注意力是不对称的:

  • AR 只做因果自注意力:只看前面的 token,保住了从 VLM 继承的语言能力。

  • DM 做双向全注意力:可自由"看"到 AR 的文本提示和所有 token,维持时空一致性。

  • AR 永不被 DM 更新,保证条件通路的因果完整性。



妙处在于,不改架构,只调整哪些 token 是"干净条件"、哪些是"待去噪目标",同一模型就能在文生图、图生视频、前向/逆向动力学、策略等模式间切换


各模态进骨干前先经专用编码器,视觉理解用 ViT,视觉/音频生成用 VAE,动作用领域感知投影层。



3

三种规格,都基于 Qwen3-VL



Nano 和 Super 本次开源,均基于 Qwen3-VL 初始化(Edge 用自研模型),以继承现成的语言和视觉能力。



4

训练与数据


训练顺序很关键,先训推理器,再用它的权重初始化生成器,把世界知识传给负责生成像素、音频、动作的那一半。


推理器用约 2420 万图文/视频样本训练(先预训练、后在物理 AI 任务上微调)。生成器走渐进式课程,从图像视频音频起步,中期引入动作和视频迁移数据,最后小数据集后训练。


英伟达还放出六个面向物理 AI 的合成数据生成(SDG)数据集(机器人、物理交互、空间推理、数字人、自动驾驶、仓库安全)。







5

关于性能:英伟达自己怎么说?


按报告,Cosmos 3 在多项任务上达到新 SOTA,后训练版本被 Artificial Analysis 评为当时最佳开源文生图和图生视频模型,被 RoboArena 评为最佳策略模型


对比表里,驾驶推理上 Super 拿 79.3 分,远超 Gemini 3.1 Pro 的 47.2,文生图 91.36,逼近闭源的 Gemini 3 Pro Image(90.85)。




6

总结


Cosmos 3 把物理 AI 的感知、模拟、执行收敛进一个可微调的统一底座,不必再为每个任务拼专用流水线,这是"生成式世界模型"路线上一次有分量的工程整合,而这条路线本身仍在与潜空间派的争论中前行。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发