技术博客
CV 计算机视觉

视频生成赛道“卷”出新高度:当主流还在模仿Sora,字节&北大已在“驯化”机器人

Mr.黄先生2026-07-09 10:14
视频生成赛道“卷”出新高度:当主流还在模仿Sora,字节&北大已在“驯化”机器人

本文解读一篇关于视频生成模型在机器人领域落地的系统性工作论文。


当前VLA(Vision-Language-Action)模型火热,但高质量机器人视频数据的匮乏一直是瓶颈——本文不仅指出了问题,更给出了一套完整的评估基准和大规模数据集方案。




重新思考面向具身世界的视频生成模型

原文链接:

[2601.15282] Rethinking Video Generation Model for the Embodied World

代码链接:

GitHub - DAGroup-PKU/ReVidgen: Rethinking Video Generation Model for the Embodied World

项目主页:

dagroup-pku.github.io/ReVidgen.github.io/


简要总结

一句话总结:北大&字节Seed团队针对机器人视频生成领域缺乏系统评估和大规模训练数据的痛点,提出了RBench(首个面向机器人视频生成的综合评测基准)和RoVid-X(400万片段的大规模机器人视频数据集),并通过25个主流模型的评测揭示了当前视频生成模型在物理真实性和任务完成度上的显著缺陷。


核心方法:

  1. 构建细粒度评测体系:设计5个任务维度(操作、长程规划、多实体协作、空间关系、视觉推理)× 4类机器人形态(单臂、双臂、人形、四足)的评测集,用MLLM-based自动指标替代人工打分,实现0.96的斯皮尔曼相关系数;


  2. 提出物理感知的评估指标:将任务完成度(Task Completion)和视觉质量(Visual Quality)解耦,前者评估物理语义合理性(PSS)和任务一致性(TAC),后者评估机器人结构稳定性(RSS)与运动平滑性(MS),从而精准捕捉"机器人变形""非接触吸附"等失败模式;


  3. 打造端到端数据流水线:通过四阶段流程(视频采集→质量过滤→任务分割与描述→物理属性标注),从互联网视频和开源数据中提取400万高质量片段,覆盖1300+技能,并统一标注光流、深度等物理属性。




为什么机器人视频生成需要"重新思考"?




最近视频生成模型进展迅猛——Sora、Wan、可灵等模型在开放域视频生成上已相当惊艳。但一个关键问题始终悬而未决:这些模型真的理解物理世界吗? 当它们被用于生成机器人操作视频时,能否保证动作的物理可行性和任务完成度?


这正是本文想要探索的核心:如何系统评估视频生成模型在具身智能场景下的真实能力,并为其提供大规模高质量训练数据?




现有方法为什么不适用?




首先,通用视频生成基准无法捕捉机器人特有的失败模式。VBench等主流基准关注帧清晰度、时序一致性,但机器人视频的核心挑战是物理合理性——机械臂能否正确抓取物体?人形机器人会不会突然"断腿"?这些涉及接触物理、运动学约束的问题,传统指标完全无视。


其次,现有机器人数据集规模小、分布窄。Open X-Embodiment虽然达到百万级,但分辨率参差不齐(64P-720P)、缺乏统一描述,且没有为视频生成任务设计的物理属性标注(光流、深度)。更关键的是,大多数数据集来自特定实验室的特定机器人,跨本体泛化能力严重不足。


因此,本文的解决方案是双管齐下:先建立严格的评测标准(RBench),再构建大规模训练数据(RoVid-X),形成"评估-训练"的闭环。




RBench:如何设计机器人专属的评测体系?




评测体系的设计遵循一个核心原则:任务完成度和视觉质量必须解耦。一个视频可能看起来很"丝滑",但机器人根本没完成任务;也可能任务完成了,但机械臂在过程中变成了"橡皮管"。


第一步:定义评测维度。RBench从两个正交方向展开:

  • 任务导向:常见操作(Manipulation)、长程规划(Long-horizon Planning)、多实体协作(Multi-entity Collaboration)、空间关系(Spatial Relationship)、视觉推理(Visual Reasoning)

  • 本体导向:单臂、双臂、人形、四足


这种设计强制模型展示跨任务、跨本体的泛化能力,避免在特定场景过拟合。


第二步:设计MLLM-based自动指标。核心创新在于用多模态大模型(GPT-5/Qwen3-VL)作为"评测器",通过VQA(视觉问答)方式评估视频。


具体分为两大块:

  1. 任务完成度(Task Completion)包含:

物理语义合理性(PSS):检测"漂浮/穿透""非接触吸附""物体凭空出现/消失"等物理违规

任务一致性(TAC):验证动作是否符合指令顺序,是否遗漏关键步骤


  1. 视觉质量(Visual Quality)包含:

机器人-物体稳定性(RSS):对比首帧和末帧,检测机器人结构变形、物体属性漂移

运动幅度(MAS):用CoTracker跟踪关键点,确保机器人有实际运动而非"静态平滑"

运动平滑性(MSS):基于Q-Align美学分数的时序一致性检测



这里第t帧机器人区域的平均位移。关键设计是相机运动补偿——通过对比背景运动,排除相机移动造成的"伪运动",确保度量的是机器人本身的动作幅度。


第三步:验证指标可靠性。作者邀请30名人类标注者进行偏好研究,结果显示RBench自动评分与人工评分的斯皮尔曼相关系数达到0.96,证明这套自动指标可以替代昂贵的人工评估。





RoVid-X:如何构建400万机器人视频数据集?




数据构建遵循"质量优先"的四阶段流水线:


第一阶段:视频采集。从互联网视频平台(YouTube等)和20+开源具身数据集中采集原始视频,用GPT-5进行内容过滤,筛选出真正包含机器人动作的视频,最终保留约300万片段。


第二阶段:质量过滤。应用场景分割、清晰度评估、动态检测、美学评分等多维过滤,剔除低质量片段。阈值设定为0.25(低质量)到4.45(高质量),确保入库视频的视觉质量。


第三阶段:任务分割与描述。使用视频理解模型(Seed1.5-VL)自动分析机器人动作,将长视频分割为独立任务片段(1-8秒),并生成结构化描述——包括动作主体(如"右臂")、操作对象(如"红色积木")、动作细节(如"抓取并移动")。


第四阶段:物理属性标注。这是RoVid-X区别于现有数据集的关键:

  • 用FlashVSR将视频超分到720p,增强细节

  • 用AllTracker标注统一的光流,确保跨场景动作一致性

  • 用Video Depth Anything生成相对深度图,提供空间关系监督


最终数据集包含400万片段、1300+技能、720p+分辨率,且所有片段都带有光流、深度、结构化描述。作为对比,之前的最大开源数据集Open X-Embodiment为140万片段,且缺乏物理属性标注。





实验结果:当前模型的真实水平如何?




作者在RBench上评测了25个主流模型,包括:

  • 闭源商业模型:Wan 2.6、Seedance 1.5 Pro、Veo 3、Sora等

  • 开源模型:Wan系列、HunyuanVideo、CogVideoX等

  • 机器人专用模型:Cosmos 2.5、DreamGen、Vidar等


关键发现:

  1. 迭代缩放确实有效,但物理理解仍有鸿沟。Wan系列从2.1(0.399)到2.6(0.607)提升显著,Seedance从1.0到1.5 Pro也持续进步。但即便是最好的Wan 2.6,在视觉推理任务上仅得0.531,长程规划和多实体协作仍是短板。


  2. "媒体模拟"与"物理模拟"存在领域鸿沟。Sora v2 Pro在RBench上仅排第17(0.362),远低于其在开放域视频生成中的口碑。这说明擅长生成"好看"视频不等于擅长生成"物理正确"的机器人视频——前者优化的是视觉平滑和电影感,后者需要精确的接触物理和运动学约束。


  1. 开源与闭源差距明显,但机器人专用模型展现韧性。前7名全是闭源商业模型,但Cosmos 2.5(第9名)作为机器人专用模型,超过了多数更大规模的开源通用模型。这验证了领域数据的价值——尽管Cosmos的训练数据量可能不及Wan,但物理交互数据的针对性使其在机器人任务上更具优势。


  1. 微调RoVid-X带来稳定提升。用RoVid-X微调Wan2.1-14B和Wan2.2-5B,在5个任务维度和4类本体上均有显著提升。例如Wan2.1-14B+Ours在视觉推理任务从0.205提升到0.298,证明数据质量可以弥补模型规模差距。


上图展示了三个代表性任务的定性结果。在视觉推理任务中,Seedance 1.0和Hailuo能正确识别"蓝色衣物"和"空心洗衣篮",而Wan 2.5将编织篮误判为空心篮;在长程规划任务中,Wan 2.5完整执行了"拿起盘子→放入水槽→打开水龙头"三步,Hailuo则遗漏了"打开水龙头"动作,导致水凭空流出——这正是物理逻辑断裂的典型表现。




总结与展望




RBench和RoVid-X的提出,标志着机器人视频生成领域从"凭感觉评估"走向"标准化评测",从"小规模特定数据"走向"大规模通用数据"。


这项工作给从业者的启示很直接:


评估层面:不要只看视频"好不好看",要检验任务是否完成、物理是否合理。RBench的自动指标可以直接复用。

训练层面:高质量领域数据的价值可能超过盲目扩大模型规模。RoVid-X的400万片段提供了很好的起点。

研究方向:当前模型在视觉推理和长程规划上仍有显著缺陷,这恰是VLA模型落地的关键瓶颈。


作者提到下一步将结合逆动力学模型(IDM)从生成视频中恢复可执行动作,实现“生成→控制"的闭环。这或许是视频生成模型真正走向机器人应用的关键一跃。





点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发