HumanNet 论文解析:当机器人没有"互联网"可学,我们就把人类视频喂给它

论文原标题:
HumanNet: Scaling Human-centric Video Learning to One Million Hours
论文链接:
https://arxiv.org/abs/2605.06747
项目主页:
https://dagroup-pku.github.io/HumanNet/#perspectives
代码地址:
https://github.com/DAGroup-PKU/HumanNet
一个被卡住的领域
要理解 HumanNet 这篇论文真正在做什么,我们得先从一个让具身智能(embodied AI)研究者头疼了很多年的问题说起。
大语言模型这几年突飞猛进,核心原因之一非常朴素:它们有整个互联网的文本可以学。视觉模型也类似,有数十亿张图像作为养料。但当我们把目光转向机器人,也就是想让 AI 真的去和物理世界交互、抓东西、用工具、完成任务,数据立刻就成了瓶颈。
一台真实机器人采集数据贵到惊人,而且采到的数据通常只针对某一种机械臂、某几个任务、某一个实验室场景。论文里给出的对比很说明问题:目前最大的开源机器人数据集 EgoScale 也只有约 2 万小时,Ego4D 是 3670 小时,而 EPIC-KITCHENS 只有 100 小时左右,这些数字和文本/图像领域的"互联网规模"完全不在一个量级。
来自北京大学 DA Group 的 Yufan Deng 和 Daquan Zhou 提出的回答很大胆:既然机器人采数据这条路走不通,那就先让模型大量地"看人类怎么做事"。他们把这个想法做成了 HumanNet,一个 100 万小时的人类中心视频语料库,比此前最大的同类数据集还要大一两个数量级。
HumanNet 到底是什么

HumanNet 的几个设计决定值得仔细看。
第一,同时收录第一视角和第三视角。第一视角(就是戴在头上的相机拍的画面)对学习"手怎么操作物体"特别关键,因为视角和机器人末端执行器接近。第三视角则提供完整的身体动作和场景上下文。
第二,关注"物理上有意义"的行为。论文里明确把数据定义为"人类活动是片段的组织信号",也就是说,被动观看、闲坐、走神这类视频都被过滤掉,留下的是抓握、使用工具、装配、操作设备、多步骤任务这种真正含有"和物理世界交互"信息的内容。
第三,多维度的标注体系。每段视频不只是有像素,还附带 3D 手部姿态、身体姿态、动作分类、字幕、层级语义标签等多种结构化信息。
和已有数据集相比的位置

HumanNet 不是又一个把数据堆大的工作,它是想给具身智能领域提供一个"地基级"的资源,就像 ImageNet 当年之于视觉、Common Crawl 之于语言那样。
100 万小时是怎么"造"出来的
光说大数字没意义,关键是怎么把杂乱的互联网视频清洗成可训练的素材。

这套流水线最值得欣赏的地方,是它把"过滤、视角区分、质量控制、隐私审核"全部当作头等设计原则来处理,而不是事后补丁。
核心实验:1000 小时
人类视频 vs 100 小时机器人数据
整篇论文最关键的一个实验,是验证"人类视频到底能不能当作机器人数据的廉价替代品"。这是 HumanNet 的核心赌注,所以作者设计了一个非常严格的对照。
他们固定下游训练数据(100 个任务、每个任务 20 条轨迹,共 34 小时机器人交互数据)、固定网络架构(LingBot-VLA),只改变预训练来源,比较四种配置:基础 Qwen VLM、Qwen 加 100 小时真实机器人 CoBot 数据、Qwen 加 1000 小时 HumanNet 第一视角视频、以及加了 2 万小时机器人数据的 LingBot 完整版。

这个结果有两层含义需要说清楚。
第一层,它说明第一视角人类视频确实承载了"以执行者为中心的视觉线索、手物接触模式、过程性结构"等迁移到机器人任务上仍然有用的信息。
第二层,从经济性角度看,采集 1000 小时 YouTube 风格的人类视频成本可能只有采集 100 小时机器人数据的几十分之一甚至更少,这意味着 HumanNet 提供的不只是一个补充资源,而是一个规模可扩展的、便宜的机器人数据替代方案。
总结
机器人数据像是手工作坊产的奢侈品,贵且稀缺,仿真数据便宜但有 sim-to-real gap,真正既规模化又有迁移价值的第三条路一直没找到。HumanNet 押的就是这第三条路:人类视频。
当然作者自己也很坦诚地讨论了局限。
一是"人不是机器人",即使 100 万小时的人类数据也消除不了人手和机械夹爪之间的具身鸿沟,人类视频更多扮演的是表示学习和迁移先验的角色,不是直接的动作演示。
二是规模带来噪声,自动生成的标注本身有错误。
三是覆盖不均衡,数据可能偏向某些地理、文化、家庭场景,大数据不等于普适。
四是隐私与安全,第一视角视频可能拍到旁观者、私人空间、文件屏幕,需要严格的过滤和访问控制。
这是一个数据中心化(data-centric)的、可扩展的路径。它能不能最终引出"具身智能领域的 GPT 时刻",还有待时间检验,但这一步迈出去本身就值得关注。

