技术博客
VLA

10 万小时手持夹爪数据,能把机器人策略推到哪一步?

Leza2026-07-22 10:54
10 万小时手持夹爪数据,能把机器人策略推到哪一步?

技术报告:https://arxiv.org/pdf/2607.15330

项目主页:https://robotics.xiaomi.com/xiaomi-robotics-1.html

代码地址:https://github.com/XiaomiRobotics/Xiaomi-Robotics-1

机器人缺的不是模型,是数据

大模型的进步靠的是"数据、算力、参数一起放大"。机器人想复制这条路,却卡在第一步:主流的真机遥操作采数据又慢又贵,还必须绑定具体硬件,采回来的东西高度雷同,几十个人在同几间实验室反复做同几件事。

小米这篇报告的赌注很直接:换一种采集方式,把数据先做到 10 万小时以上,再看规模能带来什么。

用手持夹爪绕开机器人

他们用的是 UMI(Universal Manipulation Interface,Chi et al. 2024),一个 3D 打印的手持平行夹爪,装一个鱼眼相机,人拿着它直接做事,靠视觉 SLAM 反推出末端轨迹。没有机器人,也就没有机器人的成本和场地限制。

让 VLM 替人写标签

数据有了,标注成了新瓶颈。传统做法是人工按任务语义切分轨迹、逐段写指令,10 万小时下这条路根本走不通。

他们的办法是:把轨迹切成等长片段,让 Qwen3.5-27B 描述这一段里"夹爪做了什么、物体状态怎么变了"。 注意这里标的不是指令,而是状态转移。模型学到的目标因此变成:"把场景从现在这个样子,变成这段文字描述的样子。"

工程上还有个值得一提的细节:CPU 线程负责切片并写入内存文件系统,客户端线程同时挂着数百个标注请求在飞。整个语料约两周标完

架构:一个防止"抄答案"的小设计

动作由 DiT 通过 flow matching 生成,推理时 5 步欧拉积分即可出结果。

真正有意思的是那个"负向设计":他们在 VLM 侧加了 Choice Policy 式的辅助动作监督(一次前向出 K 个候选动作 + K 个打分,只有最接近真值的那个候选回传梯度)来加速收敛,但刻意把这些动作 token 从 DiT 的注意力里排除掉。原因是:一旦让 DiT 看见 VLM 已经算出的动作,它就会走捷径直接抄,而不再费力去理解画面和指令。

两阶段训练

预训练学的是"状态转移 → 动作",但人不会这么跟机器人说话,而且 UMI 夹爪也不是机器人本体。所以后训练要补两个缺口:

同时把动作空间统一:手臂用相对末端位姿增量,且统一所有本体的末端坐标系朝向,让"向前伸"在任何硬件上都对应同一组数值;缺失的维度在算损失时直接 mask 掉。

结果:规模确实在起作用

无动作预训练的基线只有 26%。用 12.5% 的数据就能把基线翻倍,而 50%→100% 还能再涨 6 个点,没看到饱和。

模型尺寸方向:2B → 5B → 10B 对应 61% → 75% → 79%。但增益明显小于数据方向——作者据此判断,十亿参数量级可能已足够拟合当前数据分布,数据才是主要瓶颈

下游微调上,四个新任务(手机装盒、洗衣、打印机加纸、装箱)平均每个任务不到 10 小时数据时,成功率 75%,π0.5 为 40%。

最难的"没见过的组合任务"上从 7.9 提到 32.1,是全表最大的相对提升。RoboDojo 平均分 20.07(前最优 13.07),但 Memory 维度只有 7.81,输给了显式建模记忆的 Hy-Embodied-0.5-VLA(13.37)作者坦承评测时没有引入历史观测。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发