灵巧手数据荒终结者!硬核外骨骼+高保真修复:DexUMI 正在让机器人学会人类的一切动作!

原文链接:
https://arxiv.org/abs/2505.21864
简要总结
该框架将人手作为天然的操作界面,通过软硬件结合的方式,成功将人类的灵巧操作技能高效迁移至多种机器人手平台,并在多项任务中取得了优异表现。
核心方法:
硬件端引入可穿戴手部外骨骼 (Wearable Hand Exoskeleton),从而弥合人手与机器人手之间的运动学差异(Kinematics Gap),并为操作者提供实时的触觉反馈;
软件端采用高保真机器人手图像修复 (High-fidelity Robot Hand Inpainting),从而在视频数据中用机器人手替换人手,消除视觉上的身体差距(Visual Gap)。

主流方法的局限
首先,传统的远程操作(Teleoperation)或简单的动捕(Motion Capture)方法并不理想。其核心矛盾在于身体失配:人手和机器人手的关节结构、长度和运动范围(DoF)往往不同。
如果直接模仿人手动作,机器人可能会因为“够不到”或“折断关节”而失败;同时,视觉模型如果只看人手操作的视频,在面对机器人自己的金属手臂时会产生“认知失调”,导致策略失效。
本文的路径选择
因此,DexUMI 选择了“硬映射+软重绘”的协同路径。它不再要求机器人去“适应”人的动作,而是通过一套中介系统,让操作数据在生成阶段就符合机器人的“身体特征”。
具体实现步骤
首先通过硬件外骨骼重塑运动学(Kinematics Adaptation)。 操作者戴上定制的外骨骼进行任务。这一步的动作是实时将人手的姿态映射到机器人手的可行范围内,目的是确保采集到的每一帧数据都是机器人物理上可执行的。这种设计就像为人类穿上了一层“机器人皮肤”,让反馈变得直观。
其次实施视觉层面的“换头术”(Visual Inpainting)。 算法会识别视频中出现的人手,并利用生成技术将其替换为高保真的机器人手图像。这一步的做法是将原始像素替换为目标硬件的渲染图,目的是消除视觉干扰,让神经网络在学习时只看到机器人手,实现“所见即所得”的策略训练。
效果验证
研究团队在两个完全不同的灵巧手硬件平台上进行了全面实验。结果显示,DexUMI 达成了 86% 的平均任务成功率。
值得关注的细节
注意看实验中的跨平台迁移能力。由于其软件修复(Inpainting)方案具有很强的灵活性,同一套人类演示数据可以被快速转化为适用于不同机器人手的训练集,这极大地降低了灵巧操作的数据获取成本。

