具身智能内卷:从序列预测到残差模仿,人形机器人运动控制SOTA盘点!

本文为大家整理了3篇论文,聚焦于让人形机器人实现复杂、拟人化的全身运动和操作。
人形机器人运动即下一令牌预测

论文将现实世界中的人形机器人控制问题视为一个 “下一个 token 预测” 问题,类似于语言中预测下一个单词,通过这种方式来实现人形机器人的运动控制。
采用了一个通过自回归预测训练的因果 Transformer(causal transformer)模型。由于训练数据具有多模态特性,模型以模态对齐的方式进行预测,对于每个输入 token,能够预测相同模态的下一个 token,这样可以利用缺失模态的数据,比如没有动作的视频轨迹。
训练数据来源广泛,包括先前的神经网络、基于模型的控制器、运动捕捉以及人类视频。这些不同来源的数据为模型提供了丰富的信息,有助于模型学习到更全面的运动模式。
模型即使只在 27 小时的行走数据上训练,也能很好地转移到现实世界中,并且能够泛化到训练期间未见过的命令,比如向后行走。
此外,随着训练数据集的大小、上下文长度以及模型大小的增加,模型的性能会得到提升,位置跟踪误差会逐渐减少。
论文链接:
https://arxiv.org/pdf/2402.19469.pdf
ResMimic:通过残差学习从通用
运动跟踪到人形机器人全身移动操作

ResMimic通过两阶段的残差学习(Residual Learning)框架,解决了将大规模通用运动跟踪 (GMT) 策略快速、高效地适应于精确的全身移动操作 (Loco-Manipulation) 任务的关键问题。
基于其创新点(残差学习、GMT基座、专用奖励设计),以下是未来可发掘的新论文方向:
增强框架的泛化能力与层级设计,探索基于Transformer的通用残差策略以实现零样本任务适应,并构建分层残差架构解耦基座稳定、移动与精细操作,同时引入动态权重融合机制以提升决策智能。
深化奖励函数与多模态感知融合,将生物力学能效指标融入奖励以生成更自然、高效的动作,并整合触觉等实时传感数据来提升在精细操作任务中的鲁棒性。
提升在真实环境中的部署鲁棒性,开发在线系统辨识模块以动态补偿Sim-to-Real差异,并训练残差策略主动利用非预期接触来增强在杂乱环境中的抗干扰与自适应能力。
这些方向将共同推动残差学习在人形机器人复杂技能习得中的实用化与智能化水平。
论文链接:
https://arxiv.org/abs/2510.05070v1
代码链接:
https://resmimic.github.io/
HDMI:从人类视频中学习
交互式人形机器人全身控制

HDMI (HumanoiD iMitation for Interaction) 是一项旨在让类人机器人通过模仿学习(Imitation Learning, IL)从单目 RGB 视频中掌握全身交互技能的框架。
它的核心创新在于利用视频提取人类和物体的轨迹,并结合强化学习(RL)策略进行共同轨迹跟踪(co-tracking)。
流程包括:
从无约束视频中提取并重定向人体与物体的运动轨迹,以构建结构化的运动数据集。
训练一个强化学习策略来协同跟踪机器人和物体的状态,该策略包含三个关键设计:统一的对象表征、残差动作空间和通用交互奖励。
将训练好的强化学习策略零样本部署到真实人形机器人上。
在宇树G1人形机器人上进行的大量仿真到真实实验证明了这个方法的鲁棒性和通用性:HDMI实现了连续67次穿越门框,并在真实世界中成功执行了6种不同的移动操作任务,在仿真中则完成了14种任务。
结果表明,HDMI是一个从人类视频中获取交互式人形机器人技能的简单而通用的框架。
论文链接:
https://arxiv.org/abs/2509.16757
代码链接:
https://github.com/LeCAR-Lab/HDMI
