技术博客
其他

新鲜开源论文和实践项目速递!

Truman2026-07-09 14:53
新鲜开源论文和实践项目速递!


FALCON:

Learing rce-Adaptive Humanoid Loco-Manipulation










论文链接:https://arxiv.org/abs/2505.06776

(复制链接到浏览器,或点击“阅读原文”查看)


本文提出了 FALCON—— 一种基于双智能体强化学习的框架,用于实现稳定的力自适应人形机器人移动操作。FALCON 将全身控制分解为两个专门的智能体:

(1)下半身智能体,负责在外力干扰下确保稳定移动;

(2)上半身智能体,负责精确跟踪末端执行器位置,并进行隐性的自适应力补偿。


这两个智能体在仿真环境中联合训练,训练过程采用力课程学习方式,在遵守扭矩限制的前提下,逐步增大施加在末端执行器上的外力大小。实验表明,与基准方法相比,FALCON 的上半身关节跟踪精度提高了 2 倍,同时能在外力干扰下保持稳定移动,且训练收敛速度更快。


此外,FALCON 不需要针对特定机器人形态调整奖励机制或课程设置,只需相同的训练配置,就能得到可在多个机器人上部署的策略。在现实世界中,它能完成有力的移动操作任务,比如搬运负载(0-20N 力)、拉车(0-100N 力)和开门(0-40N 力)。


综上,本文的主要贡献如下:

  • 提出 FALCON 双智能体强化学习框架,使人形机器人能在承受较大的、未知的末端执行器力(0-100N,最高达体重的 30%)时,完成有力的移动操作。相比以往方法,FALCON 的上半身关节跟踪精度提高了 100%,同时保持了稳定的移动性能。

  • 为促进高效的强化学习训练,设计了 3D 力课程学习方式,通过逐步施加力,确保关节扭矩在可行范围内,并最大限度提升其力自适应能力。

  • 在两个不同的人形机器人平台(Unitree G1、Booster T1)上验证了 FALCON 的效果,仅需极少的调整,就能实现良好的跨平台泛化。



Adversarial Locomotion and 

Motion Imitation 

for Humanoid Policy Learning









论文链接:https://arxiv.org/abs/2504.14305

(复制链接到浏览器,或点击“阅读原文”查看)


人类展现出了多样且富有表现力的全身运动。然而,在类人机器人中实现类人般的全身协调仍然具有挑战性,因为传统的方法往往忽视了上半身和下半身的不同角色,这些方法通常模仿整体运动。


这一疏忽导致了计算上高开销的策略学习,并经常在实际执行中导致机器人不稳定和跌倒。为了解决这些问题该项目提出了对抗运动和动作模仿(ALMI)这一新颖框架,旨在促进上半身和下半身之间的对抗性策略学习。


ALMI 的核心思想是:将人形机器人控制任务划分为上肢和下肢两个策略子系统,分别学习不同目标,然后通过对抗博弈机制达成全身协同。具体来说,下半身提供强大的运动能力来遵循速度命令,而上半身则跟踪各种运动。


相反,上半身策略可确保在机器人执行基于速度的运动时进行有效的运动跟踪。通过迭代更新,这些策略实现了协调的全身控制,可以扩展到远程作系统的运动纵任务。


大量实验表明,此方法在仿真和全尺寸 Unitree H1 机器人上都实现了稳健的运动和精确的运动跟踪。此外,项目还发布了一个大规模的全身运动控制数据集,其中包含来自 MuJoCo 模拟的高质量情景轨迹,可部署在真实机器人上。


本工作主要贡献如下:

  • 提出一种新型对抗训练框架(ALMI),用于人形机器人的稳健运动和精确运动模仿,通过单独的策略学习上半身和下半身的不同作用。

  • 创建了首个大规模全身控制数据集(ALMI-X),该数据集将语言描述与机器人轨迹整合,有助于训练人形机器人全身控制的基础模型。

  • 进行了大量实验,以验证 ALMI 策略的有效性,并在模拟和现实世界中对仿人基础控制模型进行了初步研究。


以上两篇论文分别从力自适应移动操作和对抗性运动模仿的角度,为人类形机器人的全身控制提供了创新框架与理论支撑,接下来的实践项目则聚焦于机器人模仿人类动作的实际落地,为这一领域的应用提供了可操作的解决方案。



项目简介










本项目提出了一种方法,在人形机器人上学习全身控制策略,以尽可能逼真地模仿人类动作。为了训练这种策略,研究借助图形领域的大规模人类动作捕捉数据CMU,在强化学习框架中展开训练。


不过,由于机器人与人类在自由度和身体机能上存在巨大差异,直接利用动作捕捉数据集进行模仿学习,无法在真实的人形机器人上奏效。为此,本文提出的 “Exbody” 方法解决了这一问题:它鼓励人形机器人的上半身模仿参考动作,同时放宽对两条腿的模仿约束,仅要求腿部能稳定地遵循给定速度运动。


通过在仿真环境中训练并进行仿真到现实的迁移,该策略能控制人形机器人在现实世界中做出不同风格的行走、与人类握手,甚至和人类一起跳舞等动作。


项目代码:

https://github.com/chengxuxin/expressive-humanoid

项目主页:

https://expressive-humanoid.github.io/

论文链接:

https://arxiv.org/abs/2402.16796

(复制链接到浏览器,或点击“阅读原文”查看)


环境镜像:

Isaac GYM:preview-4 - BJX00000001 - isaac-gym-v14


数据准备

项目的数据重定向部分需要参考github中的README,在个人电脑或开发机运行,将重定向后标注好keypoint的数据传入个人存储中,并在代码中修改调用路径。

.npy文件上传到/personal/retarget_npy

ASE/ase/utils/motion_lib.py line 272 

改为 data_root = "/personal/retarget_npy"


文件调整:

expressive-humanoid/ASE/ase/poselib/data/pkl 目录中需要放入数据准备环节生成的,训练所需的pkl文件

删除mujoco文件夹


代码修改

项目中所有的setup.py中, install_requires列表中

增加'tensorboard == 2.12.0'  numpy版本修改为 'numpy==1.23.5'

启动命令及参数说明


启动命令

gm-run expressive-humanoid/legged_gym/legged_gym/scripts/train.py your_train_name --headless --no_wandb

your_train_name用于记录当次训练,在本地训练时使用,这里随便填写


为什么图表处为空白?

开源代码中没有使用tensorboard记录训练数据。如需在GradMotion中查看图表,请修改on_policy_runner.py脚本,使用tensorboard记录训练数据。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发