具身强化学习领域6篇前沿论文大揭秘,速来围观

本文为大家整理了具身强化学习领域的6篇前沿论文,涉及强化学习控制、Sim2real迁移、课程学习训练、多任务操作和数据集构建等内容。
H2O & OmniH2O 通用人形机器人实时全身遥操作和学习
H2O: 从人类到人形机器人实时全身遥操作的学习

H2O这项工作
(1) 通过可扩展的重定向和“sim-to-data”过程,获得了适用于现实世界仿人机器人的大规模运动数据集;
(2) 实现了基于 RL 的全身跟踪控制器的sim2real转移,可扩展至大量运动;
(3) 利用 RGB 摄像头和三维人体姿态估计建立人形机器人的实时远程操作系统,演示了各种全身运动。
论文链接:https://arxiv.org/abs/2403.04436
OmniH2O:通用灵巧且可全身远程操作并学习的人形机器人

OmniH2O是在H2O基础上开展的工作
(1) 提出了一种训练稳健仿人控制策略的方法,这种控制策略支持全身灵巧的定位操纵,具有通用界面,可实现多功能人类控制和自主操作,包括VR头显、语音指令,还可以与前沿模型(如GPT-4o)集成,实现机器人完全自主行动。
(2) 在模拟和现实世界中进行的大规模运动跟踪实验,验证了 OmniH2O 卓越的运动模仿能力。
(3) 提供了第一个仿人机械手操作数据集,并评估了在该数据集上的模仿学习方法,从而展示了从远程操作数据集学习仿人全身技能的过程。
论文链接:https://arxiv.org/abs/2406.08858
两个工作共用一个开源项目:
https://github.com/LeCAR-Lab/human2humanoid
两篇论文的中文解读:
https://blog.csdn.net/v_JULY_v/article/details/142796658?spm=1001.2014.3001.5501
HoST: 人形机器人起身站立控制

HoST(类人机器人站立控制),这是一个从头开始学习站立控制的强化学习框架,能够实现跨多种姿势的模拟到现实的稳健迁移。HoST通过多批评家架构和基于课程的训练,在多样化的模拟地形上有效学习姿势自适应运动。
为确保现实世界部署的成功,我们通过平滑度正则化和隐式运动速度限制,分别缓解物理硬件上的振荡和剧烈运动。经过模拟训练后,所学控制策略可直接部署于Unitree G1类人机器人。实验结果表明,控制器在广泛的实验室和户外环境中均能实现平滑、稳定且稳健的站立动作。
项目链接:
https://taohuang13.github.io/humanoid-standingup.github.io/
论文链接:
https://arxiv.org/abs/2502.08378
(复制到浏览器打开,或点击阅读原文查看)
支持机器人型号:
UnitreeG1, UnitreeH1, High Torque Mini Pi, DroidUp
仿真环境:Isaacgym训练框架:rsl_rl + leggedGymGradmotion复现
环境镜像
Isaac GYM:preview-4 | Python:3.8.20 | PyTorch:2.4.1 | Ubuntu 20.04.5 LTS | Cuda:12.1Git配置
代码地址:https://github.com/OpenRobotLab/HoST 分支/Branch main启动指令
gm-run HoST/legged_gym/legged_gym/scripts/train.py --task g1_ground --headless--task: 任务名称,训练不同型号机器人在不同地形下起身task列表:g1_ground, g1_platform, g1_wall, g1_slope, g1_ground_prone, h1_ground, pi_ground
基于手臂约束的课程学习在轮腿机器人运动操控中的应用

该项目提出了一种基于机械臂约束的课程学习架构,以解决添加机械臂后引入的问题。首先,项目开发了一种臂约束强化学习算法,以确保控制性能的安全性和稳定性。此外,为解决臂与底盘之间奖励设置的不一致问题,提出了一种奖励感知课程学习方法。
策略首先在Isaac Gym中进行训练,然后转移到物理机器人上执行动态抓取任务,包括开门任务、风扇摆动任务以及接力棒拾取和跟随任务。
实验结果表明,该方法能够有效控制配备机械臂的轮足机器人掌握动态抓取技能,使其在运动过程中能够追踪并捕获移动物体。
项目链接:
https://acodedog.github.io/wheel-legged-loco-manipulation/
论文链接:https://arxiv.org/abs/2403.16535
(复制到浏览器打开,或点击阅读原文查看)
支持机器人型号:
airbot, go2_arx, aliengo_Z1, b2w
仿真环境:Isaacgym
训练框架:rsl_rl + leggedGym
Gradmotion复现环境镜像Isaac GYM:preview-4 | Python:3.8.20 | PyTorch:2.4.1 | Ubuntu 20.04.5 LTS | Cuda:12.1
Git配置
代码地址: https://github.com/aCodeDog/legged-robots-manipulation/
分支/Branch master
启动指令
gm-run legged-robots-manipulation/loco_manipulation_gym/scripts/train.py --task=go2_arx --headless --max_iterations=500--task: 可选任务名称 go2_human,go2_arx,b2w_z1,b2w,go2w,airbot
ABS: 多足机器人障碍环境中的高速无碰撞导航
多足机器人在复杂环境中导航时,必须同时具备敏捷性和安全性,以实现高效任务执行并避免与障碍物或人类发生碰撞。现有研究要么开发保守型控制器(< 1.0 m/s)以确保安全,要么专注于敏捷性而忽视可能致命的碰撞风险。
本文提出了一种基于学习的控制框架——敏捷且安全(ABS),该框架使四足机器人能够实现敏捷且无碰撞的运动。ABS包含一个敏捷策略,用于在障碍物中执行敏捷运动技能,以及一个恢复策略以防止失败,两者协同实现高速且无碰撞的导航。
ABS中的策略切换由一个基于学习的控制理论到达避免价值网络控制,该网络还作为目标函数指导恢复策略,从而在闭环中保护机器人。训练过程包括在模拟环境中学习敏捷策略、避障价值网络、恢复策略以及外部感知表示网络。
这些训练好的模块可直接部署在真实世界中,借助机载感知与计算能力,实现狭小室内外空间中静态与动态障碍物环境下的高速无碰撞导航。
项目链接:https://agile-but-safe.github.io/
(复制到浏览器打开,或点击阅读原文查看)
支持机器人型号:Unitree Go1 EDU
仿真环境:Isaacgym
训练框架:rsl_rl + leggedGym
Gradmotion复现环境镜像 Isaac GYM:preview-4 | Python:3.8.20 | PyTorch:2.4.1 | Ubuntu 20.04.5 LTS | Cuda:12.1
Git配置代码地址: https://github.com/LeCAR-Lab/ABS 分支/Branch main
启动指令
gm-run ABS/training/legged_gym/legged_gym/scripts/train.py --task=go1_pos_rough --max_iterations=400 --headless--task: 可选任务名称 go1_rough, go1_pos_rough, go1_rec_rough, a1_rough, go1_pos_rough_ppo_lagrangianDribble Master: 通过腿部运动学习敏捷的人形运球

人形机器人足球运球是一项极具挑战性的任务,需要在保持动态平衡的同时灵巧地控球。传统的基于规则的方法由于依赖于固定的行走模式,对实时球动态的适应能力有限,往往难以实现精确的控球。为了应对这些挑战,我们提出了一个两阶段课程学习框架,使人形机器人能够在没有明确动态或预定轨迹的情况下掌握运球技能。
在第一阶段,机器人学习基本的运动技能;在第二阶段,我们对灵活运球动作的策略进行微调。我们还在仿真中引入了虚拟摄像头模型,并设计了启发式奖励以鼓励主动感知,从而扩大连续感知球的视觉范围。我们在仿真中对该策略进行了训练,并成功地将其移植到实体仿人机器人上。
实验结果表明,我们的方法能够有效地操纵球,在多种环境中实现灵活且具有视觉吸引力的运球行为。这项工作凸显了强化学习在开发灵活的人形足球机器人方面的潜力。
项目主页:
https://zhuoheng0910.github.io/dribble-master/
论文链接:
https://arxiv.org/abs/2505.12679
(复制到浏览器打开,或点击阅读原文查看)
