技术博客
强化学习

翻遍了全网,这11个具身智能强化学习开源项目最值得复现!

Truman2026-07-09 11:57
翻遍了全网,这11个具身智能强化学习开源项目最值得复现!

强化学习近年来如火如荼,为帮助研究者与开发者高效追踪前沿,本文梳理了 2025年度具身智能领域的11个强化学习论文开源项目和开源框架,聚焦人形四足机械臂。欢迎大家尝试用GM复现!







1

ASAP: Aligning Simulation and 

Real-World Physics for Learning Agile 

Humanoid Whole-Body Skills


研究团队:卡内基梅隆大学、英伟达


项目概述:ASAP(Aligning Simulation and Real-World Physics)是一个两阶段框架,专门设计用于解决仿真与现实世界之间的动力学不匹配问题,从而实现敏捷的人形机器人全身技能。


该框架首先在仿真中预训练运动跟踪策略,然后在现实世界中部署这些策略并收集数据来训练增量动作模型,该模型能够补偿仿真与现实世界之间的动力学差异。通过将增量动作模型集成到仿真器中并对预训练策略进行微调,


ASAP能够有效对齐现实世界动力学,在Unitree G1人形机器人上实现了包括C罗式庆祝跳跃、勒布朗·詹姆斯的"静音器"庆祝动作、科比的后仰跳投等高难度敏捷动作,显著降低了运动跟踪误差。




项目论文:

https://arxiv.org/abs/2502.01143

项目代码:

https://github.com/LeCAR-Lab/ASAP



2

TienKung-Lab: Direct IsaacLab 

Workflow for TienKung


研究团队:北京人形机器人创新中心


项目概述:TienKung-Lab是一个基于强化学习的运动控制系统,专为全尺寸类人机器人设计。它将AMP式奖励与周期性步态奖励相结合,促进自然、稳定且高效的步行和跑步行为。


该代码库基于IsaacLab构建,支持向MuJoCo传输Sim2Sim,并采用模块化架构,实现无缝定制和扩展。此外,它还集成了基于射线投射的传感器,增强感知能力,实现环境精确交互和障碍物避让。


在此前进行的全球首届人形机器人马拉松比赛中,搭载该运控算法的天工Ultra夺得全球首个人形机器人马拉松冠军。




项目代码:

https://github.com/Open-X-Humanoid/TienKung-Lab



3

BeyondMimic Motion Tracking


研究团队:加州大学伯克利分校、斯坦福大学


项目概述:BeyondMimic 是一个突破性的仿人机器人控制框架,通过结合运动追踪引导扩散模型,实现了从单纯的动作模仿到多功能控制的跨越。


该研究的核心创新在于提出了一个统一的两阶段框架:首先通过强化学习从多样化的人类运动数据中学习敏捷、自然的仿人运动技能,然后训练一个潜在扩散模型来合成这些技能,通过在线优化解决训练时未见的任务。



该框架的关键优势在于其零样本泛化能力——无需针对特定任务进行调优,就能实现多种下游任务,包括摇杆遥操作、路径点导航、运动修复和避障等。


与先前需要大量领域随机化和手动调优的方法不同,BeyondMimic 采用紧凑而原则性的公式,仅使用三个正则化项就能实现物理一致的行为。



实验结果表明,BeyondMimic 在真实硬件上成功展示了人类水平的敏捷性,包括空中侧手翻、旋转踢腿等高动态动作,同时在自然度用户研究中显著优于现有最先进方法。


这项工作将仿人机器人控制从手动调优的特定运动策略推进到了一个预测性、可泛化的新范式,为直接从人类演示学习并跨运动、环境和目标泛化的仿人行为基础模型迈出了重要一步。



项目论文:

https://arxiv.org/abs/2508.08241

项目代码:

https://github.com/HybridRobotics/whole_body_tracking



4

NavRL: Learning Safe Flight in 

Dynamic Environments


研究团队:卡内基梅隆大学


项目概述:NavRL 是一个基于深度强化学习的无人机导航框架,旨在解决动态环境中安全飞行的核心挑战。该研究提出了一种创新的方法,通过结合定制化的状态动作表示基于速度障碍物的安全防护机制,实现了在包含静态和动态障碍物的复杂环境中的安全导航。


实验验证表明,NavRL 在仿真和实际飞行测试中均表现出色,在动态混合环境中的碰撞次数相比基准方法减少超过50%,实现了零样本的仿真到现实转移


该框架在NVIDIA Isaac Sim中实现了并行训练,支持数千架四旋翼无人机同时训练,显著加速了收敛过程。


这项工作为无人机在复杂动态环境中的安全自主导航提供了有效的解决方案,具有重要的实际应用价值。




项目论文:

https://ieeexplore.ieee.org/document/10904341

项目主页:

https://github.com/Zhefan-Xu/NavRL



5

RoboMIND: Benchmark on 

Multi-embodiment Intelligence 

Normative Data for Robot Manipulation


研究团队:北京人形机器人创新中心、北京大学计算机学院多媒体信息处理国家重点实验室、北京人工智能研究院


项目概述:RoboMIND是联合开发的大规模多具身机器人操作数据集


该项目针对当前机器人学习领域缺乏高质量标准化数据集的瓶颈问题,构建了一个包含10.7万条演示轨迹的综合性基准数据集,涵盖4种不同的机器人平台(Franka Emika Panda单臂机器人、X-Humanoid Tien Kung人形机器人、AgileX双臂机器人和UR5e单臂机器人)、479个多样化任务和96种物体类别。




项目论文:

https://roboticsconference.org/program/papers/152/

项目代码:

https://github.com/x-humanoid-robomind/x-humanoid-robomind.github.io



6

Piper rl  demo


研究团队:松灵机器人


项目概述:PiPER是松灵机器人推出的高性价比六轴协作机械臂, “PiPER RL Demo” 开源项目详细介绍了如何在 Mujoco 和 Genesis 两大仿真环境中,构建并训练一个面向“末端夹爪到达目标位置”任务的强化学习策略。


该项目将从环境搭建、自定义 Gym 环境设计、奖励函数构建到并行训练与可视化评估,完整呈现一个端到端的 RL 开发流程,帮助读者快速上手机器人强化学习实践。




项目代码:

https://github.com/vanstrong12138/Piper_rl



7

OpenArm Isaac Lab


研究团队:英伟达、OpenArm


项目概述:该仓库为基于NVIDIA Isaac Sim和Isaac Lab构建的OpenArm机器人平台提供仿真和学习环境。


它支持强化学习(RL)模仿学习(IL)、远程作以及模拟到现实的研发,适用于单手(单臂)和双手(双臂)机器人系统。




项目代码:

https://github.com/enactic/openarm_isaac_lab



8

Berkeley Humanoid Lite


研究团队:加州大学伯克利分校


项目概述:伯克利人形机器人精简版(Berkeley Humanoid Lite)是一个开创性的开源人形机器人平台,旨在解决当前人形机器人领域存在的成本高昂、封闭源代码和可定制性差等核心问题。


该项目通过创新的3D打印技术实现了人形机器人的民主化,让研究人员、教育工作者和爱好者都能以低于5000美元的成本构建和定制自己的人形机器人。



研究团队通过严格的执行器评估验证了平台的可靠性,包括功率效率测试(机械效率达90%)、传动刚度测量(319.49 Nm/rad)和60小时耐久性测试。


实验证明,该平台能够成功实现从模拟到硬件的零样本策略传输,完成双足行走、物体抓取、解魔方等复杂任务。




项目论文:

https://arxiv.org/abs/2504.17249

项目主页:

https://lite.berkeley-humanoid.org/

项目代码:

https://github.com/HybridRobotics/Berkeley-Humanoid-Lite



9

HoST: Humanoid Standing-up Control


研究团队:上海人工智能实验室、上海交通大学、香港大学、浙江大学、香港中文大学


项目概述:HoST(Humanoid Standing-up Control)是一个创新的强化学习框架,专门为解决人形机器人从多样化姿态站立的控制问题而设计。


该项目针对当前人形机器人控制领域存在的关键挑战——即如何让机器人从地面、平台、墙壁和斜坡等多种复杂姿态中平稳站立起来,提出了全面的解决方案。




项目论文:

https://arxiv.org/abs/2502.08378

项目主页:

https://taohuang13.github.io/humanoid-standingup.github.io/

项目代码:

https://github.com/InternRobotics/HoST



10

RLinf: Reinforcement Learning 

Infrastructure for Post-training


研究团队:清华大学、中关村研究院、Infinigence AI、北京大学、加州大学伯克利分校、北京航空航天大学、上海交通大学


项目概述:RLinf是一个基于宏微观流转换(M2Flow) 的新型强化学习训练系统,旨在解决现有系统在RL工作流执行效率低下的问题。


该系统通过将高层次、易于组合的RL工作流在时间和空间维度上自动分解,并重新组合成优化的执行流,实现了灵活性和效率的最大化


RLinf通过弹性流水线、上下文切换和基于性能分析的调度策略,在推理RL和具身RL任务上均显著优于现有最优系统,实现了1.07倍至2.43倍的端到端训练吞吐量提升




项目论文:

https://arxiv.org/abs/2509.15965

项目代码:

GitHub - RLinf/RLinf: RLinf is a flexible and scalable open-source infrastructure designed for post-



11

SimpleVLA-RL: Open RL Framework 

for Vision–Language–1Action Models


研究团队:清华大学、上海人工智能实验室、上海交通大学、北京大学、香港大学等


项目概述:SimpleVLA-RL 是一个专为视觉-语言-动作模型设计的高效强化学习框架,旨在解决VLA模型在机器人操作任务中面临的两个核心挑战:大规模人类操作轨迹数据的稀缺性以及面对分布偏移时的泛化能力有限问题。




项目论文:

https://arxiv.org/abs/2509.09674

项目代码:

https://github.com/PRIME-RL/SimpleVLA-RL





重要通知

诚邀各位创新者们和我们一起共创知识库实践板块!你只需将已在GM成功复现的项目,通过收集表花几分钟提交。


审核通过后,我们会在2天内将算力赠送金发到你的账户。这笔赠送金可以直接用来开启你的下一个实验。


你上传的优秀工程,也将被收录进平台知识库的实践板块,成为吸引更多同行与后来者的灯塔。

轻松一步,兑换资源,也沉淀足迹。


期待你的分享!

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发