具身强化学习领域3篇论文大揭秘,速来围观!

本周更新了三篇论文涉及两个方向。
模仿学习与人类反馈驱动的强化学习
腿足机器人运动控制与技能学习
01
基于变分偏好学习从
人类反馈中进行个性化强化学习

由华盛顿大学的研究人员撰写。论文指出,强化学习从人类反馈(RLHF)是使基础模型与人类价值观和偏好保持一致的强大范例,但当前 RLHF 技术无法解释个体人类偏好的自然差异。
为解决这一问题,研究人员开发了一类多模态 RLHF 方法,基于潜在变量公式推断特定于用户的潜在变量,并在此基础上学习奖励模型和策略,而无需额外的用户特定数据。
实验表明,该方法能在模拟控制问题中推断和优化用户特定的奖励函数,提高奖励函数的准确性,还能测量不确定性和主动学习用户偏好。
论文链接:
https://arxiv.org/pdf/2408.10075.pdf
代码地址:
https://github.com/WEIRDLabUW/vpl_llm
02
RMA:四足机器人快速运动自适应

由Meta AI和UC Berkeley团队联合提出,是四足机器人动态适应领域的突破性工作。
该论文核心创新在于分层强化学习架构:底层基础策略(Base Policy)处理运动控制,高层自适应模块(Adaptation Module)实时分析本体感知数据(如关节位置、扭矩信息),在线推断地形参数(如摩擦力、坡度),并在毫秒级内调整控制策略。
该方法无需预先采集环境数据或构建精确地形模型,仅通过机器人自身传感器信息即可实现在线自适应。
实验显示,Unitree Laikago和Aliengo机器人在多种未知复杂地形(草地、沙地、斜坡、软垫)中成功保持动态稳定性,适应速度比传统方法快10倍以上,显著提升了机器人在真实环境中的鲁棒性和实用性。
论文链接:
https://arxiv.org/abs/2107.04034
代码地址:
https://github.com/antonilo/rl_locomotion
03
让腿式机器人学会敏捷与动态运动技能

由苏黎世联邦理工学院(ETH Zurich)机器人系统实验室(RSL)团队发表于机器人顶级会议(RSS / Science Robotics)。
论文的核心贡献在于提出了一个新颖的分层控制框架,该框架巧妙地融合了强化学习(Reinforcement Learning, RL) 与模型预测控制(Model Predictive Control, MPC) 的优势。
在该框架中,上层MPC控制器基于简化的动力学模型,负责规划未来的运动轨迹和足端接触力,以提供长期的最优性指导;而下层RL学习得到的神经网络策略则负责执行MPC的指令,并处理全阶模型动力学及执行器的复杂特性,实现高保真的精确控制。
通过在大规模仿真环境中进行的课程学习(Curriculum Learning),该方法成功使ANYmal机器人掌握了诸如在线的动态小跑(Dynamic Trotting) 和复杂的双足站立跳跃(Rearing) 等前所未有的敏捷技能。
尤为重要的是,通过领域随机化(Domain Randomization) 等技术,所学策略能够零样本(Zero-shot) 直接迁移至真实物理机器人上运行,无需任何额外的微调,展现了卓越的Sim-to-Real转移能力。
实验结果充分证明,相较于传统的基于模型的控制方法,该框架所习得的控制器不仅在运动敏捷性(如速度、灵活性)和鲁棒性(抗外力扰动、应对不确定性地形)方面表现卓越,同时还显著提升了能量效率。
这项研究为开发能够在复杂现实环境中自主、高效运行的新一代腿足式机器人提供了关键性的技术路径与理论支撑。
论文链接:
https://arxiv.org/abs/1901.08652
代码地址:
https://github.com/junja94/anymal_science_robotics_supplementary
