重磅速递!4篇值得精读的具身强化学习论文

计算机视觉中的视觉嵌入学习
Sim2real迁移
模仿学习与人类反馈驱动的强化学习
Perception Encoder:
一款“看得更深”的通用视觉基础模型

论文介绍了一种用于图像和视频理解的先进编码器 Perception Encoder(PE)。传统视觉编码器依赖多种预训练目标,而该研究发现仅通过对比性视觉语言训练就能产生强大的通用嵌入,且这些嵌入隐藏在网络中间层。
为此,研究者引入语言对齐和空间对齐两种方法来提取这些嵌入。PE 模型在零样本图像和视频分类与检索、问答以及检测等空间任务上均取得了优异性能。此外,论文还发布了模型、代码和一个新的视频数据集。
论文链接:
https://arxiv.org/abs/2504.13181
官方项目链接:
https://github.com/facebookresearch/perception_models
Cosmos-Transfer1:
基于自适应多模态控制的条件世界生成

NVIDIA 基于扩散模型(Diffusion Model)推出了一款名为 Cosmos-Transfer1 的条件世界生成模型,专为模拟真实物理世界而设计。
该模型不仅能够结合深度图、分割图、边缘图等多种模态信息生成逼真的虚拟视频,还创新性地引入了空间-时间自适应控制机制,能够精准调控每一帧中各个区域的内容细节。
论文链接:
https://arxiv.org/pdf/2503.14492
官方项目链接:
https://github.com/nvidia-cosmos/cosmos-transfer1
Imitation from Observation:
通过上下文转换从原始视频中学习模仿行为

该论文是模仿学习领域的重要研究成果,由 Pieter Abbeel 团队等研究者发表于ICML 2018(国际机器学习大会),核心突破在于解决了传统模仿学习中 “需获取专家动作数据” 的局限,提出从原始视频观测中直接学习模仿行为的新范式。
传统模仿学习(如行为克隆)依赖专家执行任务时的 “动作标签”(如机器人关节角度、自动驾驶转向指令),但现实场景中动作数据往往难以采集,而视频数据更易获取。
为此,论文提出 “上下文转换(Context Translation) ” 框架:将专家视频与智能体自身的环境视频视为 “不同上下文”,通过训练一个转换模型,把专家视频中的 “任务相关特征”(如物体位置、动作轨迹)迁移到智能体的环境视角中,再结合强化学习,让智能体在无专家动作的情况下,仅通过观察视频就能学习到目标行为。
论文在机器人抓取、导航等任务中验证了有效性,例如让机械臂通过观察人类抓取物体的视频,自主学会相同的抓取动作,且无需预先知道人类的手部关节运动数据。
论文链接:
https://arxiv.org/abs/1707.03374
领域随机化:
将深度神经网络从仿真环境迁移至现实世界

论文提出领域随机化(Domain Randomization)技术,通过在模拟器中随机化渲染参数,如光照、物体纹理、姿态等,使模型在模拟环境中学习到更具泛化性的特征。
这样,真实世界对于模型来说就只是模拟环境的一种变体。
研究人员聚焦于物体定位任务,仅使用具有非现实随机纹理的模拟数据,训练出了对真实世界物体检测精度达 1.5 厘米,且对干扰物和部分遮挡具有鲁棒性的模型,并在杂乱环境抓取任务中进行了验证。
论文链接:
https://arxiv.org/abs/1703.06907
官方项目名称:
robotics-grasping
官方代码地址:
https://github.com/deepmind/robotics-grasping
