技术博客
强化学习

别再手动调参了!CoRL 2025 炸场:长上下文Transformer + 潜空间RL,开启“万能机器人”时代

Truman2026-07-09 11:57
别再手动调参了!CoRL 2025 炸场:长上下文Transformer + 潜空间RL,开启“万能机器人”时代

如果你还在为每一款机器人单独编写控制算法,或者为昂贵的人类演示数据发愁,那么这三篇来自 CMU、NVIDIA、Stanford 顶级团队的最新论文将彻底重构你的认知。


以下论文都是CoRL的获奖/提名论文。






LocoFormer:通过长上下文

自适应实现的通用运动控制


LocoFormer是一款由卡内基梅隆大学团队研发的通用全机体运动模型,其核心突破在于打破传统“一机一策”模式,能够控制多种未见过的足式、轮式机器人,且无需精确运动学知识。


该模型通过大规模强化学习结合激进的领域随机化,在程序化生成的多样机器人上进行训练,并采用长上下文适配机制,使其能跨越回合边界提取信息,从而实现对环境干扰、机体故障的高鲁棒性控制,并能从失败中自主总结经验、持续改进。


研究者认为,这种“长上下文+大规模RL”的框架为未来机器人技能基础模型提供了通用而简洁的实现路径。



论文链接:

https://arxiv.org/abs/2509.23745




通过潜在空间

强化学习实现扩散策略的导向控制


本研究提出了一种名为潜空间强化学习的创新方法,旨在解决行为克隆策略在新环境中自主适应能力不足的瓶颈。


传统扩散策略依赖大量人类演示数据且成本高昂,而标准强化学习则因样本效率低下难以在实际机器人任务中高效应用。


本方法的核心在于,在预训练扩散策略的潜噪声空间中进行强化学习,通过优化潜变量间接引导策略生成更适应新环境的动作序列,且仅需以黑盒方式调用原始策略,无需调整其模型权重。


该方法在仿真基准测试、现实机器人任务及通用策略适配场景中均验证了其高效性,能以极低的样本需求实现策略的快速在线优化,为现实世界机器人部署提供了高效的自主改进方案。



论文链接:

https://arxiv.org/abs/2506.15799




DexUMI:

用人手作为灵巧操作的通用操控接口


DexUMI 是一个旨在将人类灵巧操作技能迁移至各类机器人手的数据采集与策略学习框架。


其核心技术通过以下两个维度的适配来消除人类与机器人之间的“具身鸿沟”:

  1. 硬件适配(桥接运动学差异):该框架采用可穿戴手部外骨骼作为自然交互接口。它能够将人类的复杂动作转化为机器人手可行的运动路径,并在操作数据采集过程中为人类提供直接的触觉反馈

  2. 软件适配(桥接视觉差异):为了消除视觉上的不一致,该技术利用高保真机器人手修复技术,在训练视频中将人类的手部替换为对应的机器人手。


通过这种软硬件结合的方案,DexUMI 在两种不同的灵巧手硬件平台上实现了 86% 的平均任务成功率,证明了其在真实世界任务中的通用性和有效性。


这种技术就像是为机器人量身定制了一套“实感虚拟现实系统”:硬件外骨骼让机器人能够实时同步人类的动作并反馈力度,而软件修复技术则像是在后期剪辑中把“替身”换成“主角”,让AI在训练时看到的场景与实际操作时完全一致。



论文链接:

https://arxiv.org/abs/2505.21864

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发