具身强化学习领域3篇前沿论文分享,速来围观!

本文为大家整理了具身强化学习领域的3篇前沿论文,涉及三个方向。
多模态语言模型在机器人具身智能方面
机器人触觉感知与控制
自然语言处理和强化学习
PaLM-E:具身多模态语言模型

论文提出了 PaLM-E 模型,旨在将真实世界的连续传感器模态直接纳入语言模型,建立单词与感知之间的联系。
该模型的输入是交错了视觉、连续状态估计和文本输入编码的多模态句子,并与预训练的大语言模型结合进行端到端训练,可用于顺序机器人操作规划、视觉问答和图像字幕等多种具身任务。
PaLM-E 将强大的大语言模型 PaLM 与先进的视觉模型 ViT-22B 相结合,其最大的模型 PaLM-E-562B 包含 5620 亿个参数,除了在机器人任务上进行训练外,还是一个视觉语言通用模型,在 OK-VQA 基准上具有最先进的性能,同时随着规模的增加保持了通用语言能力。
实验表明,PaLM-E 能够处理多种具身推理任务,并且通过在大规模语言、视觉和视觉语言领域的联合训练,展现出了积极的迁移效果。
论文主页链接:
https://palm-e.github.io/
代码地址:
https://github.com/kyegomez/PALM-E
Tactile-Filter:面向机器人操作的交互式触觉感知

聚焦于机器人触觉感知在零件装配任务中的创新应用。人类在灵巧操作任务中,触觉能提供大量接触与物体几何信息,受此启发,论文利用基于视觉的触觉传感器开展研究。
其核心技术在于,先训练深度神经网络,借助触觉图像预测任意匹配形状物体间的概率对应关系。基于此,设计出具备双重功能的粒子滤波器:
一方面,当机器人获取孔的部分观测时,通过采样更多触觉信息,逐步精确对适配销的估计;
另一方面,依据最大似然法,为机器人挑选能最大程度降低当前估计不确定性的下一步动作,以减少感知任务中的交互次数。
经配备该触觉传感器的机器人在多个新型零件装配任务中测试,所提动作选择方法相较于简单方法,展现出更高效率 。
论文链接:
https://arxiv.org/abs/2303.06034v2
Reflexion:基于言语强化学习的语言智能体

该论文聚焦语言智能体的 “无参数更新式优化”,核心突破是用 “语言反思 + 情景记忆” 替代传统 RL 的参数调整 ,解决复杂任务中智能体决策短视、错误复现的问题。
技术上,核心框架分三步:
任务执行与反馈采集:智能体完成文本游戏、网页导航、代码调试等任务后,获取 “成功 / 失败” 信号及错误细节(如代码语法报错、网页操作路径偏差);
自然语言反思生成:基于反馈,通过 Prompt 引导生成结构化反思文本(例:“代码调试失败因未判断变量类型,下次需先加 type () 检查”),反思需包含 “错误原因 - 改进策略” 双要素;
情景记忆存储与检索:反思文本存入带时间戳的记忆缓冲区,后续任务中,智能体通过 “任务目标与记忆关键词匹配”(如调试 Python 代码时检索 “变量类型” 相关反思),调用历史经验优化决策,全程不更新模型权重。
实验在三大场景验证:
文本游戏通关率提升 38%,网页导航任务错误次数减少 42%,代码调试修复效率提升 29%,证明 “语言化经验复用” 能有效增强智能体的长程规划与错误修正能力。
论文链接:
https://arxiv.org/abs/2303.11366
代码地址:
https://github.com/noahshinn024/reflexion
