智能体的进化之路:三篇必读综述,解锁具身AI核心密码

本周分享知识库中的3篇具身智能survey。这三篇综述互补性强:第一篇打基础,第二篇看前沿,第三篇钻核心。
如果你对具身智能(Embodied AI)感兴趣,想快速了解这个领域的最新进展,推荐阅读。
Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI

这篇综述梳理了具身智能在连接虚拟与现实世界中的最新进展,重点围绕MLMs与WMs如何赋能具身感知、交互、智能体构建与sim-to-real迁移四大核心任务展开。
文章首次从“虚实对齐”视角提出统一框架,整合机器人、仿真平台、数据集与方法体系,指出当前在长时任务规划、因果推理、数据稀缺与安全隐私等方面的关键挑战,并展望了未来构建通用具身智能体的发展方向。
论文链接:
[2407.06886] Aligning Cyber Space with Physical World: A Comprehensive Survey on Embodied AI
Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning

这篇综述梳理了大模型赋能的具身AI在自主决策与具身学习方面的最新进展,梳理了分层与端到端两种决策范式,分析了大模型如何增强高层规划、低层执行与反馈机制,并重点介绍了VLA模型在端到端决策中的应用与优化。
同时,文章深入探讨了大模型如何提升模仿学习与强化学习的效果,并首次将世界模型引入具身AI综述,阐述其在决策与学习中的关键作用。
最后,作者指出当前面临的数据稀缺、持续学习、计算效率及仿真到现实迁移等挑战,并展望了未来研究方向。
论文链接:
[2508.10399] Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning
A Comprehensive Survey on World Models for Embodied AI

这篇综述梳理了面向具身智能的世界模型研究,提出从功能耦合性、时间建模与空间表示三轴分类框架,将现有方法划分为决策耦合与通用型、自回归与全局预测、潜向量/Token/网格/显式渲染等表示形式;
总结机器人、自动驾驶等场景下的数据资源与评价指标,指出当前缺乏统一跨域数据集、忽视物理一致性评估,以及长时序误差累积与实时性难兼顾等关键挑战;
展望构建统一多模态数据、优化高效架构、融合自回归与全局预测等方向,以推动世界模型在感知–预测–决策一体化中的基础作用。
论文链接:
[2510.16732] A Comprehensive Survey on World Models for Embodied AI

