不需要人类指令也能自学驾驶?这三篇最新顶刊论文正让科幻片变成纪录片

数字孪生监督的水下自主导航强化学习框架

本研究提出了一种基于数字孪生监督的水下自主导航强化学习框架。
该框架以BlueROV2为实验平台,采用近端策略优化算法,通过融合目标方位、虚拟占用网格和射线投射构建多源观测空间,实现对复杂水下环境的感知。
创新性地引入真实测试场景的3D数字孪生模型进行虚实协同监督,显著降低了实机实验风险,并成功实现了从仿真到现实的策略迁移。
实验结果表明,在障碍物密集的水下环境中,该强化学习策略在路径适应性和避障性能上均优于传统动态窗口法,为无GPS、低能见度条件下的水下机器人导航提供了可靠解决方案。
论文链接:
https://arxiv.org/abs/2512.10925
在3D辐射场中通过域适应学习
实现基于单目RGB的杂乱环境飞行

这篇论文聚焦机器人导航领域的核心挑战 —— 飞行机器人能否仅依靠单目 RGB 图像在杂乱环境中安全导航。
针对现代自主导航系统依赖昂贵深度感知硬件、传统仿真学习存在 “感知鸿沟” 的痛点,提出了融合 3D Gaussian Splatting(3DGS)仿真与对抗性域适应的创新耦合框架。
前者构建具备照片级真实感的 3D 辐射场仿真环境以精确模拟现实视觉特征,后者通过对抗学习显式最小化特征差异,使导航策略捕捉领域不变线索。
实验证实该框架训练的策略具备稳健的零样本迁移能力,无需物理世界额外微调,即可支持机器人在光照多变、非结构化的复杂环境中实现安全且敏捷的飞行,为多模态感知与场景理解、学习迁移与自主适应领域提供了典型实践方案。
论文链接:
https://arxiv.org/abs/2512.17349
InDRiVE:基于潜在分歧的无奖励世界
模型预训练框架及其在自动驾驶中的应用

InDRiVE 是一项针对自动驾驶任务的无奖励世界模型预训练框架,旨在解决传统基于模型的强化学习中奖励函数设计困难与分布偏移鲁棒性不足的问题。
该框架基于 DreamerV3 智能体架构,通过在 CARLA 仿真环境中利用潜在集成差异(latent ensemble disagreement)作为内在探索信号,驱动智能体主动探索未充分覆盖的驾驶场景。
其核心包含一个基于想象的参与者-评论家模型,能够直接从学习到的世界模型中提取无需显式规划的探索策略。
实验表明,该预训练策略在参数冻结情况下,可实现跨未知城镇与路线的零样本鲁棒迁移,并在仅需极少外部反馈的条件下快速适应下游任务(如车道保持与避障)。
该研究证实,基于内在不确定性的预训练是构建可迁移、可复用驾驶世界模型的有效途径,在相同交互预算下表现优于传统方法,凸显了无奖励预训练在自主导航领域的重要价值。
论文链接:
https://arxiv.org/abs/2512.18850
