技术博客
VLA

​前沿速递​!4篇VLA领域前沿研究分享

知行|NoLimits2026-07-09 14:44
​前沿速递​!4篇VLA领域前沿研究分享

本文为大家整理了VLA方向的4篇前沿论文。







OpenVLA:开源视觉-语言-动作模型




OpenVLA 是一个拥有 70 亿参数的开源视觉-语言-动作(Vision-Language-Action, VLA)模型,专门为通用机器人操作任务设计。


核心构成: 它基于 Llama 2 语言模型,并结合了一个融合了 DINOv2 和 SigLIP 预训练特征的视觉编码器。


训练数据: 模型在一个包含来自 Open X-Embodiment 数据集的 97 万条真实世界机器人操作轨迹的大型多样化集合上进行训练。


主要成就: OpenVLA 在通用机械臂操作任务上取得了强大的泛化能力,其性能超越了参数更多的闭源模型(例如,在某些任务上比 RT-2-X (55B) 模型的任务成功率高出 16.5%)。


开源贡献: 作者们开源了模型权重、训练代码、以及用于部署和高效微调的 PyTorch 代码库,极大地推动了通用机器人策略的研究。



论文链接:

https://arxiv.org/abs/2406.09246

项目主页:

https://openvla.github.io/

代码链接:

https://github.com/openvla/openvla

英文解析视频:

PR-478: OpenVLA: An Open-Source Vision-Language-Action Model





RICL:为预训练的视觉-语言-动作

模型添加情境适应性




针对通用视觉-语言-动作模型(如π₀)虽经大规模预训练具备泛化能力,却缺乏如大语言模型般通过少量示例即时学习新任务的情境学习能力这一核心瓶颈,研究者提出了RICL方法。


该方法通过一种特殊微调策略,使模型学会将少量任务演示作为上下文输入,并基于此预测动作,从而为VLA模型成功“注入”情境学习能力。


在实际部署中,用户仅需提供约20个新任务演示,RICL系统即可从中检索相关片段作为情境,使模型无需更新任何参数便能实现对新任务的即时适应与性能提升。


RICL首次实现了VLA模型的情境学习,显著增强了其语言接地与适应能力,为机器人提供了一种快速、灵活且无需微调的实用化学习途径。



论文链接:

https://arxiv.org/abs/2508.02062

项目主页:

https://ricl-vla.github.io/

代码链接:

https://github.com/ricl-vla/ricl_openpi





SafeVLA: 基于约束学习的视觉-语言-动作

模型安全对齐



 

《SafeVLA》旨在解决视觉-语言-动作模型在实际部署中面临的安全风险,提出集成安全方法(ISA),将安全约束明确嵌入策略学习过程。


该框架基于约束马尔可夫决策过程,通过系统定义安全规则、主动诱发并收集不安全行为作为负样本,并利用约束强化学习对VLA策略进行大规模安全优化。


实验表明,SafeVLA在模拟环境中实现了安全性与任务性能的有效平衡,且所学约束能泛化至未知场景,显著降低长尾风险。


研究同时发布了包含数百万安全约束场景的Safety-CHORES基准,以推动安全VLA的进一步发展。



论文链接:

https://arxiv.org/abs/2503.03480





通过下一个 Token 预测进行上下文内

模仿学习




该研究立足于机器人学与大模型的交叉领域,核心目标是为机器人赋予无需微调的高效泛化能力。


其技术路径是将机器人的多模态交互历史(视觉状态、语言指令、动作序列)统一离散化为Token序列,从而将机器人控制问题转化为下一个动作Token预测任务。


基于Transformer架构的模型通过在大规模数据上学习,可继承其强大的上下文建模与涌现能力。


为实现无需参数更新的快速适应,论文进一步提出上下文内模仿学习方法:

将新任务的少量演示作为提示上下文输入预训练模型,模型据此动态调节动作输出,即时掌握未见过的任务,展现出卓越的少样本学习与场景泛化能力。


简言之,该项工作通过将控制问题序列化,为视觉-语言-动作策略解锁了即时的上下文学习能力。



论文链接:

https://arxiv.org/abs/2408.15980

项目主页:

https://icrt.dev/

代码链接:

https://github.com/Max-Fu/icrt

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发