绝了!预训练VLA永不遗忘秘诀曝光,双系统推理碾压一切,AI革命风暴来袭!

Fast-in-Slow:
一种在慢推理中嵌入快操控的双系统基础模型

Fast-in-Slow (FiS) 提出了一种统一的双系统VLA模型,灵感来源于认知双过程理论:将快速执行模块(System 1,高频操纵)嵌入到基于VLM的慢速推理模块(System 2)中,通过部分参数共享实现。
复用预训练VLM(如7B规模)的最后几层Transformer块作为轻量System 1执行头(异步高频输出动作),而完整VLM保留为System 2进行多模态推理和规划。
这种“Fast-in-Slow”架构避免了传统双系统需额外独立策略头的低效,同时保证推理-执行协调。
这种方案的结果是在仿真提升8%、真实双臂任务提升11%成功率,动作chunk=8时控制频率达117.7 Hz,兼顾泛化与实时性。
论文链接:
https://arxiv.org/abs/2506.01953
项目主页:
https://fast-in-slow.github.io/
ThinkAct:
通过强化视觉潜在规划实现视-言-行推理

ThinkAct (NeurIPS 2025, NVIDIA) 提出了一种双系统VLA框架,通过强化视觉潜在规划桥接高层推理与低层动作执行。
核心技术为训练多模态LLM生成具身推理计划(embodied reasoning plans),使用动作对齐视觉奖励(基于目标完成+轨迹一致性)进行强化学习(GRPO风格),奖励引导长时序规划、自纠错。
推理计划压缩为视觉潜在轨迹(visual plan latent),条件下游动作模型,实现few-shot适应、长时序任务与动态环境鲁棒执行。
实验显示在LIBERO等基准上显著提升few-shot、long-horizon与self-correction能力。
论文链接:
https://arxiv.org/abs/2507.16815
项目主页:
https://jasper0314-huang.github.io/thinkact-vla/
预训练的视觉-语言-动作
模型在持续学习中展现出惊人的抗遗忘性

Pretrained Vision-Language-Action Models are Surprisingly Resistant to Forgetting in Continual Learning 通过大规模实证研究揭示:大型预训练VLA模型在机器人持续学习中对灾难性遗忘表现出惊人抵抗力,与从零训练的小型策略模型形成鲜明对比。
核心技术与发现:
在LIBERO等基准上,预训练VLA(如GR00T、pi0)采用简单经验回放(Experience Replay),仅需2% replay buffer即可实现近零遗忘(甚至出现正向后向迁移),而小型BC模型严重遗忘。
预训练是关键:它从根本上改变持续学习动态,大模型在小回放缓冲下保持先前任务性能,同时对新任务仍有强前向学习能力。
额外洞察:模型规模本身也有帮助(从零训练的大模型也显示低遗忘),但预训练作用更显著;无需复杂正则化(如EWC),简单Sequential + 少量Replay就足够。
这颠覆了传统持续学习假设,为VLA在真实机器人终身学习中的部署提供了强信心。
论文链接:
https://arxiv.org/abs/2603.03818
项目主页:
https://continual-vlas.github.io/forget-me-not
视频讲解:
https://youtu.be/HaalfULkPoY?si=N7U6StCoOLB0wJa-
