技术博客
VLA

同济大学空间智能团队最新力作 SC-VLA:用"稀疏世界想象"让 VLA 自我纠错,任务步数减 16%、成功率提 9%

知行|NoLimits2026-07-09 14:43
同济大学空间智能团队最新力作 SC-VLA:用"稀疏世界想象"让 VLA 自我纠错,任务步数减 16%、成功率提 9%

论文原标题:

Self-Correcting VLA: Online Action Refinement via Sparse World Imagination

论文链接:

https://arxiv.org/abs/2602.21633

代码地址:

https://github.com/TJ-Spatial-Intelligence-Lab/SC-VLA




主要作者:

Chenyv Liu*, Wentao Tan*, Lei Zhu, Fengling Li, Jingjing Li, Guoli Yang

发表机构:

同济大学, 悉尼科技大学, 电子科技大学, 北京大数据先进技术研究院


SC-VLA结合了世界模型 (world model) 思想与强化学习策略优化,使机器人能够在执行过程中逐步调整行为,而不再完全依赖离线数据。


SC-VLA 的整体结构可以分为两个阶段: Sparse World Imagination (稀疏世界想象) 与 Online Action Refinement (在线动作修正)。



前者负责预测未来世界状态,后者基于这些预测对动作策略进行在线修正。










方案实现









整体流程

SC-VLA 基于 Flow Matching 框架构建,并在此基础上加入“稀疏世界想象”和“在线动作修正”两阶段设计。输入端首先融合多视角图像、语言指令和机器人本体状态,编码获得多模态条件表示。


随后,模型在 DiT 主干中不仅生成基础动作,还通过额外的 query 与中间层特征预测当前任务进度 (progress) 和未来短期状态变化 (Δstate),形成稀疏的未来世界信号。在第二阶段,系统再引入基于 SAC 的残差动作优化模块,根据“预测未来”


和“真实执行结果”的一致性构造内生奖励,对基础动作进行在线微调,最终得到更稳健、更高效的机器人控制策略。



主要创新

  • 提出 Sparse World Imagination 机制,在动作生成过程中同时预测 progress 和 Δstate,使策略能够显式建模短期物理演化。


  • 利用 DiT 中间层特征而非最终输出层预测未来信号,将世界状态信息直接嵌入动作主干内部表示。


  • 设计 Online Action Refinement 模块,通过“基础动作 + 残差修正”的方式实现在线策略优化。


  • 构造基于“预测未来与真实执行的一致性”的内生稠密奖励,减少对人工奖励设计和外部奖励模型的依赖。










实验对比









  1. ManiSkill仿真环境



  1. ARX5真机环境











总结展望









SC-VLA 将“未来预测”与“在线修正”结合,引入内在反馈机制,使机器人能够在执行过程中持续优化策略,展现出从“模仿执行”迈向“自主适应”的潜力。


未来,该方向有望进一步扩展到更长时序规划、更复杂交互场景以及多任务泛化中,同时在模型效率与训练成本方面仍有进一步优化空间。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发