技术博客
VLA

让机器人走出实验室的三块拼图:π*₀.₆、X-VLA 与 RTC 的协奏

知行|NoLimits2026-07-09 14:43
让机器人走出实验室的三块拼图:π*₀.₆、X-VLA 与 RTC 的协奏





π*₀.₆: a VLA That 

Learns From Experience (RECAP)


论文链接:

https://arxiv.org/pdf/2511.14759


要理解 π*₀.₆ 的贡献,我们需要先回到一个根本性的困境。过去两年,以 RT-2、OpenVLA、π₀ 为代表的视觉-语言-动作模型在大规模遥操作数据上做模仿学习,取得了惊人的进展。


但部署到真实环境后,大家很快发现一个天花板:成功率往往卡在 70%-80% 左右就很难再提升。原因很直观,模仿学习只能学到"老师演示过的轨迹分布",一旦遇到分布外情况(物体放偏了、光照变了、机械臂自己犯错偏离了演示状态),策略就不知道该怎么办。


π*₀.₆ 提出的 RECAP(Reinforcement learning with Experience and Corrections via Advantage-conditioned Policies) 巧妙地绕开了这个难题。它的核心思路你可以这样理解:与其用 RL 的梯度去"硬掰"策略参数,不如让策略学会"看着分数行事"


具体来说,他们训练了一个值函数,把回报离散化成几个等级,用多分类的方式预测每一步的"优势值"(advantage,即这一步比平均水平好多少)。VLA 在训练和推理时都被这个优势值"条件化"。


这个设计的精妙之处在于,它把强化学习问题重新转化成了一个监督学习问题。模型不需要计算复杂的策略梯度,只需要做"条件化的行为克隆":给定状态、指令、和优势值,预测对应的动作分布。


这样一来,演示数据(优势设为高)、自主试错的成功轨迹(优势可学)、以及人类的纠正干预(优势设为最高)就可以全部塞进同一个训练框架里。机器人于是真的能"从经验中学习",它跑得越多,失败和成功的数据越多,值函数越准,策略也就越好。


在部署层面,π*₀.₆ 在叠衣服、清理厨房、组装纸箱等长周期任务上,相比纯模仿学习的 π₀.₅ 有了显著提升。但比具体数字更重要的是,这是第一个被公开报告的"部署后还能继续进步"的通用 VLA,这个范式很可能定义未来两三年的研究方向。




X-VLA: Soft-Prompted 

Transformer as Scalable Cross-Embodiment 

Vision-Language-Action Model


论文链接:

https://arxiv.org/pdf/2510.10274

代码地址:

https://github.com/2toinf/X-VLA


X-VLA 提出的"软提示(soft prompt)"思路非常优雅。它的核心想法是:把每种机器人形态本身当作一个可学习的"前缀"。具体做法是,为每个 embodiment 学习一组小的嵌入向量(类似 NLP 中的 prompt tuning),这组向量被预先拼接到 Transformer 输入序列的最前面。


然后整个模型,视觉编码器、语言编码器、流匹配动作专家,都是统一的、所有形态共享的。


为什么这个设计这么有效?可以这样直观理解:Transformer 通过自注意力机制,会让后续的所有 token(视觉、语言、动作)都"看到"前面的形态嵌入。这相当于告诉模型"现在你是在驱动 Aloha 双臂,你输出的动作会被解释成 14 维的关节速度",形态信息以一种软性、可微、可学习的方式注入了整个计算过程。新增一个机器人形态?只需要新加一组小小的嵌入向量,模型主体完全不动。


X-VLA 的另一个亮点是它的单调扩展性:论文实验表明,训练用到的形态越多,在每个单独形态上的表现反而越好。这意味着不同机器人之间存在正迁移,模型从 Aloha 学到的东西能帮助它更好地驱动 Franka。


这种性质在以前的架构里是不稳定的,而软提示通过参数共享最大化、形态特定参数最小化,把这个性质变得清晰可靠。


实证方面,X-VLA 用大约 9 亿参数(相对 π₀ 的 30 亿来说算精简)就在六个仿真器和三个真实平台上达到了 SOTA,并且赢得了 IROS 2025 的 AgiBot World Challenge 冠军,被 ICLR 2026 接收。




Real-Time Execution of Action Chunking 

Flow Policies (RTC) and follow-up Legato


论文链接:

https://arxiv.org/abs/2506.07339


RTC 解决的问题非常具体却又非常关键:推理延迟与流畅控制的矛盾


RTC 的精妙之处在于,它是一个纯推理时的算法,不需要重新训练任何模型,可以套在任何已经训练好的扩散或流匹配 VLA 上。核心思路你可以类比图像修复(image inpainting):


想象当前 chunk 已经在执行,机器人已经迈出了前 d 步,这 d 步实际发生的动作是"既成事实"。剩下的 H-d 步还在执行队列里。这时候你要预测下一个 chunk(还是 H 步)。


RTC 的做法是:把这下一个 chunk 中"会与当前正在执行的部分重叠"的那些动作位置,固定成已知的、即将执行的真值,然后让流匹配模型只去"修补/绘制"剩下的那些自由位置。就像在一幅画上挖几个洞,让模型只填补这几个洞,周围的内容必须保持一致。


这样一来,新生成的 chunk 在边界处天然就和前一个 chunk 对齐了,因为重叠的部分被强制设成了相同的值,流匹配的连续性保证了非重叠部分也会平滑过渡。整个过程不改变模型参数,推理成本也几乎不变。


为什么这个看似简单的技巧如此重要?因为它第一次让大型 VLA 真正具备了执行动态任务的可能。论文里他们用 RTC 让 π₀ 完成了划火柴、抓动态物体等以前完全做不到的任务。


后续工作 Legato 进一步把这个思想"训练时原生化",在训练阶段就让模型学习如何续接之前的 chunk,从而把推理延迟容忍度推到更高。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发