技术博客
VLA理解与问答论文解读

AAAI 2026 最佳论文-ReconVLA详解(一) --《ReconVLA 论文精读:如何用视觉重建让机器人看准目标?》

coffee co.2026-08-03 16:41
AAAI 2026 最佳论文-ReconVLA详解(一)
--《ReconVLA 论文精读:如何用视觉重建让机器人看准目标?》

ReconVLA 论文精读:机器人要做对,得先看对

从“注意力跑偏”到“重建目标区域”,拆解 AAAI 2026 Outstanding Paper ReconVLA

假设你对机器人说:“把西瓜放进黄色碗里。”

听懂这句话,只是第一关。机器人还得从桌上一堆东西里找到西瓜,算准机械臂该往哪里伸;抓起来以后,它的目光还要从西瓜转向黄色碗,最后对准碗口,把西瓜稳稳放进去。

整个过程很像一场接力赛:语言理解、目标定位、动作控制,任何一棒掉链子,西瓜就可能被抓空、撞翻,或者落在碗边。

这正是 Vision-Language-Action(VLA)模型想解决的问题。它把“看图”“听指令”和“做动作”塞进同一个模型里,看起来已经相当全能。但 ReconVLA 的作者追问了一句:

一个机器人能输出动作,真的代表它看准目标了吗?

答案未必。

作者发现,传统 VLA 的注意力常常像“撒胡椒面”一样铺在整张图上:背景分到一点,机械臂分到一点,无关物体也分到一点,真正该操作的目标反而没被牢牢盯住。简单场景里,模型还能靠数据规律“蒙对”;一旦桌面变乱、物体长得相似,或者任务需要连续完成多个步骤,这种视觉走神就很容易变成动作失败。

ReconVLA 的办法很有意思:既然模型嘴上说自己看懂了,那就让它来一场“闭卷默写”——只根据内部视觉表示,重建当前最该关注的目标区域。重建不出来,说明它其实没看清;为了把这场随堂测验做对,模型就不得不记住目标的位置、外形和细节。

这篇论文的核心可以浓缩成一句话:

ReconVLA 不是为了生成一张好看的图片,而是借“重建目标区域”这项训练任务,逼 VLA 学会真正看清任务相关的目标。


一、VLA 会“做”,为什么还会“看错”?

1. VLA 到底是什么?

VLA 是 Vision-Language-Action 的缩写。它接收相机图像和语言指令,最后输出机器人可以执行的动作。论文把这条流程写成:

A = Q(LLM(E(I), T(S)))

不用被公式吓到,它表达的其实是一条很直观的流水线:

  • I 是机器人看到的图像;
  • S 是人给出的语言指令;
  • E 是视觉编码器,负责把图像编码成 image tokens;
  • T 是文本编码器,负责把指令编码成 text tokens;
  • LLM 融合视觉和语言,生成 action tokens;
  • Q 是动作反编码器,负责把 token 还原为机械臂能执行的连续动作 A。

也就是:看见场景 → 听懂任务 → 生成动作。

机械臂的位姿、关节角度和夹爪开合本来是连续数值。为了让语言模型处理它们,VLA 会先将动作量化成离散 token,再像生成一句话那样,一个接一个地预测动作 token。

区别在于,文字生成错一个词,句子可能只是有点别扭;动作 token 偏一点,机械臂却可能直接抓空。

2. 动作正确,不等于看得正确

传统 VLA 主要用示范动作训练:模型输出越接近专家动作,损失就越小。问题是,这种损失只负责检查“最后做了什么”,并不会追问“你刚才到底在看哪里”。

比如训练数据中的杯子总放在桌面右侧,机械臂也总从相似姿态出发。模型可能没有真正识别杯子的边缘和形状,只是记住了“往右伸手”这条捷径,照样能在训练场景里拿到不错的分数。

可一旦杯子换了位置、桌面换了颜色,或者旁边多放几个相似物体,这条捷径就失灵了。

所以,下面两件事并不能画等号:

  • 模型在训练数据上给出了正确动作;
  • 模型形成了稳定、准确、与任务相关的视觉表征。

ReconVLA 瞄准的,正是两者之间这道缝。

3. 什么是 gaze region?

Visual Grounding 的核心,是把语言里提到的对象和图像中的具体区域对应起来。ReconVLA 把当前最该关注的任务区域称为 gaze region,也就是“凝视区域”。

这里的 gaze 不是真实眼动数据,也不是给机器人装了一双会转动的眼睛,而是一种类人的比喻。

更重要的是,gaze region 不是永远不变的。在“把蓝色积木叠到粉色积木上”这个任务里:

  • 抓取阶段,重点是蓝色积木;
  • 放置阶段,重点会转向粉色积木的顶部。

人做事时,目光会跟着当前步骤自然切换;ReconVLA 想让模型学会的,正是这种“该看谁时就看谁”的能力。


二、让机器人看目标,有三条路

论文没有一上来就宣布“我们的方案最好”,而是把视觉 grounding 整理为三种范式:显式输入、思维链输出和隐式监督。三种方法建立在同一 baseline 上,方便公平比较。

1. Explicit Grounding:直接递上一张重点放大图

最直观的做法,是先用 YOLOv11 找到目标,把目标裁剪出来,再将“原图+目标裁剪图”一起交给 VLA。

这像考试时,老师不仅发了整张地图,还贴心地圈出重点并附上一张局部放大图。模型当然更容易找到目标,实验中平均连续完成长度也从 baseline 的 3.36 提升到 3.61。

但代价也很明显:推理链上始终挂着一个外部检测器,原图和裁剪图还会产生重复信息。更关键的是,它把重点“喂”给了模型,却不一定让 VLA 自己长出更好的视觉表征。检测器一旦认错,后面的动作模型也容易跟着跑偏。

2. Chain-of-Thought Grounding:先报坐标,再动手

第二条路是让模型先生成目标边界框,再生成动作:

Bbox[x1, x2, y1, y2] + Action Sequence

它很像机器人先说一句“目标在这里”,再开始操作。这个思路看起来更透明,但在论文的 CALVIN 实现中表现很差:平均完成长度只有 0.63,连续完成四步和五步任务的成功率都降到了 0。

原因可能在于,几个坐标 token 很难装下物体的形状、纹理和边缘等细节;同时让一个自回归模型精确生成坐标和动作,也增加了优化难度。前面的坐标一旦报错,后续动作还可能被一路带偏。

需要注意的是,这组结果只能说明论文中的这套 CoT Grounding 实现不理想,不能扩大成“所有具身思维链都无效”。

3. Implicit Grounding:不多说,也不多看,但心里得有数

ReconVLA 选择了第三条路:

  • 输入仍然是原始多视角图像和语言指令;
  • 输出仍然是机器人动作;
  • 训练时额外检查内部表示能否重建 gaze region。

它不把目标裁剪图塞进在线输入,也不要求模型在动作前大声报出边界框,而是直接训练模型内部的视觉表示。

三种方法的差别可以概括为:

范式 输入端 输出端 真正被训练的重点 在线推理依赖
Explicit Grounding 增加目标裁剪图 仍输出动作 动作预测 外部检测器与裁剪图
CoT Grounding 输入原图 先 bbox,后动作 坐标与动作序列 自回归坐标链
Implicit Grounding 输入原图 仍输出动作 动作+内部视觉表征 VLA 本身

ReconVLA 最巧妙的地方,不只是用了 diffusion,而是把监督从“给模型多看什么”和“让模型多说什么”,移到了“模型心里究竟记住了什么”。


三、ReconVLA 怎么工作:一条动作主线,一场重建小测

ReconVLA 的架构可以看成两条并行轨道:一条负责生成动作,一条负责重建目标。两条轨道共享同一个 VLA 主干。

1. 动作轨道:该怎么动?

模型采用 LLaVA-7B 式多模态架构,语言主干为 Qwen2-7B,视觉编码器为 SigLIP。多视角图像被编码为 image tokens,指令被编码为 text tokens,模型融合二者后自回归生成 action tokens,最后再还原为连续控制动作。

这条轨道与常规 VLA 类似,回答的是:机器人下一步该怎么动?

2. 重建轨道:你真的看清了吗?

重建支路则像一位不太好糊弄的监考老师。

它先用连续 VAE 把 gaze region 图像 I' 压缩到潜空间,得到 z_0;再随机加噪得到 z_t。一个轻量 Diffusion Transformer 接收 z_t、时间步 t,以及 VLA 输出的 reconstructive tokens h_R,尝试预测刚才加进去的噪声。

视觉损失写成:

L_visual_VLA = E_(t, epsilon)[||D(z_t; h_R, t) - epsilon||_2^2]

公式看起来复杂,逻辑却很朴素:

  • epsilon 是真实加入的噪声;
  • D(z_t; h_R, t) 是去噪器猜出的噪声;
  • 猜得越准,说明 h_R 提供的目标信息越充分。

如果 VLA 的内部表示只记住了桌面颜色,却没记住碗口在哪里,去噪器自然很难恢复碗的区域;重建误差就会反向推动主干网络,把目标的位置、轮廓和视觉细节重新学扎实。

因此,这里的扩散模型不是为了在部署时慢慢画一张高清图,而是一个训练用的“测谎仪”:模型说自己看懂了没用,能支持目标区域重建才算过关。

3. 两项作业一起交

ReconVLA 的总损失由动作损失和视觉重建损失直接相加:

L_ReconVLA = L_action_VLA + L_visual_VLA

动作损失管“做得对不对”,重建损失管“看得清不清”。论文公式没有额外写权重系数,公开代码中训练态也直接执行 loss = loss + vm_loss

这意味着模型不能只会动,也不能只会看:两份作业得一起交。

4. 为什么指令 token 要放在图像 token 前?

同一张桌面上可能同时放着西瓜、苹果、黄色碗和绿色碗。光看图像,模型并不知道当前该盯谁;“目标”必须由图像和指令共同决定。

ReconVLA 把 instruction tokens 放在 image tokens 前面。借助 causal attention,后面的图像 token 可以读取前面的任务信息。于是,同一幅画面在“拿西瓜”和“拿苹果”两条指令下,会形成不同的任务相关表示。

这个看似不起眼的 token 顺序,其实解决了一个关键问题:重建支路凭什么知道该重建谁?

5. 推理时还要重建图片吗?

从公开代码路径看,不需要。

重建损失只在训练状态下计算;生成动作时,模型直接走语言模型的 generate() 路径,不需要提供目标图,也不会运行扩散去噪来画出 gaze region。

所以 ReconVLA 可以简单理解为:

  • 训练时:一边学动作,一边接受目标区域重建训练;
  • 推理时:带着已经练出来的视觉能力,直接输出动作。

外部 grounding 模型和重建分支没有被塞进在线控制链,这正是“隐式”二字的含义之一。


四、10 万条轨迹、200 万样本:gaze region 从哪里来?

VLA 原本更擅长“看图说话”和“看图行动”,并不天然擅长从内部 token 恢复局部图像。只靠少量下游数据临时学习重建,很容易变成死记几个物体和背景。

为此,作者整合了 BridgeData V2、LIBERO 和 CALVIN 三类开源机器人数据,并使用微调后的 Grounding DINO,根据语言指令自动找到交互区域,构造“原始图像—gaze region”配对。

最终,预训练数据规模超过 10 万条轨迹、200 万个样本。模型先在大规模混合数据上学习“不同场景中该看哪里”,再针对具体机器人任务微调。

这里有一个容易误解的细节:ReconVLA 并不是彻底摆脱了 Grounding DINO,而是改变了它出现的位置。

  • 显式 grounding:检测器需要在机器人在线操作时持续工作;
  • ReconVLA:Grounding DINO 主要在训练前离线生成 gaze region,部署时不再成为必经环节。

这像老师在备课时提前圈好重点,但考试时学生不能再带着答案上场。最终能不能完成任务,仍取决于 VLA 自己有没有把重点学会。


五、实验结果:它真的从“到处看”变成“盯准看”了吗?

ReconVLA 的实验形成了一条比较完整的证据链:先比较三种 grounding 范式,再看注意力、精细操作、消融、长时序榜单和真机表现。

1. 三种 grounding 正面对决

CALVIN 包含 34 个任务和 A、B、C、D 四种环境。ABC→D 表示在 A、B、C 环境训练,到从未见过的 D 环境测试,重点考察背景泛化。评测要求机器人连续完成五个子任务,共统计 500 次 rollout。

方法 1/5 2/5 3/5 4/5 5/5 平均完成长度
Baseline 88.8 76.1 63.7 57.0 49.0 3.36
Explicit Grounding 94.4 82.5 70.9 62.2 50.2 3.61
CoT Grounding 47.0 14.3 1.6 0.0 0.0 0.63
Implicit Grounding 95.6 87.6 76.9 69.3 64.1 3.95

显式 grounding 在任务前几步确实有帮助,但到了第五步,只比 baseline 高 1.2 个百分点。ReconVLA 则把 5/5 成功率从 49.0% 提升到 64.1%,而且任务链越长,优势越明显。

换句话说,别人递来的“重点放大图”能帮一阵子,真正把目标表征学进模型内部,走得更远。

2. 最难的叠积木,提升最显眼

Stack Block 不只是把物体抓起来,还要把一块积木准确叠到另一块上。模型既要找准被抓取物,又要看清承接位置,任何几毫米的偏差都可能让积木倒下。

  • Baseline:59.3%;
  • ReconVLA:79.5%;
  • 绝对提升:20.2 个百分点。

这个结果尤其有说服力,因为最大增益恰好出现在最依赖精确定位的任务上。论文说自己改善了目标视觉表征,而最需要“看准”的任务也确实涨得最多,方法主张与实验结果对上了。

3. 不是“重建什么都行”,重点在 gaze region

消融实验把不同组件逐个加回模型:

重建分支 重建 gaze region 大规模预训练 5/5 成功率 平均完成长度
49.0 3.36
46.5 3.42
58.2 3.85
64.1 3.95

只重建整张图时,平均长度从 3.36 微升到 3.42,但 5/5 成功率反而从 49.0% 降到 46.5%,收益并不稳定。

把目标改成 gaze region 后,平均长度跃升到 3.85,5/5 成功率达到 58.2%;再加入大规模预训练,最终来到 3.95 和 64.1%。

这组消融揭开了论文真正的机关:关键不是随便给 VLA 装一个“画图模块”,而是让它只重建与当前任务最相关的区域。整张图里,桌面纹理、墙面颜色和无关杂物都会抢占学习能力;gaze region 则像一束聚光灯,把监督集中在真正影响动作的地方。

4. 与主流方法相比,强项在未见背景泛化

在 ABC→D 设置中,ReconVLA 的结果如下:

方法 类型 5/5 成功率 平均完成长度
GR-1 未来图像生成 40.1 3.06
Vidman 生成式方法 46.7 3.42
OpenVLA 大型 VLA 43.5 3.27
UniVLA 大型 VLA 56.5 3.80
ReconVLA 目标区域重建 64.1 3.95

与 OpenVLA 相比,ReconVLA 的 5/5 成功率高 20.6 个百分点;与 UniVLA 相比高 7.6 个百分点。

有趣的是,GR-1 等生成式方法关注“接下来会发生什么”,用未来图像辅助规划;ReconVLA 则先解决“眼前究竟该看什么”。一个向未来想,一个把当下看清。实验说明,对机器人来说,先别急着畅想下一幕,把面前的目标看准同样重要。

在相对熟悉的 ABCD→D 设置中,ReconVLA 的平均完成长度为 4.23,略高于 GR-1 的 4.21;但它的 5/5 成功率为 70.5%,低于 GR-1 的 73.1%。因此更准确的说法是:ReconVLA 在这一设置中具有竞争力,但不是所有指标都第一;它最突出的优势仍在未见背景的 ABC→D 泛化测试中。

5. 从模拟器走到真机

作者还在 6 自由度 AgileX PiPer 机械臂上测试了四类任务:

  • 叠碗;
  • 把水果放进碗里;
  • 翻杯子;
  • 收拾桌面。

每项任务平均采集约 150 条训练轨迹,每个模型、每项任务测试 20 次。ReconVLA 在四项任务中均优于 OpenVLA 和 PD-VLA,在放水果和叠碗任务上的成功率接近或超过 90%。当目标换成训练中没有见过的新物体时,对比方法几乎无法完成任务,ReconVLA 仍保留了明显的操作能力。

注意力可视化也给出了很直观的画面:baseline 的高亮区域常散落在背景和无关物体上,ReconVLA 则更集中在西瓜、碗口或积木等当前目标附近。它不是唯一的因果证明,却与长时序、精细操作、消融和真机结果彼此呼应——注意力不再“撒胡椒面”,而是更像把准星压在目标上。


六、ReconVLA 真正聪明的地方是什么?

如果只把它总结为“VLA 后面加了一个 Diffusion Transformer”,就低估了这篇论文。它真正漂亮的地方有四点。

1. 它先发现“模型看错了什么”,再决定加什么

论文不是从“我还能堆一个什么模块”出发,而是先观察到注意力分散,再把它上升为视觉 grounding 不充分的问题,最后才设计重建监督。问题、方法和实验围绕同一条主线展开,没有各唱各的戏。

2. 它把“是否看懂”变成了一件可以检查的事

过去只能看到输入图像、语言指令和最终动作,中间的目标表征像个黑箱。ReconVLA 用区域重建给这个中间变量安排了一场考试:如果内部表示连目标区域都无法支持恢复,就很难说它真的理解了目标。

3. 它只重建当前该看的地方

重建整幅画面容易被背景牵着走;重建未来图像更偏向动力学预测。ReconVLA 把生成能力用在当下的任务相关区域,相当于主动建立了一个信息筛子:与动作无关的内容可以少记,目标的位置和细节必须记牢。

4. 训练时加压力,部署时不添堵

显式 grounding 会增加在线输入,CoT grounding 会增加在线输出,ReconVLA 则主要在训练期增加辅助监督。推理时仍保持“图像+指令进,动作出”的原接口。

这让它不像给机器人永久绑上一副外置望远镜,更像训练阶段做过大量视力和专注力练习:真正上场时,不必把训练器材一起背着跑。


七、它还没有回答什么?

ReconVLA 解决的是一个清楚而重要的问题,但它并没有包办视觉 grounding 的全部未来。论文留下的疑问主要集中在三点。

第一,gaze region 由 Grounding DINO 自动生成,标错、漏检或框入过多背景时,监督噪声会怎样影响动作学习,论文还没有单独量化。

第二,当前方法主要依赖二维目标区域。面对插拔、精密装配或严重遮挡,机器人还需要深度、表面法向和 6D 位姿等三维信息,二维 crop 能走多远仍需更多实验。

第三,真机实验每个模型、每项任务测试 20 次,已经能展示趋势,但跨机器人本体、动态场景和更大规模复现仍有待验证。

这些问题不会推翻论文的价值。好论文并不需要一次解决整个领域,而是要把一个长期模糊的痛点说清楚,再给出一套可信、可验证的解法。ReconVLA 做到了这一点。


八、结语:先看对,才能做对

从工程上看,ReconVLA 是在 VLA 训练中加入目标区域的潜空间扩散重建;从方法上看,它用重建监督塑造任务相关的视觉表征;从更高一层看,它提出了一种 Implicit Grounding 范式——不增加在线目标输入,也不要求模型显式输出边界框,而是让 grounding 变成模型内部的能力。

它最值得记住的,并不是某个 VAE、某个 diffusion head,甚至也不只是 64.1% 这个数字,而是一种研究思路:

当最终动作损失只能告诉模型“做错了”,却无法告诉它“看错了”,就为中间感知表征设计一场与任务相关的考试。

ReconVLA 用“重建目标区域”出了这道考题。为了答对,机器人必须知道目标是谁、在哪里、长什么样;等真正执行动作时,它不必展示答案,只需要把已经练出来的视觉能力用在刀刃上。

说到底,机器人操作并没有什么神秘捷径:手要稳,脑要懂,而在这一切之前——眼睛得先看对。


如果你对 ReconVLA 愆趣,想进一步了解其模型设计、实验结果或复现细节,可以查看以下资料:

本文仅用于学术交流与技术分享,相关内容及图片版权归论文作者与研究团队所有。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发