AAAI 2026 最佳论文-ReconVLA详解(一) --《ReconVLA 论文精读:如何用视觉重建让机器人看准目标?》

ReconVLA 论文精读:机器人要做对,得先看对
从“注意力跑偏”到“重建目标区域”,拆解 AAAI 2026 Outstanding Paper ReconVLA
假设你对机器人说:“把西瓜放进黄色碗里。”
听懂这句话,只是第一关。机器人还得从桌上一堆东西里找到西瓜,算准机械臂该往哪里伸;抓起来以后,它的目光还要从西瓜转向黄色碗,最后对准碗口,把西瓜稳稳放进去。
整个过程很像一场接力赛:语言理解、目标定位、动作控制,任何一棒掉链子,西瓜就可能被抓空、撞翻,或者落在碗边。
这正是 Vision-Language-Action(VLA)模型想解决的问题。它把“看图”“听指令”和“做动作”塞进同一个模型里,看起来已经相当全能。但 ReconVLA 的作者追问了一句:
一个机器人能输出动作,真的代表它看准目标了吗?
答案未必。
作者发现,传统 VLA 的注意力常常像“撒胡椒面”一样铺在整张图上:背景分到一点,机械臂分到一点,无关物体也分到一点,真正该操作的目标反而没被牢牢盯住。简单场景里,模型还能靠数据规律“蒙对”;一旦桌面变乱、物体长得相似,或者任务需要连续完成多个步骤,这种视觉走神就很容易变成动作失败。
ReconVLA 的办法很有意思:既然模型嘴上说自己看懂了,那就让它来一场“闭卷默写”——只根据内部视觉表示,重建当前最该关注的目标区域。重建不出来,说明它其实没看清;为了把这场随堂测验做对,模型就不得不记住目标的位置、外形和细节。
这篇论文的核心可以浓缩成一句话:
ReconVLA 不是为了生成一张好看的图片,而是借“重建目标区域”这项训练任务,逼 VLA 学会真正看清任务相关的目标。
一、VLA 会“做”,为什么还会“看错”?
1. VLA 到底是什么?
VLA 是 Vision-Language-Action 的缩写。它接收相机图像和语言指令,最后输出机器人可以执行的动作。论文把这条流程写成:
A = Q(LLM(E(I), T(S)))
不用被公式吓到,它表达的其实是一条很直观的流水线:
- I 是机器人看到的图像;
- S 是人给出的语言指令;
- E 是视觉编码器,负责把图像编码成 image tokens;
- T 是文本编码器,负责把指令编码成 text tokens;
- LLM 融合视觉和语言,生成 action tokens;
- Q 是动作反编码器,负责把 token 还原为机械臂能执行的连续动作 A。
也就是:看见场景 → 听懂任务 → 生成动作。
机械臂的位姿、关节角度和夹爪开合本来是连续数值。为了让语言模型处理它们,VLA 会先将动作量化成离散 token,再像生成一句话那样,一个接一个地预测动作 token。
区别在于,文字生成错一个词,句子可能只是有点别扭;动作 token 偏一点,机械臂却可能直接抓空。
2. 动作正确,不等于看得正确
传统 VLA 主要用示范动作训练:模型输出越接近专家动作,损失就越小。问题是,这种损失只负责检查“最后做了什么”,并不会追问“你刚才到底在看哪里”。
比如训练数据中的杯子总放在桌面右侧,机械臂也总从相似姿态出发。模型可能没有真正识别杯子的边缘和形状,只是记住了“往右伸手”这条捷径,照样能在训练场景里拿到不错的分数。
可一旦杯子换了位置、桌面换了颜色,或者旁边多放几个相似物体,这条捷径就失灵了。
所以,下面两件事并不能画等号:
- 模型在训练数据上给出了正确动作;
- 模型形成了稳定、准确、与任务相关的视觉表征。
ReconVLA 瞄准的,正是两者之间这道缝。
3. 什么是 gaze region?
Visual Grounding 的核心,是把语言里提到的对象和图像中的具体区域对应起来。ReconVLA 把当前最该关注的任务区域称为 gaze region,也就是“凝视区域”。
这里的 gaze 不是真实眼动数据,也不是给机器人装了一双会转动的眼睛,而是一种类人的比喻。
更重要的是,gaze region 不是永远不变的。在“把蓝色积木叠到粉色积木上”这个任务里:
- 抓取阶段,重点是蓝色积木;
- 放置阶段,重点会转向粉色积木的顶部。
人做事时,目光会跟着当前步骤自然切换;ReconVLA 想让模型学会的,正是这种“该看谁时就看谁”的能力。
二、让机器人看目标,有三条路
论文没有一上来就宣布“我们的方案最好”,而是把视觉 grounding 整理为三种范式:显式输入、思维链输出和隐式监督。三种方法建立在同一 baseline 上,方便公平比较。
1. Explicit Grounding:直接递上一张重点放大图
最直观的做法,是先用 YOLOv11 找到目标,把目标裁剪出来,再将“原图+目标裁剪图”一起交给 VLA。
这像考试时,老师不仅发了整张地图,还贴心地圈出重点并附上一张局部放大图。模型当然更容易找到目标,实验中平均连续完成长度也从 baseline 的 3.36 提升到 3.61。
但代价也很明显:推理链上始终挂着一个外部检测器,原图和裁剪图还会产生重复信息。更关键的是,它把重点“喂”给了模型,却不一定让 VLA 自己长出更好的视觉表征。检测器一旦认错,后面的动作模型也容易跟着跑偏。
2. Chain-of-Thought Grounding:先报坐标,再动手
第二条路是让模型先生成目标边界框,再生成动作:
Bbox[x1, x2, y1, y2] + Action Sequence
它很像机器人先说一句“目标在这里”,再开始操作。这个思路看起来更透明,但在论文的 CALVIN 实现中表现很差:平均完成长度只有 0.63,连续完成四步和五步任务的成功率都降到了 0。
原因可能在于,几个坐标 token 很难装下物体的形状、纹理和边缘等细节;同时让一个自回归模型精确生成坐标和动作,也增加了优化难度。前面的坐标一旦报错,后续动作还可能被一路带偏。
需要注意的是,这组结果只能说明论文中的这套 CoT Grounding 实现不理想,不能扩大成“所有具身思维链都无效”。
3. Implicit Grounding:不多说,也不多看,但心里得有数
ReconVLA 选择了第三条路:
- 输入仍然是原始多视角图像和语言指令;
- 输出仍然是机器人动作;
- 训练时额外检查内部表示能否重建 gaze region。
它不把目标裁剪图塞进在线输入,也不要求模型在动作前大声报出边界框,而是直接训练模型内部的视觉表示。
三种方法的差别可以概括为:
| 范式 | 输入端 | 输出端 | 真正被训练的重点 | 在线推理依赖 |
|---|---|---|---|---|
| Explicit Grounding | 增加目标裁剪图 | 仍输出动作 | 动作预测 | 外部检测器与裁剪图 |
| CoT Grounding | 输入原图 | 先 bbox,后动作 | 坐标与动作序列 | 自回归坐标链 |
| Implicit Grounding | 输入原图 | 仍输出动作 | 动作+内部视觉表征 | VLA 本身 |
ReconVLA 最巧妙的地方,不只是用了 diffusion,而是把监督从“给模型多看什么”和“让模型多说什么”,移到了“模型心里究竟记住了什么”。
三、ReconVLA 怎么工作:一条动作主线,一场重建小测
ReconVLA 的架构可以看成两条并行轨道:一条负责生成动作,一条负责重建目标。两条轨道共享同一个 VLA 主干。
1. 动作轨道:该怎么动?
模型采用 LLaVA-7B 式多模态架构,语言主干为 Qwen2-7B,视觉编码器为 SigLIP。多视角图像被编码为 image tokens,指令被编码为 text tokens,模型融合二者后自回归生成 action tokens,最后再还原为连续控制动作。
这条轨道与常规 VLA 类似,回答的是:机器人下一步该怎么动?
2. 重建轨道:你真的看清了吗?
重建支路则像一位不太好糊弄的监考老师。
它先用连续 VAE 把 gaze region 图像 I' 压缩到潜空间,得到 z_0;再随机加噪得到 z_t。一个轻量 Diffusion Transformer 接收 z_t、时间步 t,以及 VLA 输出的 reconstructive tokens h_R,尝试预测刚才加进去的噪声。
视觉损失写成:
L_visual_VLA = E_(t, epsilon)[||D(z_t; h_R, t) - epsilon||_2^2]
公式看起来复杂,逻辑却很朴素:
- epsilon 是真实加入的噪声;
- D(z_t; h_R, t) 是去噪器猜出的噪声;
- 猜得越准,说明 h_R 提供的目标信息越充分。
如果 VLA 的内部表示只记住了桌面颜色,却没记住碗口在哪里,去噪器自然很难恢复碗的区域;重建误差就会反向推动主干网络,把目标的位置、轮廓和视觉细节重新学扎实。
因此,这里的扩散模型不是为了在部署时慢慢画一张高清图,而是一个训练用的“测谎仪”:模型说自己看懂了没用,能支持目标区域重建才算过关。
3. 两项作业一起交
ReconVLA 的总损失由动作损失和视觉重建损失直接相加:
L_ReconVLA = L_action_VLA + L_visual_VLA
动作损失管“做得对不对”,重建损失管“看得清不清”。论文公式没有额外写权重系数,公开代码中训练态也直接执行 loss = loss + vm_loss。
这意味着模型不能只会动,也不能只会看:两份作业得一起交。
4. 为什么指令 token 要放在图像 token 前?
同一张桌面上可能同时放着西瓜、苹果、黄色碗和绿色碗。光看图像,模型并不知道当前该盯谁;“目标”必须由图像和指令共同决定。
ReconVLA 把 instruction tokens 放在 image tokens 前面。借助 causal attention,后面的图像 token 可以读取前面的任务信息。于是,同一幅画面在“拿西瓜”和“拿苹果”两条指令下,会形成不同的任务相关表示。
这个看似不起眼的 token 顺序,其实解决了一个关键问题:重建支路凭什么知道该重建谁?
5. 推理时还要重建图片吗?
从公开代码路径看,不需要。
重建损失只在训练状态下计算;生成动作时,模型直接走语言模型的 generate() 路径,不需要提供目标图,也不会运行扩散去噪来画出 gaze region。
所以 ReconVLA 可以简单理解为:
- 训练时:一边学动作,一边接受目标区域重建训练;
- 推理时:带着已经练出来的视觉能力,直接输出动作。
外部 grounding 模型和重建分支没有被塞进在线控制链,这正是“隐式”二字的含义之一。
四、10 万条轨迹、200 万样本:gaze region 从哪里来?
VLA 原本更擅长“看图说话”和“看图行动”,并不天然擅长从内部 token 恢复局部图像。只靠少量下游数据临时学习重建,很容易变成死记几个物体和背景。
为此,作者整合了 BridgeData V2、LIBERO 和 CALVIN 三类开源机器人数据,并使用微调后的 Grounding DINO,根据语言指令自动找到交互区域,构造“原始图像—gaze region”配对。
最终,预训练数据规模超过 10 万条轨迹、200 万个样本。模型先在大规模混合数据上学习“不同场景中该看哪里”,再针对具体机器人任务微调。
这里有一个容易误解的细节:ReconVLA 并不是彻底摆脱了 Grounding DINO,而是改变了它出现的位置。
- 显式 grounding:检测器需要在机器人在线操作时持续工作;
- ReconVLA:Grounding DINO 主要在训练前离线生成 gaze region,部署时不再成为必经环节。
这像老师在备课时提前圈好重点,但考试时学生不能再带着答案上场。最终能不能完成任务,仍取决于 VLA 自己有没有把重点学会。
五、实验结果:它真的从“到处看”变成“盯准看”了吗?
ReconVLA 的实验形成了一条比较完整的证据链:先比较三种 grounding 范式,再看注意力、精细操作、消融、长时序榜单和真机表现。
1. 三种 grounding 正面对决
CALVIN 包含 34 个任务和 A、B、C、D 四种环境。ABC→D 表示在 A、B、C 环境训练,到从未见过的 D 环境测试,重点考察背景泛化。评测要求机器人连续完成五个子任务,共统计 500 次 rollout。
| 方法 | 1/5 | 2/5 | 3/5 | 4/5 | 5/5 | 平均完成长度 |
|---|---|---|---|---|---|---|
| Baseline | 88.8 | 76.1 | 63.7 | 57.0 | 49.0 | 3.36 |
| Explicit Grounding | 94.4 | 82.5 | 70.9 | 62.2 | 50.2 | 3.61 |
| CoT Grounding | 47.0 | 14.3 | 1.6 | 0.0 | 0.0 | 0.63 |
| Implicit Grounding | 95.6 | 87.6 | 76.9 | 69.3 | 64.1 | 3.95 |
显式 grounding 在任务前几步确实有帮助,但到了第五步,只比 baseline 高 1.2 个百分点。ReconVLA 则把 5/5 成功率从 49.0% 提升到 64.1%,而且任务链越长,优势越明显。
换句话说,别人递来的“重点放大图”能帮一阵子,真正把目标表征学进模型内部,走得更远。
2. 最难的叠积木,提升最显眼
Stack Block 不只是把物体抓起来,还要把一块积木准确叠到另一块上。模型既要找准被抓取物,又要看清承接位置,任何几毫米的偏差都可能让积木倒下。
- Baseline:59.3%;
- ReconVLA:79.5%;
- 绝对提升:20.2 个百分点。
这个结果尤其有说服力,因为最大增益恰好出现在最依赖精确定位的任务上。论文说自己改善了目标视觉表征,而最需要“看准”的任务也确实涨得最多,方法主张与实验结果对上了。
3. 不是“重建什么都行”,重点在 gaze region
消融实验把不同组件逐个加回模型:
| 重建分支 | 重建 gaze region | 大规模预训练 | 5/5 成功率 | 平均完成长度 |
|---|---|---|---|---|
| 否 | 否 | 否 | 49.0 | 3.36 |
| 是 | 否 | 否 | 46.5 | 3.42 |
| 是 | 是 | 否 | 58.2 | 3.85 |
| 是 | 是 | 是 | 64.1 | 3.95 |
只重建整张图时,平均长度从 3.36 微升到 3.42,但 5/5 成功率反而从 49.0% 降到 46.5%,收益并不稳定。
把目标改成 gaze region 后,平均长度跃升到 3.85,5/5 成功率达到 58.2%;再加入大规模预训练,最终来到 3.95 和 64.1%。
这组消融揭开了论文真正的机关:关键不是随便给 VLA 装一个“画图模块”,而是让它只重建与当前任务最相关的区域。整张图里,桌面纹理、墙面颜色和无关杂物都会抢占学习能力;gaze region 则像一束聚光灯,把监督集中在真正影响动作的地方。
4. 与主流方法相比,强项在未见背景泛化
在 ABC→D 设置中,ReconVLA 的结果如下:
| 方法 | 类型 | 5/5 成功率 | 平均完成长度 |
|---|---|---|---|
| GR-1 | 未来图像生成 | 40.1 | 3.06 |
| Vidman | 生成式方法 | 46.7 | 3.42 |
| OpenVLA | 大型 VLA | 43.5 | 3.27 |
| UniVLA | 大型 VLA | 56.5 | 3.80 |
| ReconVLA | 目标区域重建 | 64.1 | 3.95 |
与 OpenVLA 相比,ReconVLA 的 5/5 成功率高 20.6 个百分点;与 UniVLA 相比高 7.6 个百分点。
有趣的是,GR-1 等生成式方法关注“接下来会发生什么”,用未来图像辅助规划;ReconVLA 则先解决“眼前究竟该看什么”。一个向未来想,一个把当下看清。实验说明,对机器人来说,先别急着畅想下一幕,把面前的目标看准同样重要。
在相对熟悉的 ABCD→D 设置中,ReconVLA 的平均完成长度为 4.23,略高于 GR-1 的 4.21;但它的 5/5 成功率为 70.5%,低于 GR-1 的 73.1%。因此更准确的说法是:ReconVLA 在这一设置中具有竞争力,但不是所有指标都第一;它最突出的优势仍在未见背景的 ABC→D 泛化测试中。
5. 从模拟器走到真机
作者还在 6 自由度 AgileX PiPer 机械臂上测试了四类任务:
- 叠碗;
- 把水果放进碗里;
- 翻杯子;
- 收拾桌面。
每项任务平均采集约 150 条训练轨迹,每个模型、每项任务测试 20 次。ReconVLA 在四项任务中均优于 OpenVLA 和 PD-VLA,在放水果和叠碗任务上的成功率接近或超过 90%。当目标换成训练中没有见过的新物体时,对比方法几乎无法完成任务,ReconVLA 仍保留了明显的操作能力。
注意力可视化也给出了很直观的画面:baseline 的高亮区域常散落在背景和无关物体上,ReconVLA 则更集中在西瓜、碗口或积木等当前目标附近。它不是唯一的因果证明,却与长时序、精细操作、消融和真机结果彼此呼应——注意力不再“撒胡椒面”,而是更像把准星压在目标上。
六、ReconVLA 真正聪明的地方是什么?
如果只把它总结为“VLA 后面加了一个 Diffusion Transformer”,就低估了这篇论文。它真正漂亮的地方有四点。
1. 它先发现“模型看错了什么”,再决定加什么
论文不是从“我还能堆一个什么模块”出发,而是先观察到注意力分散,再把它上升为视觉 grounding 不充分的问题,最后才设计重建监督。问题、方法和实验围绕同一条主线展开,没有各唱各的戏。
2. 它把“是否看懂”变成了一件可以检查的事
过去只能看到输入图像、语言指令和最终动作,中间的目标表征像个黑箱。ReconVLA 用区域重建给这个中间变量安排了一场考试:如果内部表示连目标区域都无法支持恢复,就很难说它真的理解了目标。
3. 它只重建当前该看的地方
重建整幅画面容易被背景牵着走;重建未来图像更偏向动力学预测。ReconVLA 把生成能力用在当下的任务相关区域,相当于主动建立了一个信息筛子:与动作无关的内容可以少记,目标的位置和细节必须记牢。
4. 训练时加压力,部署时不添堵
显式 grounding 会增加在线输入,CoT grounding 会增加在线输出,ReconVLA 则主要在训练期增加辅助监督。推理时仍保持“图像+指令进,动作出”的原接口。
这让它不像给机器人永久绑上一副外置望远镜,更像训练阶段做过大量视力和专注力练习:真正上场时,不必把训练器材一起背着跑。
七、它还没有回答什么?
ReconVLA 解决的是一个清楚而重要的问题,但它并没有包办视觉 grounding 的全部未来。论文留下的疑问主要集中在三点。
第一,gaze region 由 Grounding DINO 自动生成,标错、漏检或框入过多背景时,监督噪声会怎样影响动作学习,论文还没有单独量化。
第二,当前方法主要依赖二维目标区域。面对插拔、精密装配或严重遮挡,机器人还需要深度、表面法向和 6D 位姿等三维信息,二维 crop 能走多远仍需更多实验。
第三,真机实验每个模型、每项任务测试 20 次,已经能展示趋势,但跨机器人本体、动态场景和更大规模复现仍有待验证。
这些问题不会推翻论文的价值。好论文并不需要一次解决整个领域,而是要把一个长期模糊的痛点说清楚,再给出一套可信、可验证的解法。ReconVLA 做到了这一点。
八、结语:先看对,才能做对
从工程上看,ReconVLA 是在 VLA 训练中加入目标区域的潜空间扩散重建;从方法上看,它用重建监督塑造任务相关的视觉表征;从更高一层看,它提出了一种 Implicit Grounding 范式——不增加在线目标输入,也不要求模型显式输出边界框,而是让 grounding 变成模型内部的能力。
它最值得记住的,并不是某个 VAE、某个 diffusion head,甚至也不只是 64.1% 这个数字,而是一种研究思路:
当最终动作损失只能告诉模型“做错了”,却无法告诉它“看错了”,就为中间感知表征设计一场与任务相关的考试。
ReconVLA 用“重建目标区域”出了这道考题。为了答对,机器人必须知道目标是谁、在哪里、长什么样;等真正执行动作时,它不必展示答案,只需要把已经练出来的视觉能力用在刀刃上。
说到底,机器人操作并没有什么神秘捷径:手要稳,脑要懂,而在这一切之前——眼睛得先看对。
如果你对 ReconVLA 愆趣,想进一步了解其模型设计、实验结果或复现细节,可以查看以下资料:
本文仅用于学术交流与技术分享,相关内容及图片版权归论文作者与研究团队所有。
