技术博客
VLA其他

AAAI 2026 最佳论文-ReconVLA详解(四)--扒一扒作者团队

coffee co.2026-08-04 11:26
AAAI 2026 最佳论文-ReconVLA详解(四)--扒一扒作者团队

十个名字,四所高校:我顺着 ReconVLA 的作者名单往回翻

十位作者,四所高校:香港科技大学(广州)、西湖大学、浙江大学、Monash University。名单从 Wenxuan Song 开始,以 Donglin Wang 和 Haoang Li 收尾。单看阵容,很容易脑补出一场正式的跨校合作:几位老师先定方向,再从四所学校各找几名学生,开会、分工、组队,最后攒出一篇最佳论文。

但我把这些名字放进搜索框,一个个往前查,看到的却是另一种故事。

这十个人不是为了 ReconVLA 才第一次坐到一起。他们更像几拨早就合作过的人,沿着不同路线走了几年,最后在同一个问题上碰头。而位于几条路线交叉口的,恰好是第一作者宋文轩。

当然,我没有这支团队的组会录音,也不知道是谁在某个深夜最先说出“要不让模型重建目标区域”。我能看到的,只有个人主页、作者排序和一篇篇公开论文。

可论文圈有个好玩的地方:合作关系很难完全藏住。简历会把经历分成一行一行,作者名单却会把人重新连起来。

我先从西湖大学翻起

宋文轩的个人主页里有一段很短的经历:本科毕业于哈尔滨工业大学(威海)后,他曾到西湖大学 MiLAB 访学,导师是 Donglin Wang。他还特意写到,自己一直和 Pengxiang Ding、Han Zhao 保持紧密联系,并从两人身上学到很多。

这句话如果孤零零地放在简历里,只像一句客气的致谢。把它和论文列表摆在一起,意思就完全不同了。

2024 年前后,Pengxiang Ding、Han Zhao、Wenxuan Song 和 Donglin Wang 接连出现在 QUAR-VLA 与 GeRM 两篇工作中。前者由 Pengxiang Ding 领衔,后者换成 Wenxuan Song 做第一作者;研究对象都是四足机器人,核心搭档却没有散。

我很喜欢看这种作者顺序的变化。它比“某人连续一作,其他人永远站在后面”更能说明问题:这不像一群人陪着同一个主角刷副本,倒像一个已经磨合起来的小队——这次你主攻,下次我带队,题目可以换,合作不用重来。

而且,他们当时做的并不是 ReconVLA 里的机械臂操作。QUAR-VLA 想让四足机器人把视觉、语言和动作接起来;GeRM 继续处理多任务学习、不同质量的数据和 Mixture-of-Experts。机器人后来从“四条腿”换成了“两只机械臂”,但那些麻烦并没有变:模型怎样看,怎样理解指令,怎样组织数据,又怎样把理解变成可靠动作。

这也是我查到的第一条暗线。ReconVLA 的团队并不是从 ReconVLA 才开始形成。早在西湖大学的四足机器人项目里,后来那张最佳论文作者表的一部分,已经提前同框了。

到了港科大(广州),旧搭档没有留在上一页

后来,宋文轩进入香港科技大学(广州)攻读博士,师从 Haoang Li。

对一名博士生来说,换实验室常常意味着换题目、换设备,也换一套合作者。过去的名字慢慢沉到简历下方,新实验室的人占据论文列表上半区——这本来是最普通的轨迹。

宋文轩的论文列表却没有这样整齐地“断代”。

在研究动作并行解码的 PD-VLA 里,新搭档 Jiayi Chen 出现在第二作者位置;而西湖时期的 Pengxiang Ding、Han Zhao 仍在,Haoang Li 则出现在名单末尾。旧合作圈没有被替换,新实验室的人直接接了进来。

再往后看 RationalVLA,阵容已经颇有“提前大结局”的味道:港科大(广州)的合作者来了,西湖大学的老搭档来了,Monash 一侧的 Feilong Tang、Xuelian Cheng、Zongyuan Ge 也出现了。

ReconVLA 的十人名单,几乎就在这样的连续合作中慢慢显影:

  • Wenxuan Song、Ziyang Zhou、Jiayi Chen、Haodong Yan、Yuxin Huang 与 Haoang Li,构成港科大(广州)这一侧;
  • Han Zhao、Pengxiang Ding 与 Donglin Wang,延续西湖大学 MiLAB 的合作线,其中前两位同时连接浙江大学;
  • Feilong Tang 则把 Monash University 带进作者栏。

如果我只按学校上色,这是一篇四校合作论文;如果顺着共同署名往前看,它更像宋文轩几段研究经历叠在一起留下的投影。

他不是名单里唯一重要的人,也没有证据表明所有作者都是由他亲自邀请。但有一点很难忽略:别人多数位于某一个合作圈里,他却走过圈与圈之间的路。

最远的 Monash,其实早就出现了

四个单位中,Monash University 看起来离得最远,也最容易被当成作者栏里突然冒出来的“海外合作”。

我起初也这样想。直到我在宋文轩的个人主页上看到,他曾在 Monash University 开展研究,由 Zongyuan Ge 和 Xuelian Cheng 指导;再顺着论文往前后翻,Monash 这条线便不再突兀。

Zongyuan Ge 出现在 PD-VLA,Feilong Tang、Xuelian Cheng 和 Zongyuan Ge 共同出现在 RationalVLA;到了 ReconVLA,Feilong Tang 继续在场。再往后,他又出现在 Unified Diffusion VLA 的作者名单里。

一次同框可能是项目需要,连续几篇都在,就更像一段已经稳定运转的合作。

所以,Monash 并不是 ReconVLA 临近投稿时才补上的一块拼图。宋文轩在那里留下的研究经历,为两边提供了一个现实交点;后续论文则说明,访学结束之后,这条线并没有跟着门禁卡一起失效。

这算不上什么内幕,却比硬编一段“某次会议上一拍即合”更有意思。真正可靠的学术八卦,往往不藏在聊天记录里,而藏在那些反复出现的名字里。

这群人为什么偏偏在 ReconVLA 上会师

查到这里,我还有一个疑问:认识归认识,为什么最后是 ReconVLA 把他们聚到了一起?

答案或许就在论文的问题里。

VLA 模型要根据图像和语言控制机器人。听起来它既能看又能做,ReconVLA 却先指出了一个尴尬事实:很多模型虽然给出了动作,视觉注意力并没有真正落到要操作的物体上。机器人像是听懂了命令,也伸出了手,却未必把目标看仔细。

团队给出的办法很巧:不直接拿框去监督注意力,而是让模型根据内部视觉表示,重建机器人正在关注和操作的目标区域。要把那块图像还原出来,模型就不能只记一个模糊轮廓;它必须保留与动作有关的细粒度信息。换句话说,重建不是额外学画画,而是一场针对视觉表征的闭卷考试。

这个问题恰好站在几种能力的交界处。

港科大(广州)IRPN Lab 长期研究三维视觉、机器人感知与操作;西湖大学 MiLAB 的合作圈此前已经在强化学习、多任务机器人和 VLA 上反复磨合;而宋文轩、Jiayi Chen 等人在 PD-VLA、RationalVLA 等工作里,又积累了机械臂 VLA 与真实系统验证的经验。

如果把这些能力写成学校宣传稿,很容易变成一句空洞的“优势互补”。但从论文时间线看,互补并不是两位负责人开会时才临时设计出来的。学生们早已一起碰过数据、模型和机器人系统,也知道一个漂亮想法落地时会卡在哪儿。ReconVLA 只是终于找到了一个足够重要、也恰好需要所有这些经验的问题。

它最后使用超过 10 万条轨迹、200 多万条样本进行预训练,又同时做仿真和真机实验。这样的工作既要有清楚的方法判断,也要有人把数据、训练和机器人部署真正接起来。十位作者在这里不再显得“太多”,反而像这个问题自然需要的宽度。

真正让我在意的,是获奖以后人没有散

判断一支团队是不是临时拼盘,最简单的办法不是看获奖之前,而是看获奖之后。

ReconVLA 之后,这些名字没有从彼此的论文里消失。

Jiayi Chen、Wenxuan Song 等人继续研究联合离散扩散与实时解码;Han Zhao、Pengxiang Ding、Donglin Wang 仍然连接着 MiLAB 的研究线;Haoang Li 也持续出现在多篇跨组工作中。Spatial Forcing 把问题从“看准目标”推向空间表征,Unified Diffusion VLA 和 CEED-VLA 又把动作生成与速度继续向前推进。

最有意思的是,第一作者也在轮换。QUAR-VLA 是 Pengxiang Ding,GeRM 和 ReconVLA 是 Wenxuan Song,Unified Diffusion VLA 则由 Jiayi Chen 领衔。宋文轩频繁出现,却并非永远占据第一个位置。

这让我重新理解了所谓“连接者”。连接者不一定每次都站在队伍最前面。他更像那个让合作可以跨过一次访学、一次换校、一次研究方向转弯的人:项目由谁主导可以改变,愿意一起解决问题的人还在。

OpenHelix Team 也让这种关系有了一个学校之外的落点。实验室有校门,访学有期限,开源组织却可以把代码、模型、论文列表和下一项计划留在同一张桌子上。它未必能说明每个人做了多少工作,却让这张跨校网络拥有了持续可见的名字。

最佳论文背后,不只有一个好点子

回头再看 ReconVLA 的作者页,我已经不太愿意把它叫作“豪华联队”了。

豪华联队听起来像把最强的人临时凑齐;ReconVLA 更接近另一种组队方式:先在小项目里建立信任,换了单位也不断掉旧线,让新搭档自然接进来,再用一个接一个的问题维持合作。

宋文轩在这张网络里的特殊之处,不只是论文数量多,而是他的研究经历几乎与团队结构重合:西湖大学阶段认识的人,港科大(广州)读博后加入的人,Monash 经历连接的人,最后都出现在同一张作者表上。

我仍然不知道,是谁发出了 ReconVLA 的第一条消息,也不知道十个人第一次完整出现在同一场会议里是什么情形。公开资料不足以回答这些问题,我也不想拿想象冒充内幕。

但公开记录已经讲清了一件更重要的事:一篇最佳论文很少凭空长出来。它前面往往拖着一串看似无关的项目、几次研究方向的转弯,以及一群合作过之后还愿意继续合作的人。

论文第一页只有十个名字。顺着它们往回翻,我看到的却是一支团队缓慢成形的过程。


如果你对 ReconVLA 感兴趣,想进一步了解其模型设计、实验结果或复现细节,可以查看以下资料:

本文仅用于学术交流与技术分享,相关内容及图片版权归论文作者与研究团队所有。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发