技术博客
强化学习AI AgentVLA论文解读训练

从“会抓取”到“会做事”:解读逐际动力 COSA 0.5 与人形 VLA V³-0

NOTA62026-07-16 12:08
从“会抓取”到“会做事”:解读逐际动力 COSA 0.5 与人形 VLA V³-0

逐际动力近期发布了COSA0.5的技术报告

官网中文链接: https://limxdynamics.com/cosa05v3/#zh

英文链接: https://limxdynamics.com/cosa05v3/#en

视频

逐际动力的 V³-0 并不主要是在证明“人形机器人也能抓取”。它试图解决的是更难的问题:让人形机器人把视觉理解、移动、双手操作、全身平衡和失败恢复组织成一个连续闭环,在真实空间里完成长程任务

这也是 COSA 0.5 值得关注的地方。它不是孤立地发布一个视觉语言动作模型(VLA),而是将 VLA、全身运动控制、人类在环干预与真机强化学习串成一套具身智能系统

先看它展示了什么

报告中的 Oli 是一台 43 自由度人形机器人。演示并非把若干短片拼接起来,而是让机器人在接近三分钟的连续流程中整理房间:收衣物、搬运和堆叠箱子、收拾桌面玩具、扶正椅子、清理垃圾,最后把钱包交给人。

这些动作单独看都不新鲜;难点在于它们彼此相连。

机器人每完成一项,都要重新走近下一个目标、改变朝向、控制头部视野、弯腰、伸手、抓取、放置,再转向新的位置。

任何一次抓空、失衡或陷入重复动作,都会让整条任务链失败。

因此,这份报告的核心命题是:移动和操作不能再被视作两个串接的模块,而应当被统一为同一个全身控制问题。

系统怎么工作:慢理解、快行动、稳执行

V³-0 的架构可以理解为“快慢双系统 VLA + 全身控制底座”。

flowchart TD
    U["语言指令"] --> S["V³ 慢系统:视觉语言理解<br/>低频 < 5 Hz"]
    C["头部/腕部相机"] --> S
    S -->|"任务意图 latent"| F["V³ 快系统:flow-matching 策略<br/>50 Hz"]
    C --> F
    R["机器人本体状态"] --> F
    F -->|"全身动作块:手、腿、躯干、头部"| W["LimX-WBT:全身跟踪与动态平衡<br/>控制频率实时运行"]
    W --> O["Oli:43 DoF 人形机器人"]
    O -->|"真机 rollout 与状态反馈"| H["人类在环:专家接管/纠正"]
    H --> D["失败片段标注 + reward model"]
    D -->|"真机 RL 更新"| F

第一层是慢系统。它是视觉语言模型,读取头部和手腕相机画面以及语言指令,压缩生成任务意图表示。由于场景语义和任务规划不必每秒刷新数十次,它可以低频运行。

第二层是快系统。它接收慢系统的 latent、实时相机画面和机器人状态,并以 50 Hz 生成短时的全身动作块。关键是,这个动作空间不只包含手部位姿,还包含双腿、躯干和头部目标:人形机器人要拿远处物体,先要走过去;走动中还要通过主动转头持续看住目标。

第三层是 LimX-WBT(Whole-Body Tracker)。上层只表达“我希望身体如何运动”,WBT 负责在真实机器人上把这些目标追踪出来,同时维持平衡。伸手、迈步、深弯腰都会改变质心,若让导航控制器、手臂控制器和稳定控制器在接口处分别协调,系统很容易出现冲突。V³-0 的选择是让一个全身跟踪 器统一处理这件事。

这套设计的真正价值:把延迟隔离在正确的位置

大模型擅长理解指令和场景,但天然不适合直接承担高频控制。

控制回路若等待大模型推理完成,机器人面对人靠近、物体位移、摩擦变化或自身执行偏差时就会反应太慢。

V³-0 的快慢拆分并非只是“节省算力”:它把语义推理的延迟隔离在慢系统,把对现实世界变化的响应交给快速策略。快系统既读取高层意图,也重新读取实时视觉和本体状态,因此无需盲目执行上一次计划。

这是一种比端到端单一 VLA 更实用的工程路线。前者追求一个模型直接完成全部映射,后者承认不同问题有不同时间尺度:理解可以慢,动作不能慢,动态平衡更不能慢。

从演示到数据飞轮:人类在环并不是“遥控兜底”

报告的另一个重点是人类在环与真机强化学习。基础策略先由专家全身遥操作数据进行模仿学习;之后机器人自主 rollout。发生关键偏差时,专家可无缝接管全身控制,完成纠正后再把控制权交回策略。

这些数据不是只为了救场:自主运行中的失败片段会被人工标注,训练 reward model;再由 reward model 对任务进展逐时刻评分,转化为策略更新信号。如此形成“演示—自主运行—失败标注—人工纠正—真机 RL”的闭环。

这一点很关键。人形机器人最昂贵、也最稀缺的是带有接触、平衡、执行器误差和失败恢复过程的真机交互数据。

若人工接管可以低摩擦地嵌入运行过程,它就能同时提升安全性与数据密度。

报告给出了哪些证据

官网报告称,真机 RL 更新后,三个任务的表现均超过 behavior cloning(BC)基线;其中 basket cleanup 的成功率从 18.01% 提升至 74.00%,汇总失败率从 39.65% 降至 11.33%。

这至少说明,在其设定的真实任务中,基于失败状态和人工纠正继续训练是有效的。

在底层跟踪上,报告还将 LimX-WBT 与在同一机器人上复现的 SONIC 作内部对比:MPJPE 从 13.75 mm 降至 12.85 mm,MPJAE 从 3.3° 降至 1.5°,关节与底盘运动 jerk 也更低。

这意味着它不仅更贴近目标姿态,也没有以更大抖动为代价。

但这些数字应被理解为厂商技术报告中的内部证据,而不是独立 benchmark 排名。报告没有完整给出评测样本量、方差/置信区间、跨平台实验或第三方复现结果。

它与常见“机器人演示”有什么不同

许多机器人演示真正展示的是单点能力:固定位置的抓取、短距离行走,或事先布置好的桌面操作。V³-0 的差异在于,它把下列能力同时放入同一任务链:

  • 长程性:多步任务无中途复位,整体成功率是各步骤成功率的乘积;

  • 全身性:深弯腰、走近、转身与双手操作都影响平衡;

  • 反应性:快系统持续根据实时视觉和本体状态更新动作;

  • 恢复性:抓取失败后可以重新调整,而非立即任务终止;

  • 数据闭环:失败不是演示之外的噪声,而是后续训练的输入。

换言之,项目试图从“完成一个预定义动作”走向“在一个空间中持续完成事情”。

给我们带来的启示

这份报告的工程方向是可信、且有价值的。

虽然它距离实际场景尚有距离,但是让我们看到“通用人形机器人”的一种可能性。这个报告给我们的启示:

第一,泛化边界如何拓展。报告展示了物体颜色、位置和少量未见物体变化,但主要场景仍是室内整理;面对强遮挡、拥挤人群、柔软物体的大形变、复杂接触力控制或长期环境变化,可靠性如何仍待验证。

第二,长程成功率需要更严格的统计。一次三分钟一镜到底的演示很有说服力,但不能替代跨天、跨场地、跨操作者、跨机器人本体的大规模重复测试。

第三,系统的成本与可复制性依然是业界的挑战。快慢模型的端侧算力、失败恢复对人工介入的依赖比例、数据采集成本,以及 WBT 对不同硬件的迁移代价,都会决定它能否从样机走向部署。

第四,当前亮点是系统集成,而非每个组件都前所未有。VLA、flow matching、全身控制、人类在环和真机 RL 各自都有既有研究。真正应被检验的是:这套系统架构如何稳定扩展到更多任务,且每一层的改进能否带来可复现的端到端收益。

结语:人形机器人的下一道门槛是“连续可靠”

COSA 0.5 与 V³-0 给出的不是“一个模型会多少技能”的答案,而是一条更接近产品化的路线:高层语义理解不阻塞低层运动,移动与操作不再分家,失败被捕获并转化为新的真机训练信号。

如果这套闭环能在更广泛的场景、更多机器人和更严格的第三方测试中站住脚,它的意义将不只是让 Oli 多完成几项家务,而是为人形机器人提供一种可持续积累能力的操作系统范式,从演示驱动,走向真实世界。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发