从"看懂"到"会做":阿里 Qwen-Robot Suite 技术解析

博客链接:
https://qwen.ai/blog?id=qwen-robotsuite
过去几年,大模型在文字、语音、图像这些"数字世界"里几乎无所不能。
但让它指挥一只真实的机械臂去拿起一个没见过的杯子,却依然很难,模型"看懂"了画面,却不知道该输出什么动作。阿里 Qwen 团队把这道坎概括成一句话:Seeing is not acting(看懂不等于会做)。
2026 年 6 月发布的 Qwen-Robot Suite,正是为跨过这道坎而生。
一套套件,三块拼图
Qwen-Robot Suite 不是一个机器人,而是机器人的"大脑软件",由三个基础模型组成,既能单独使用,也能拼成完整软件栈。
Qwen-RobotManip:视觉-语言-动作(VLA),负责抓取与操作
Qwen-RobotNav:视觉-语言-导航(VLN),负责移动
Qwen-RobotWorld:视频世界模型,负责"预演"未来
RobotManip:用"对齐"换"规模"
操作是机器人最难啃的骨头。难点在于:每种机器人的关节、夹爪都不一样,A 机器人采集的数据搬到 B 机器人上常常直接失效。
RobotManip 的核心思路是先把五花八门的机器人数据"对齐"成一种统一表示,再在此之上做大规模训练,这也正是它技术报告标题的含义:对齐解锁规模(Alignment Unlocks Scale)。
效果上,它在跨本体迁移(把模型搬到不同硬件上)的能力比此前最好成绩提升了约 3 倍,意味着换一台机器人时几乎不用重训。它已在 AgileX、Franka 等主流硬件上完成验证,并在大规模真机基准 RoboChallenge 的通用赛道上登顶。
RobotNav:把五种导航塞进一个模型
以前的机器人导航,往往一个任务训一个模型。RobotNav 把指令跟随、点目标导航、目标跟踪等五类任务统一进同一个模型,既是导航引擎,也是上层 agent 系统的统一接口。
它还能支撑"具身问答"(EQA)这类长程任务,比如你问机器人"我的工牌落哪儿了",它需要真的在空间里走一圈、找一找再回答,而不只是吐一句文字。
RobotWorld:让机器人先"想象"再行动
RobotWorld 是一个视频世界模型:给它当前画面和一句自然语言动作,它能预测接下来会发生什么(物理上合理的未来画面)。
两个很实用的用途:一是在真正动手前,先在"脑内"预演几条轨迹、挑最优的去执行;二是生成合成视频数据,反过来喂给前两个模型做训练。它覆盖 20+ 种机器人形态、500 类动作。
三者如何协同?
真正的威力来自组合。一个官方例子:用户说"去看看 Cotti 咖啡店有没有人落了把绿伞"。
这里通用 Qwen 模型做高层规划,把三个机器人模型当成"工具"来调用,从而把"通用智能"接到"物理行动"上。这正是阿里把它称为"具身智能全栈"的原因。
成绩与定位
RoboChallenge 通用赛道:过程分 59.83,任务成功率 45%,排名第一
跨本体迁移:较此前 SOTA 提升约 3 倍
适配硬件:AgileX、Franka、Universal Robots、宇树等
当前状态:部分阿里云企业客户试点中
一句话总结
Qwen-Robot Suite 把 Qwen 的多模态能力从屏幕里延伸到了物理世界:RobotManip 管手、RobotNav 管脚、RobotWorld 管"脑补"。
需要清醒看待的是,它们是软件"大脑"而非机器人本体,目前仍处于企业试点阶段,离大规模真实落地还有距离。但作为一套以开源数据驱动、可自由组合的全栈方案,它代表了大模型走向具身智能的一条清晰路径。
