三分钟看懂 VLA:让机器人真正“看懂、听懂、做出来”

过去几年,大语言模型让 AI 学会了理解文字、回答问题。
多模态模型进一步让 AI 能够:
看图片、看视频、理解语言。
但对于机器人来说,只会“看”和“理解”还远远不够。
机器人最终必须解决一个更现实的问题:
看懂环境、听懂人的指令,然后真正做出动作。
这就是近年来具身智能领域非常热门的一类模型:
VLA——Vision-Language-Action,视觉-语言-动作模型。
简单来说:
VLA 就是让机器人把“看见什么、听到什么”直接转化成“应该怎么动”。
一、什么是 VLA?
VLA 的全称是:
Vision-Language-Action Model
即:
视觉—语言—动作模型。
它通常接收三类信息。
第一类是视觉信息,例如:
- 摄像头图像
- 视频
- 深度图
- 环境中的物体位置
第二类是语言指令,例如:
“把桌上的红色杯子拿起来。”
第三类则是机器人自身状态,例如:
- 机械臂关节角度
- 夹爪状态
- 末端执行器位置
- 历史动作
模型综合这些信息后,输出:
机器人下一步应该执行的动作。
整个过程可以简单表示为:
视觉
+
语言
+
机器人状态
↓
VLA
↓
机器人动作
所以 VLA 的核心目标非常直接:
让机器人真正把“理解”转化成“行动”。
二、举个简单例子
假设桌子上有:
- 一个红苹果
- 一个香蕉
- 一个杯子
我们告诉机器人:
“把红苹果放进篮子里。”
机器人首先通过摄像头看到桌面。
VLA 模型需要理解:
红苹果在哪里?
然后理解语言中的:
“红苹果”
和图像中的苹果对应起来。
接着机器人还需要理解:
“放进篮子里”意味着什么。
最后模型输出一系列动作,例如:
机械臂向右移动
↓
向下移动
↓
闭合夹爪
↓
抬起
↓
移动到篮子上方
↓
松开夹爪
这就是一个完整的:
视觉 → 语言理解 → 动作执行
过程。
三、VLA 和大语言模型有什么区别?
大语言模型主要解决的问题是:
输入文字,输出文字。
例如:
“法国的首都在哪里?”
↓
LLM
↓
“巴黎”
而视觉语言模型 VLM 可以进一步处理图片:
图片
+
“桌子上有什么?”
↓
VLM
↓
“桌子上有一个苹果和一个杯子。”
但机器人最终需要的是:
动作。
因此 VLA 在 VLM 的基础上,又增加了一种新的输出:
Action。
可以简单理解为:
LLM
语言 → 语言
VLM
视觉 + 语言 → 语言
而 VLA:
视觉 + 语言 → 动作
这也是 VLA 名字中最后一个字母:
A——Action
最重要的意义。
四、VLA 到底输出什么?
很多人第一次接触 VLA 时会有一个疑问:
模型到底怎样控制机器人?
实际上,VLA 并不是简单输出:
“向前走。”
它通常会输出机器人可以执行的控制量。
例如机械臂末端的位置变化:
Δx = 0.02 m
Δy = -0.01 m
Δz = 0.03 m
或者输出:
- 关节位置
- 关节速度
- 末端位姿
- 夹爪开合状态
例如:
[x, y, z, roll, pitch, yaw, gripper]
其中前六个变量控制机械臂末端的位置和姿态。
最后一个变量控制:
夹爪打开还是闭合。
因此从本质上来说:
VLA 做的事情,就是把视觉和语言转换成机器人控制信号。
五、什么是 Action Token?
VLA 中还有一个非常有意思的思想:
把动作也变成 Token。
我们知道,大语言模型会把一句话拆成 Token。
例如:
I love robots
可能被拆成多个语言 Token。
而在一些 VLA 中,机器人动作也可以被离散化。
比如:
机械臂向右移动
可以编码成:
<Action_152>
机械臂向上移动则可能对应:
<Action_086>
这样一来,机器人控制问题就变得很像语言生成。
语言模型做的是:
预测下一个文字 Token
而 VLA 可以做:
预测下一个动作 Token
于是原本成熟的大模型技术,就能够迁移到机器人控制中。
六、为什么 VLA 需要“语言”?
很多传统机器人控制其实并不需要语言。
比如工业机械臂通常只执行:
固定轨迹。
那么为什么 VLA 要专门加入 Language?
因为语言可以让机器人拥有:
更强的任务泛化能力。
以前如果我们想让机器人完成:
“拿苹果。”
可能需要专门编写一个程序。
如果换成:
“拿香蕉。”
又要重新调整。
而 VLA 可以直接理解:
“拿苹果”
“拿香蕉”
“把杯子放到桌子左边”
“把绿色积木放到盒子里”
只需要改变自然语言指令。
机器人就可以执行不同任务。
因此语言在这里实际上扮演了:
任务接口
的角色。
也就是说:
人类负责说目标,机器人负责理解并执行。
七、VLA 为什么突然火起来了?
一个非常重要的原因是:
大模型已经证明了“大规模预训练”的能力。
传统机器人控制通常有一个问题:
一个模型只会一个任务。
例如:
模型 A 会抓杯子。
模型 B 会开抽屉。
模型 C 会叠衣服。
而 VLA 想做的事情更接近:
训练一个通用模型,完成很多不同机器人任务。
例如同一个模型可以接受:
“把杯子拿起来”
“打开抽屉”
“把玩具放进盒子”
“把桌面整理干净”
然后根据不同环境生成不同动作。
这和大语言模型的发展路线非常类似。
过去 NLP 更偏向:
一个模型解决一个任务。
而现在:
一个大模型解决很多任务。
机器人领域也正在经历类似的变化。
八、VLA 是怎么训练出来的?
训练 VLA 最关键的数据通常是:
机器人操作轨迹。
一条训练数据可能包含:
图像
+
语言任务
+
机器人动作
例如:
图片:机械臂位于杯子左侧
指令:
“拿起杯子”
动作:
机械臂向右移动 2 cm
连续记录整个任务,就会得到:
图像1 → 动作1
图像2 → 动作2
图像3 → 动作3
...
图像N → 动作N
通过大量这样的数据训练后,模型逐渐学会:
在什么场景下应该做什么动作。
这本质上很像:
模仿学习。
机器人通过学习人类示范或者已有控制策略的数据,逐渐获得操作能力。
九、VLA 最大的问题:机器人数据太贵
VLA 虽然很有潜力,但它面临一个非常现实的问题:
数据太少。
互联网中有海量:
- 图片
- 视频
- 文本
因此语言模型和视觉模型可以使用非常庞大的数据集。
但机器人数据不同。
采集一小时机器人数据,需要:
真正让一台机器人运行一小时。
而且过程中可能出现:
- 碰撞
- 抓取失败
- 设备磨损
- 环境重置
- 人工操作
因此机器人数据的成本远高于互联网文本。
这也是为什么现在很多 VLA 方法会采用:
视觉语言模型预训练 + 机器人数据微调
的方式。
也就是说:
先让模型从互联网学会:
“看懂世界”。
然后再使用机器人数据学会:
“怎么行动”。
十、VLA 和强化学习有什么区别?
VLA 和强化学习并不是同一种方法。
强化学习通常是:
机器人执行动作
↓
环境给奖励
↓
继续探索
↓
优化策略
机器人需要不断:
试错。
例如机器人抓到杯子:
Reward = +1
抓取失败:
Reward = 0
然后不断优化策略。
而很多 VLA 主要采用:
模仿学习。
也就是:
别人告诉机器人正确动作
↓
机器人学习正确动作
因此可以简单理解为:
强化学习:自己试。
VLA:先学别人怎么做。
当然,两者也可以结合。
例如:
先用 VLA 学会基本操作。
再通过强化学习进一步优化机器人策略。
这也是非常自然的一条技术路线。
十一、VLA 和世界模型有什么区别?
VLA 更关注:
“现在应该做什么?”
输入当前观察和指令:
当前图像
+
任务
↓
VLA
↓
动作
而世界模型更关注:
“做完这个动作之后会发生什么?”
例如:
当前状态
+
动作
↓
World Model
↓
未来状态
因此可以把两者简单理解为:
VLA 负责:
行动。
世界模型负责:
预测。
未来一个非常重要的发展方向就是:
VLA + World Model。
让机器人不仅能够:
看到场景直接行动。
还可以:
先预测动作结果,再决定是否执行。
这会让机器人控制更加接近人类的决策方式。
十二、VLA 和自动驾驶有什么相似之处?
其实 VLA 的思想并不只适用于机械臂。
例如对于移动机器人:
输入:
摄像头图像
+
“走到门口”
输出:
前进速度
+
转向角速度
对于轮式机器人:
[vx, vy, wz]
对于双足或者轮足机器人,还可以进一步输出:
- 目标速度
- 步态指令
- 高层运动命令
再由底层控制器执行。
因此未来机器人系统很可能形成类似:
VLA
↓
高层动作
↓
强化学习 / MPC / WBC
↓
电机控制
VLA 负责:
理解人类想干什么。
而底层控制器负责:
稳定、快速、安全地把动作执行出来。
十三、VLA 未来会取代传统机器人控制吗?
短期来看,很难。
因为 VLA 更擅长的是:
高层任务理解和动作决策。
但对于非常高速的底层控制,例如:
- 电机力矩控制
- 平衡控制
- 双足行走
- 轮足机器人稳定
- 碰撞响应
仍然需要非常高的控制频率。
VLA 往往不适合直接以几百 Hz、几千 Hz 控制电机。
因此未来更现实的机器人架构可能是:
语言指令
↓
VLA
↓
高层目标
↓
RL / MPC / WBC
↓
关节控制
↓
机器人
不同算法负责不同层级。
VLA 不一定取代传统控制器。
更可能是:
成为机器人最上层的“大脑”。
十四、VLA 真正重要的地方是什么?
VLA 真正带来的变化,并不是简单地:
“用 Transformer 控制机械臂。”
更重要的是:
机器人控制开始从:
专用模型
逐渐走向:
通用模型。
以前:
一个任务
↓
一个程序
以后可能变成:
很多任务
↓
一个通用 VLA
人类只需要告诉机器人:
“帮我把桌面收拾一下。”
机器人就能够:
识别桌面上的物体,
理解哪些是垃圾,
找到垃圾桶,
规划动作,
抓取物体,
然后完成任务。
这种能力才是 VLA 最终希望实现的目标。
十五、总结
最后用三句话理解 VLA。
第一句:
VLA 的全称是:
Vision-Language-Action,视觉—语言—动作模型。
第二句:
它做的事情可以简单理解为:
机器人看到什么 + 人类想让它做什么 → 机器人应该怎么动。
第三句:
VLA 最大的目标是:
让机器人从“一个程序完成一个任务”,逐渐走向“一个模型完成很多任务”。
如果说大语言模型让 AI 学会了:
“听懂人说话。”
视觉语言模型让 AI 学会了:
“看懂这个世界。”
那么 VLA 想做的事情就是:
让 AI 看懂世界、听懂人类,然后真正伸出手去改变这个世界。
这也是 VLA 在具身智能时代最吸引人的地方。