技术博客
VLA原理训练

三分钟看懂 VLA:让机器人真正“看懂、听懂、做出来”

LSST2026-08-09 20:13
三分钟看懂 VLA:让机器人真正“看懂、听懂、做出来”

过去几年,大语言模型让 AI 学会了理解文字、回答问题。

多模态模型进一步让 AI 能够:

看图片、看视频、理解语言。

但对于机器人来说,只会“看”和“理解”还远远不够。

机器人最终必须解决一个更现实的问题:

看懂环境、听懂人的指令,然后真正做出动作。

这就是近年来具身智能领域非常热门的一类模型:

VLA——Vision-Language-Action,视觉-语言-动作模型。

简单来说:

VLA 就是让机器人把“看见什么、听到什么”直接转化成“应该怎么动”。


一、什么是 VLA?

VLA 的全称是:

Vision-Language-Action Model

即:

视觉—语言—动作模型。

它通常接收三类信息。

第一类是视觉信息,例如:

  • 摄像头图像
  • 视频
  • 深度图
  • 环境中的物体位置

第二类是语言指令,例如:

“把桌上的红色杯子拿起来。”

第三类则是机器人自身状态,例如:

  • 机械臂关节角度
  • 夹爪状态
  • 末端执行器位置
  • 历史动作

模型综合这些信息后,输出:

机器人下一步应该执行的动作。

整个过程可以简单表示为:

视觉
+
语言
+
机器人状态
↓
VLA
↓
机器人动作

所以 VLA 的核心目标非常直接:

让机器人真正把“理解”转化成“行动”。


二、举个简单例子

假设桌子上有:

  • 一个红苹果
  • 一个香蕉
  • 一个杯子

我们告诉机器人:

“把红苹果放进篮子里。”

机器人首先通过摄像头看到桌面。

VLA 模型需要理解:

红苹果在哪里?

然后理解语言中的:

“红苹果”

和图像中的苹果对应起来。

接着机器人还需要理解:

“放进篮子里”意味着什么。

最后模型输出一系列动作,例如:

机械臂向右移动
↓
向下移动
↓
闭合夹爪
↓
抬起
↓
移动到篮子上方
↓
松开夹爪

这就是一个完整的:

视觉 → 语言理解 → 动作执行

过程。


三、VLA 和大语言模型有什么区别?

大语言模型主要解决的问题是:

输入文字,输出文字。

例如:

“法国的首都在哪里?”
↓
LLM
↓
“巴黎”

而视觉语言模型 VLM 可以进一步处理图片:

图片
+
“桌子上有什么?”
↓
VLM
↓
“桌子上有一个苹果和一个杯子。”

但机器人最终需要的是:

动作。

因此 VLA 在 VLM 的基础上,又增加了一种新的输出:

Action。

可以简单理解为:

LLM
语言 → 语言
VLM
视觉 + 语言 → 语言

而 VLA:

视觉 + 语言 → 动作

这也是 VLA 名字中最后一个字母:

A——Action

最重要的意义。


四、VLA 到底输出什么?

很多人第一次接触 VLA 时会有一个疑问:

模型到底怎样控制机器人?

实际上,VLA 并不是简单输出:

“向前走。”

它通常会输出机器人可以执行的控制量。

例如机械臂末端的位置变化:

Δx = 0.02 m
Δy = -0.01 m
Δz = 0.03 m

或者输出:

  • 关节位置
  • 关节速度
  • 末端位姿
  • 夹爪开合状态

例如:

[x, y, z, roll, pitch, yaw, gripper]

其中前六个变量控制机械臂末端的位置和姿态。

最后一个变量控制:

夹爪打开还是闭合。

因此从本质上来说:

VLA 做的事情,就是把视觉和语言转换成机器人控制信号。


五、什么是 Action Token?

VLA 中还有一个非常有意思的思想:

把动作也变成 Token。

我们知道,大语言模型会把一句话拆成 Token。

例如:

I love robots

可能被拆成多个语言 Token。

而在一些 VLA 中,机器人动作也可以被离散化。

比如:

机械臂向右移动

可以编码成:

<Action_152>

机械臂向上移动则可能对应:

<Action_086>

这样一来,机器人控制问题就变得很像语言生成。

语言模型做的是:

预测下一个文字 Token

而 VLA 可以做:

预测下一个动作 Token

于是原本成熟的大模型技术,就能够迁移到机器人控制中。


六、为什么 VLA 需要“语言”?

很多传统机器人控制其实并不需要语言。

比如工业机械臂通常只执行:

固定轨迹。

那么为什么 VLA 要专门加入 Language?

因为语言可以让机器人拥有:

更强的任务泛化能力。

以前如果我们想让机器人完成:

“拿苹果。”

可能需要专门编写一个程序。

如果换成:

“拿香蕉。”

又要重新调整。

而 VLA 可以直接理解:

“拿苹果”
“拿香蕉”
“把杯子放到桌子左边”
“把绿色积木放到盒子里”

只需要改变自然语言指令。

机器人就可以执行不同任务。

因此语言在这里实际上扮演了:

任务接口

的角色。

也就是说:

人类负责说目标,机器人负责理解并执行。


七、VLA 为什么突然火起来了?

一个非常重要的原因是:

大模型已经证明了“大规模预训练”的能力。

传统机器人控制通常有一个问题:

一个模型只会一个任务。

例如:

模型 A 会抓杯子。

模型 B 会开抽屉。

模型 C 会叠衣服。

而 VLA 想做的事情更接近:

训练一个通用模型,完成很多不同机器人任务。

例如同一个模型可以接受:

“把杯子拿起来”
“打开抽屉”
“把玩具放进盒子”
“把桌面整理干净”

然后根据不同环境生成不同动作。

这和大语言模型的发展路线非常类似。

过去 NLP 更偏向:

一个模型解决一个任务。

而现在:

一个大模型解决很多任务。

机器人领域也正在经历类似的变化。


八、VLA 是怎么训练出来的?

训练 VLA 最关键的数据通常是:

机器人操作轨迹。

一条训练数据可能包含:

图像
+
语言任务
+
机器人动作

例如:

图片:机械臂位于杯子左侧

指令:
“拿起杯子”

动作:
机械臂向右移动 2 cm

连续记录整个任务,就会得到:

图像1 → 动作1

图像2 → 动作2

图像3 → 动作3

...

图像N → 动作N

通过大量这样的数据训练后,模型逐渐学会:

在什么场景下应该做什么动作。

这本质上很像:

模仿学习。

机器人通过学习人类示范或者已有控制策略的数据,逐渐获得操作能力。


九、VLA 最大的问题:机器人数据太贵

VLA 虽然很有潜力,但它面临一个非常现实的问题:

数据太少。

互联网中有海量:

  • 图片
  • 视频
  • 文本

因此语言模型和视觉模型可以使用非常庞大的数据集。

但机器人数据不同。

采集一小时机器人数据,需要:

真正让一台机器人运行一小时。

而且过程中可能出现:

  • 碰撞
  • 抓取失败
  • 设备磨损
  • 环境重置
  • 人工操作

因此机器人数据的成本远高于互联网文本。

这也是为什么现在很多 VLA 方法会采用:

视觉语言模型预训练 + 机器人数据微调

的方式。

也就是说:

先让模型从互联网学会:

“看懂世界”。

然后再使用机器人数据学会:

“怎么行动”。


十、VLA 和强化学习有什么区别?

VLA 和强化学习并不是同一种方法。

强化学习通常是:

机器人执行动作
↓
环境给奖励
↓
继续探索
↓
优化策略

机器人需要不断:

试错。

例如机器人抓到杯子:

Reward = +1

抓取失败:

Reward = 0

然后不断优化策略。

而很多 VLA 主要采用:

模仿学习。

也就是:

别人告诉机器人正确动作
↓
机器人学习正确动作

因此可以简单理解为:

强化学习:自己试。

VLA:先学别人怎么做。

当然,两者也可以结合。

例如:

先用 VLA 学会基本操作。

再通过强化学习进一步优化机器人策略。

这也是非常自然的一条技术路线。


十一、VLA 和世界模型有什么区别?

VLA 更关注:

“现在应该做什么?”

输入当前观察和指令:

当前图像
+
任务
↓
VLA
↓
动作

而世界模型更关注:

“做完这个动作之后会发生什么?”

例如:

当前状态
+
动作
↓
World Model
↓
未来状态

因此可以把两者简单理解为:

VLA 负责:

行动。

世界模型负责:

预测。

未来一个非常重要的发展方向就是:

VLA + World Model。

让机器人不仅能够:

看到场景直接行动。

还可以:

先预测动作结果,再决定是否执行。

这会让机器人控制更加接近人类的决策方式。


十二、VLA 和自动驾驶有什么相似之处?

其实 VLA 的思想并不只适用于机械臂。

例如对于移动机器人:

输入:

摄像头图像
+
“走到门口”

输出:

前进速度
+
转向角速度

对于轮式机器人:

[vx, vy, wz]

对于双足或者轮足机器人,还可以进一步输出:

  • 目标速度
  • 步态指令
  • 高层运动命令

再由底层控制器执行。

因此未来机器人系统很可能形成类似:

VLA
↓
高层动作
↓
强化学习 / MPC / WBC
↓
电机控制

VLA 负责:

理解人类想干什么。

而底层控制器负责:

稳定、快速、安全地把动作执行出来。


十三、VLA 未来会取代传统机器人控制吗?

短期来看,很难。

因为 VLA 更擅长的是:

高层任务理解和动作决策。

但对于非常高速的底层控制,例如:

  • 电机力矩控制
  • 平衡控制
  • 双足行走
  • 轮足机器人稳定
  • 碰撞响应

仍然需要非常高的控制频率。

VLA 往往不适合直接以几百 Hz、几千 Hz 控制电机。

因此未来更现实的机器人架构可能是:

语言指令
↓
VLA
↓
高层目标
↓
RL / MPC / WBC
↓
关节控制
↓
机器人

不同算法负责不同层级。

VLA 不一定取代传统控制器。

更可能是:

成为机器人最上层的“大脑”。


十四、VLA 真正重要的地方是什么?

VLA 真正带来的变化,并不是简单地:

“用 Transformer 控制机械臂。”

更重要的是:

机器人控制开始从:

专用模型

逐渐走向:

通用模型。

以前:

一个任务
↓
一个程序

以后可能变成:

很多任务
↓
一个通用 VLA

人类只需要告诉机器人:

“帮我把桌面收拾一下。”

机器人就能够:

识别桌面上的物体,

理解哪些是垃圾,

找到垃圾桶,

规划动作,

抓取物体,

然后完成任务。

这种能力才是 VLA 最终希望实现的目标。


十五、总结

最后用三句话理解 VLA。

第一句:

VLA 的全称是:

Vision-Language-Action,视觉—语言—动作模型。

第二句:

它做的事情可以简单理解为:

机器人看到什么 + 人类想让它做什么 → 机器人应该怎么动。

第三句:

VLA 最大的目标是:

让机器人从“一个程序完成一个任务”,逐渐走向“一个模型完成很多任务”。

如果说大语言模型让 AI 学会了:

“听懂人说话。”

视觉语言模型让 AI 学会了:

“看懂这个世界。”

那么 VLA 想做的事情就是:

让 AI 看懂世界、听懂人类,然后真正伸出手去改变这个世界。

这也是 VLA 在具身智能时代最吸引人的地方。

点赞收藏
// 评论0
0 / 500
还没有评论,快来抢沙发