VLA 你可以把它理解成机器人里的“看懂 + 听懂 + 直接行动”。

全称是 Vision-Language-Action,中文常叫“视觉-语言-动作模型”。

它和普通 VLM 最大的区别是:VLM 主要负责理解,VLA 还要真的输出动作。

比如你对机器人说:

“把桌上的矿泉水瓶拿给我。”

VLA 的输入可能包括相机图像和你的语言指令,然后模型直接输出一串动作,例如机械臂末端位姿、关节角、夹爪开合等。

可以粗略理解成这条链:

相机图像 + 语言指令
        ↓
      VLA
        ↓
理解:
“桌上有瓶子”
“用户要我拿瓶子”
        ↓
决定:
先靠近 → 对准 → 抓住 → 抬起
        ↓
输出动作
        ↓
机器人执行

传统机器人通常是模块化的:

语言
 ↓
LLM / 意图识别
 ↓
任务规划
 ↓
目标检测 YOLO
 ↓
3D定位
 ↓
抓取点生成
 ↓
MoveIt / OMPL
 ↓
控制器
 ↓
机械臂运动

而 VLA 想做的事情更像:

图像 + 语言
     ↓
一个大模型
     ↓
Action

当然,现实工程里通常不会真的把所有传统模块全部扔掉,安全控制、碰撞检测、底层控制等仍然很重要。

你可以拿自动驾驶类比。传统方法可能是:

摄像头
↓
检测车道线
↓
检测车辆
↓
预测车辆轨迹
↓
规划路径
↓
方向盘控制

而端到端 VLA 更希望学习:

摄像头画面
+
“向右转”
↓
模型
↓
方向盘 + 油门 + 刹车

这里最关键的一个概念就是 Action Token / Action Representation。普通大语言模型输出的是文字 token,比如:

"pick"
"up"
"the"
"bottle"

但 VLA 最终需要把动作表示出来,例如:

Δx = +0.02
Δy = -0.01
Δz = +0.03

Δroll
Δpitch
Δyaw

gripper = close

也可能直接输出关节:

q1 q2 q3 q4 q5 q6

所以 VLA 的核心问题之一就是:

怎么把机器人动作变成模型能够预测的“语言”。

你之后会经常看到三类输出方式:连续动作、离散化动作 token,以及 trajectory/chunk,也就是一次预测未来好几步动作。

再往深一点看,VLA 通常可以理解成:

Vision Encoder
     ↓
把图片变成视觉特征

Language Model
     ↓
理解任务和场景

Action Head / Action Decoder
     ↓
把理解结果转成动作

比如输入:

图像:
桌子上有红杯子、蓝瓶子、苹果

语言:
"Pick up the blue bottle."

视觉编码器负责看懂“哪里有什么”,语言模型理解“blue bottle 是目标”,最后 Action Head 输出:

机械臂向左前方移动
↓
下降
↓
对准瓶子
↓
闭合夹爪
↓
抬起

VLA 怎么训练?最容易理解的方法是“模仿人类操作”。

假设收集很多数据:

图像                  指令                 人类动作

桌上有瓶子      "pick up bottle"       手向瓶子移动
下一帧          "pick up bottle"       手下降
下一帧          "pick up bottle"       夹爪闭合
下一帧          "pick up bottle"       手抬起来

给模型看几百万、几千万段类似数据,它就学习:

在什么画面 + 什么指令下,人类通常采取什么动作。

这就是 Imitation Learning(模仿学习) 的味道。

所以 VLA 和强化学习不是一回事。简单区分:

Imitation Learning:老师怎么做,我跟着学。
Reinforcement Learning:我自己尝试,根据奖励判断做得好不好。

很多机器人模型主要先靠大量示范数据训练,再配合其他方式进一步优化。

另外,VLA 真正厉害的地方不只是“会抓东西”,而是希望获得 泛化能力

传统抓取程序可能是:

if object == bottle:
    执行 bottle_grasp()

换成一个没见过的新水杯可能就不工作了。

VLA 希望做到:

“把能装水的东西拿给我。”

机器人看到:

杯子
瓶子
碗
遥控器

然后通过视觉和语言语义理解,自己选一个合适目标并操作。这也是为什么 VLA 和机器人具身智能关系特别紧。

你以后还会经常看到三个概念:

LLM:Language → Language
VLM:Vision + Language → Language
VLA:Vision + Language → Action

可以这样记:

LLM
会说
↓

VLM
会看 + 会说
↓

VLA
会看 + 会听懂 + 会动

如果放到一个实际机器人项目里,比较现实的架构不是“VLA 完全取代 ROS”,而更可能是:

              VLA
      ┌────────┴────────┐
    Camera            Instruction
      ↓
   Action / Goal
      ↓
     ROS2
      ↓
Safety / Collision Check
      ↓
MoveIt / Controller
      ↓
Robot

也就是说,VLA 更像“大脑”,ROS2、MoveIt、控制器仍然像神经和肌肉系统。这也是目前学习 VLA 时非常重要的工程视角:不要因为端到端模型很酷,就把机器人运动学、控制和规划都扔掉。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐