vla 系统学习
VLA 你可以把它理解成机器人里的“看懂 + 听懂 + 直接行动”。
全称是 Vision-Language-Action,中文常叫“视觉-语言-动作模型”。
它和普通 VLM 最大的区别是:VLM 主要负责理解,VLA 还要真的输出动作。
比如你对机器人说:
“把桌上的矿泉水瓶拿给我。”
VLA 的输入可能包括相机图像和你的语言指令,然后模型直接输出一串动作,例如机械臂末端位姿、关节角、夹爪开合等。
可以粗略理解成这条链:
相机图像 + 语言指令
↓
VLA
↓
理解:
“桌上有瓶子”
“用户要我拿瓶子”
↓
决定:
先靠近 → 对准 → 抓住 → 抬起
↓
输出动作
↓
机器人执行
传统机器人通常是模块化的:
语言
↓
LLM / 意图识别
↓
任务规划
↓
目标检测 YOLO
↓
3D定位
↓
抓取点生成
↓
MoveIt / OMPL
↓
控制器
↓
机械臂运动
而 VLA 想做的事情更像:
图像 + 语言
↓
一个大模型
↓
Action
当然,现实工程里通常不会真的把所有传统模块全部扔掉,安全控制、碰撞检测、底层控制等仍然很重要。
你可以拿自动驾驶类比。传统方法可能是:
摄像头
↓
检测车道线
↓
检测车辆
↓
预测车辆轨迹
↓
规划路径
↓
方向盘控制
而端到端 VLA 更希望学习:
摄像头画面
+
“向右转”
↓
模型
↓
方向盘 + 油门 + 刹车
这里最关键的一个概念就是 Action Token / Action Representation。普通大语言模型输出的是文字 token,比如:
"pick"
"up"
"the"
"bottle"
但 VLA 最终需要把动作表示出来,例如:
Δx = +0.02
Δy = -0.01
Δz = +0.03
Δroll
Δpitch
Δyaw
gripper = close
也可能直接输出关节:
q1 q2 q3 q4 q5 q6
所以 VLA 的核心问题之一就是:
怎么把机器人动作变成模型能够预测的“语言”。
你之后会经常看到三类输出方式:连续动作、离散化动作 token,以及 trajectory/chunk,也就是一次预测未来好几步动作。
再往深一点看,VLA 通常可以理解成:
Vision Encoder
↓
把图片变成视觉特征
Language Model
↓
理解任务和场景
Action Head / Action Decoder
↓
把理解结果转成动作
比如输入:
图像:
桌子上有红杯子、蓝瓶子、苹果
语言:
"Pick up the blue bottle."
视觉编码器负责看懂“哪里有什么”,语言模型理解“blue bottle 是目标”,最后 Action Head 输出:
机械臂向左前方移动
↓
下降
↓
对准瓶子
↓
闭合夹爪
↓
抬起
VLA 怎么训练?最容易理解的方法是“模仿人类操作”。
假设收集很多数据:
图像 指令 人类动作
桌上有瓶子 "pick up bottle" 手向瓶子移动
下一帧 "pick up bottle" 手下降
下一帧 "pick up bottle" 夹爪闭合
下一帧 "pick up bottle" 手抬起来
给模型看几百万、几千万段类似数据,它就学习:
在什么画面 + 什么指令下,人类通常采取什么动作。
这就是 Imitation Learning(模仿学习) 的味道。
所以 VLA 和强化学习不是一回事。简单区分:
Imitation Learning:老师怎么做,我跟着学。
Reinforcement Learning:我自己尝试,根据奖励判断做得好不好。
很多机器人模型主要先靠大量示范数据训练,再配合其他方式进一步优化。
另外,VLA 真正厉害的地方不只是“会抓东西”,而是希望获得 泛化能力。
传统抓取程序可能是:
if object == bottle:
执行 bottle_grasp()
换成一个没见过的新水杯可能就不工作了。
VLA 希望做到:
“把能装水的东西拿给我。”
机器人看到:
杯子
瓶子
碗
遥控器
然后通过视觉和语言语义理解,自己选一个合适目标并操作。这也是为什么 VLA 和机器人具身智能关系特别紧。
你以后还会经常看到三个概念:
LLM:Language → Language
VLM:Vision + Language → Language
VLA:Vision + Language → Action
可以这样记:
LLM
会说
↓
VLM
会看 + 会说
↓
VLA
会看 + 会听懂 + 会动
如果放到一个实际机器人项目里,比较现实的架构不是“VLA 完全取代 ROS”,而更可能是:
VLA
┌────────┴────────┐
Camera Instruction
↓
Action / Goal
↓
ROS2
↓
Safety / Collision Check
↓
MoveIt / Controller
↓
Robot
也就是说,VLA 更像“大脑”,ROS2、MoveIt、控制器仍然像神经和肌肉系统。这也是目前学习 VLA 时非常重要的工程视角:不要因为端到端模型很酷,就把机器人运动学、控制和规划都扔掉。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)