什么是 VLA?什么是 WAM?二者区别是什么?

标准答案

VLA(Vision-Language-Action)是条件策略模型:

输入:


Image
Language
Robot State

输出:


Action

例如:


π(a|I,L,s)

主要学习:

observation → action

例如 OpenVLA、RT-2、π0 等。


World Action Model(WAM)

不仅预测 action,

还学习:


future observation
future latent
future reward
future state

也就是说:


state
 ↓
World Model
 ↓
future latent
 ↓
policy

因此:

WAM 更偏:

Learn dynamics

VLA 更偏:

Learn policy

一句话总结:

VLA 学的是"怎么做",WAM 学的是"世界会怎样变化"。


第二题(100%)

为什么要把 VLM 和 Action 解耦训练?

这是 JD 第一条。

很多人会答:

"方便训练。"

太浅。

标准答案:

主要四个原因:

① VLM 参数太大。

例如:


7B
13B
72B

机器人数据:


只有几十万 trajectory

容易过拟合。


② Vision 可以共享。

机器人动作不同:


抓取

装配

搬运

Vision 不需要每次重新训练。


③ Action head 很小。

例如:


Vision
 ↓
Frozen
 ↓
Action Decoder

LoRA 就可以训练。


④ 训练效率。

例如:

只训练:


5M parameter

而不是:


7B parameter

训练快很多。


第三题(★★★★★)

为什么 LoRA 很适合机器人?

标准答案:

机器人:

数据少。

几十万 trajectory。

远远小于:

LLM:


1T token

因此:

训练:


ΔW

即可。

LoRA:


W'=W+BA

只更新:


A
B

优势:

  • 显存小
  • 收敛快
  • 不容易灾难遗忘
  • 一个 Vision Backbone 可以对应多个 Robot

第四题(★★★★★)

BC 为什么不能解决机器人?

标准答案:

BC:


π(a|o)

训练:


expert

推理:

机器人自己执行。

问题:

distribution shift。

例如:

训练:


一直正确

部署:


抓偏2cm

后面:

全部 OOD。

误差不断积累。

因此:

BC:

适合:

短任务。

RL:

负责:

Recovery。


第五题(★★★★★)

BC + RL 怎么结合?

标准答案:

工业里面一般:


Expert Demo
 ↓
Behavior Cloning
 ↓
Offline RL
 ↓
Online RL
 ↓
Robot

BC:

负责:

初始化。

RL:

负责:

探索。

最后:

Fine-tune。

这是现在工业界最常见路线。


第二部分 Mujoco / ManiSkill

第六题

Mujoco 和 ManiSkill 有什么区别?

标准答案:

Mujoco:

物理引擎。

负责:


Physics

例如:

  • Contact
  • Dynamics
  • Joint

ManiSkill:

建立在:


SAPIEN

之上的机器人 Benchmark。最新 ManiSkill 3 强调 GPU 并行仿真、GPU 并行渲染和高吞吐数据采集,可大规模生成 RGB-D、分割等数据。

提供:

  • Panda
  • Xmate
  • Mobile Manipulation

以及:


PickCube

PegInsertion

OpenCabinet

等任务。

一句话:


Mujoco
=
Physics

ManiSkill
=
机器人训练平台

第七题

Domain Randomization 为什么重要?

标准答案:

Simulation:


Lighting

Texture

Mass

Friction

Camera

Noise

全部随机。

这样:

Policy:

不会:


Overfit

仿真。

真机:

成功率更高。


第八题

Sim2Real 最大问题是什么?

标准答案:

四类:

① Dynamics Gap

摩擦。

惯量。

② Visual Gap

光照。

纹理。

③ Sensor Gap

Depth Noise。

Latency。

④ Control Gap

Controller。

Delay。


第三部分 强化学习

第九题

PPO 为什么工业机器人越来越少?

标准答案:

PPO:

On-policy。

需要:

大量采样。

机器人:

采样:

太贵。

因此:

更多:


SAC

TD3

Offline RL

第十题

SAC 为什么适合机器人?

标准答案:

因为:

Off-policy。

Replay Buffer。

Sample Efficient。

连续动作。

适合:

Manipulator。


第十一题

Offline RL 和 BC 最大区别?

标准答案:

BC:

只模仿。

Offline RL:

还有:

Reward。

Q Function。

Value Function。

因此:

可以:

超过 Expert。


第四部分 VLA

第十二题

Action Space 怎么设计?

优秀答案:

常见:


Joint

EE Pose

Delta Pose

Velocity

工业:

更喜欢:


Δx

Δy

Δz

ΔR

Gripper

第十三题

为什么 ACT 能成功?

标准答案:

Action Chunk。

一次:

预测:


20

50

100

步。

Temporal Smooth。

减少:

Jitter。


第十四题

为什么 Chunk 太长不好?

标准答案:

未来:

越来越不确定。

Observation:

失效。

因此:

工业:

Rolling Horizon。

不断:

重新预测。


第五部分 数据闭环

第十五题

数据闭环怎么做?

标准答案:


Robot
 ↓
Failure
 ↓
Replay
 ↓
Filter
 ↓
Label
 ↓
Train
 ↓
Deploy

工业:

重点不是:

Collect。

而是:

Collect Failure。


第十六题

哪些数据最有价值?

优秀答案:

不是:

Success。

而是:


Almost Success

Recovery

Failure

这些:

Information Density。

最高。


第六部分 真机

第十七题

为什么仿真95%,真机50%?

标准答案:

四个:


Calibration

Latency

Controller

Contact

第十八题

插销任务为什么难?

标准答案:

因为:

Contact Rich。

Position Error:

只有:

1 mm。

都会失败。

必须:

Force。

Compliance。


第十九题

机器人怎么判断抓成功?

优秀答案:

融合:


Vision

Force

Gripper Width

Motor Current

不是:


Close()

就是:

Success。


第二十题(开放题)

如果让你设计整个系统?

优秀答案:


Demo
 ↓
Dataset

 ↓
BC

 ↓
Offline RL

 ↓
Sim

 ↓
Domain Randomization

 ↓
Real Robot

 ↓
Failure Collection

 ↓
Retrain

 ↓
Deploy

最后一题(代码题)

他们很可能会让你:

现场:

写:

PyTorch:

BC。

例如:


obs = encoder(image)

action = policy(obs)

loss = F.mse_loss(action, expert_action)

loss.backward()

或者:

问:

DDP:

怎么启动。

LoRA:

怎么插。

Gradient Checkpoint:

为什么省显存。


我建议你重点准备的论文(基本覆盖面试)

如果只有一天时间,我建议按下面优先级:

  1. ACT(Action Chunking Transformer) —— 行为克隆、Action Chunk、Temporal Ensemble。
  2. OpenVLA —— VLM + Action Head、LoRA、机器人基础模型。
  3. RT-2 —— Vision-Language-Action,把视觉语言知识迁移到机器人控制。
  4. Diffusion Policy —— 扩散模型生成连续动作轨迹。
  5. ManiSkill 3 —— GPU 并行机器人仿真、数据采集与 Benchmark。
  6. SAC(Soft Actor-Critic) —— 工业机器人中最常见的连续控制 RL 算法。
  7. Offline RL(CQL、IQL 等) —— 机器人离线强化学习的主流方向。

我的判断:这家公司更像是在招机器人 Foundation Model 工程师,而不是传统的机器人算法工程师。他们最看重的不是“你会不会 PPO”,而是你是否能把 VLM → BC → Offline RL → Mujoco/ManiSkill → Sim2Real → 真机闭环这一整条链路串起来,并且能解释每个环节为什么这样设计、出了问题如何定位和优化。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐