什么是 VLA?什么是 WAM?二者区别是什么?
什么是 VLA?什么是 WAM?二者区别是什么?
标准答案
VLA(Vision-Language-Action)是条件策略模型:
输入:
Image
Language
Robot State
输出:
Action
例如:
π(a|I,L,s)
主要学习:
observation → action
例如 OpenVLA、RT-2、π0 等。
World Action Model(WAM)
不仅预测 action,
还学习:
future observation
future latent
future reward
future state
也就是说:
state
↓
World Model
↓
future latent
↓
policy
因此:
WAM 更偏:
Learn dynamics
VLA 更偏:
Learn policy
一句话总结:
VLA 学的是"怎么做",WAM 学的是"世界会怎样变化"。
第二题(100%)
为什么要把 VLM 和 Action 解耦训练?
这是 JD 第一条。
很多人会答:
"方便训练。"
太浅。
标准答案:
主要四个原因:
① VLM 参数太大。
例如:
7B
13B
72B
机器人数据:
只有几十万 trajectory
容易过拟合。
② Vision 可以共享。
机器人动作不同:
抓取
装配
搬运
Vision 不需要每次重新训练。
③ Action head 很小。
例如:
Vision
↓
Frozen
↓
Action Decoder
LoRA 就可以训练。
④ 训练效率。
例如:
只训练:
5M parameter
而不是:
7B parameter
训练快很多。
第三题(★★★★★)
为什么 LoRA 很适合机器人?
标准答案:
机器人:
数据少。
几十万 trajectory。
远远小于:
LLM:
1T token
因此:
训练:
ΔW
即可。
LoRA:
W'=W+BA
只更新:
A
B
优势:
- 显存小
- 收敛快
- 不容易灾难遗忘
- 一个 Vision Backbone 可以对应多个 Robot
第四题(★★★★★)
BC 为什么不能解决机器人?
标准答案:
BC:
π(a|o)
训练:
expert
推理:
机器人自己执行。
问题:
distribution shift。
例如:
训练:
一直正确
部署:
抓偏2cm
后面:
全部 OOD。
误差不断积累。
因此:
BC:
适合:
短任务。
RL:
负责:
Recovery。
第五题(★★★★★)
BC + RL 怎么结合?
标准答案:
工业里面一般:
Expert Demo
↓
Behavior Cloning
↓
Offline RL
↓
Online RL
↓
Robot
BC:
负责:
初始化。
RL:
负责:
探索。
最后:
Fine-tune。
这是现在工业界最常见路线。
第二部分 Mujoco / ManiSkill
第六题
Mujoco 和 ManiSkill 有什么区别?
标准答案:
Mujoco:
物理引擎。
负责:
Physics
例如:
- Contact
- Dynamics
- Joint
ManiSkill:
建立在:
SAPIEN
之上的机器人 Benchmark。最新 ManiSkill 3 强调 GPU 并行仿真、GPU 并行渲染和高吞吐数据采集,可大规模生成 RGB-D、分割等数据。
提供:
- Panda
- Xmate
- Mobile Manipulation
以及:
PickCube
PegInsertion
OpenCabinet
等任务。
一句话:
Mujoco
=
Physics
ManiSkill
=
机器人训练平台
第七题
Domain Randomization 为什么重要?
标准答案:
Simulation:
Lighting
Texture
Mass
Friction
Camera
Noise
全部随机。
这样:
Policy:
不会:
Overfit
仿真。
真机:
成功率更高。
第八题
Sim2Real 最大问题是什么?
标准答案:
四类:
① Dynamics Gap
摩擦。
惯量。
② Visual Gap
光照。
纹理。
③ Sensor Gap
Depth Noise。
Latency。
④ Control Gap
Controller。
Delay。
第三部分 强化学习
第九题
PPO 为什么工业机器人越来越少?
标准答案:
PPO:
On-policy。
需要:
大量采样。
机器人:
采样:
太贵。
因此:
更多:
SAC
TD3
Offline RL
第十题
SAC 为什么适合机器人?
标准答案:
因为:
Off-policy。
Replay Buffer。
Sample Efficient。
连续动作。
适合:
Manipulator。
第十一题
Offline RL 和 BC 最大区别?
标准答案:
BC:
只模仿。
Offline RL:
还有:
Reward。
Q Function。
Value Function。
因此:
可以:
超过 Expert。
第四部分 VLA
第十二题
Action Space 怎么设计?
优秀答案:
常见:
Joint
EE Pose
Delta Pose
Velocity
工业:
更喜欢:
Δx
Δy
Δz
ΔR
Gripper
第十三题
为什么 ACT 能成功?
标准答案:
Action Chunk。
一次:
预测:
20
50
100
步。
Temporal Smooth。
减少:
Jitter。
第十四题
为什么 Chunk 太长不好?
标准答案:
未来:
越来越不确定。
Observation:
失效。
因此:
工业:
Rolling Horizon。
不断:
重新预测。
第五部分 数据闭环
第十五题
数据闭环怎么做?
标准答案:
Robot
↓
Failure
↓
Replay
↓
Filter
↓
Label
↓
Train
↓
Deploy
工业:
重点不是:
Collect。
而是:
Collect Failure。
第十六题
哪些数据最有价值?
优秀答案:
不是:
Success。
而是:
Almost Success
Recovery
Failure
这些:
Information Density。
最高。
第六部分 真机
第十七题
为什么仿真95%,真机50%?
标准答案:
四个:
Calibration
Latency
Controller
Contact
第十八题
插销任务为什么难?
标准答案:
因为:
Contact Rich。
Position Error:
只有:
1 mm。
都会失败。
必须:
Force。
Compliance。
第十九题
机器人怎么判断抓成功?
优秀答案:
融合:
Vision
Force
Gripper Width
Motor Current
不是:
Close()
就是:
Success。
第二十题(开放题)
如果让你设计整个系统?
优秀答案:
Demo
↓
Dataset
↓
BC
↓
Offline RL
↓
Sim
↓
Domain Randomization
↓
Real Robot
↓
Failure Collection
↓
Retrain
↓
Deploy
最后一题(代码题)
他们很可能会让你:
现场:
写:
PyTorch:
BC。
例如:
obs = encoder(image)
action = policy(obs)
loss = F.mse_loss(action, expert_action)
loss.backward()
或者:
问:
DDP:
怎么启动。
LoRA:
怎么插。
Gradient Checkpoint:
为什么省显存。
我建议你重点准备的论文(基本覆盖面试)
如果只有一天时间,我建议按下面优先级:
- ACT(Action Chunking Transformer) —— 行为克隆、Action Chunk、Temporal Ensemble。
- OpenVLA —— VLM + Action Head、LoRA、机器人基础模型。
- RT-2 —— Vision-Language-Action,把视觉语言知识迁移到机器人控制。
- Diffusion Policy —— 扩散模型生成连续动作轨迹。
- ManiSkill 3 —— GPU 并行机器人仿真、数据采集与 Benchmark。
- SAC(Soft Actor-Critic) —— 工业机器人中最常见的连续控制 RL 算法。
- Offline RL(CQL、IQL 等) —— 机器人离线强化学习的主流方向。
我的判断:这家公司更像是在招机器人 Foundation Model 工程师,而不是传统的机器人算法工程师。他们最看重的不是“你会不会 PPO”,而是你是否能把 VLM → BC → Offline RL → Mujoco/ManiSkill → Sim2Real → 真机闭环这一整条链路串起来,并且能解释每个环节为什么这样设计、出了问题如何定位和优化。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)