这两年机器人公司招算法人才时,一个很明显的现象是:JD里的关键词越来越多。

VLA、World Model、强化学习、模仿学习、多模态、Diffusion Policy、Sim2Real、Whole-Body Control……很多岗位甚至会把这些词同时写进去。

但从招聘角度看,真正麻烦的地方恰恰在这里:VLA、世界模型和强化学习不是三个可以简单一一对应的岗位名称。

如果企业只是按照关键词搜简历,很容易出现两种情况:要么找到一批“论文方向很匹配、机器人经验很弱”的候选人;要么JD写得太宽,最后连自己到底要什么人都说不清楚。

机器人公司真正需要先回答的是:现在最想解决的机器人问题是什么?


一、先别急着招人,VLA、世界模型、强化学习解决的问题并不一样

可以先用一个比较简单的方式理解。

方向核心问题企业真正需要的能力
VLA机器人看到指令后,应该做什么动作多模态理解、Policy Learning、模仿学习、机器人数据、真机部署
世界模型做这个动作以后,环境会发生什么状态预测、视频预测、动力学建模、生成模型、规划
强化学习怎样通过反馈学到更好的策略Policy Optimization、Reward设计、仿真训练、Sim2Real

VLA更偏向“从感知和语言直接走向动作”。

世界模型更关注“理解环境变化,并预测未来”。

强化学习则解决“通过交互和反馈优化策略”。

所以机器人公司不能简单地说:“我们现在缺一个世界模型工程师。”

更重要的问题是:

  • 你希望这个人做机器人操作?
  • 做导航?
  • 做人形机器人运控?
  • 做长时序任务规划?
  • 还是解决真机策略优化?

目标不同,对候选人的背景要求完全不同。


二、招VLA,不要只盯着“大模型人才”

这是现在最容易出现的招聘误区之一。

很多企业看到VLA,就会优先去找做VLM、多模态大模型或者LLM的人。

这当然是重要人才来源,但并不意味着对方一定能直接做机器人VLA。

因为真正的VLA通常需要经历:

机器人数据 → 数据清洗 → 模型训练 → Policy输出 → 真机部署 → Evaluation → 数据回流。

这里面至少涉及三种能力:

一类是多模态模型能力,例如视觉、语言、Transformer、VLM;

一类是机器人学习能力,例如Behavior Cloning、Imitation Learning、Diffusion Policy、Action Chunking等;

还有一类往往最容易被忽略:机器人本体和真机闭环经验。

一个候选人可能非常懂多模态模型,但如果没有处理过机器人action space、控制频率、轨迹执行、数据采集、相机标定以及真机部署,进入机器人公司以后依然存在很长的适应周期。

所以真正稀缺的VLA候选人,往往不是纯大模型研究人员,而是:

既懂多模态模型,又真正把Policy跑到机器人上的人。

招聘时可以重点追问:

你的模型最终输出什么?
Action是关节位置、末端位姿还是其他表示?
数据是怎么采集的?
真机成功率是多少?
失败案例主要来自模型、数据还是控制?

这几道问题,基本就能快速判断候选人的项目到底做到了哪一层。


三、招世界模型,企业最容易把“视频生成”和“机器人世界模型”混在一起

世界模型现在很热,但这个岗位实际上比VLA更容易定义模糊。

因为“World Model”可以对应很多技术方向:

视频预测、状态预测、latent dynamics、生成模型、机器人动力学预测、规划模型,甚至有人把一部分环境建模也归入世界模型。

所以招聘时最重要的不是候选人简历上有没有写“World Model”,而是看他到底建模的是什么。

比如:

输入是什么?输出是什么?模型预测的是像素、状态还是动作之后的未来?

如果机器人执行一个动作,模型能不能预测环境下一步怎么变化?

预测结果是否真正参与Planning或者Policy决策?

这才是机器人场景里的关键。

比较常见的人才来源包括视频生成、多模态、自动驾驶预测规划、强化学习、model-based RL以及机器人学习团队。

这里有一个比较典型的招聘逻辑:

企业如果只是想做视觉预测,可以找生成模型人才;如果希望世界模型真正参与机器人决策,就要增加机器人学习、规划甚至强化学习背景。

越往后者走,人才数量会明显下降。


四、强化学习岗位,一定要先区分“机器人学习”和“运动控制”

机器人行业提到强化学习,其实至少有两条完全不同的人才路线。

第一条是Manipulation/机器人操作方向。

常见关键词包括:

PPO、SAC、Imitation Learning、Offline RL、Dexterous Manipulation、Reward Model、VLA。

这一类人才可能做机械臂抓取、灵巧操作、长时序任务或者策略优化。

另一条则是现在人形机器人非常热门的:

强化学习 + 运动控制。

这类候选人的技能栈往往完全不同。

除了PPO、RL,还需要理解:

机器人动力学、Whole-Body Control、MPC、接触约束、轨迹跟踪、Sim2Real。

比如一个候选人能够训练出humanoid locomotion policy,不代表他一定能做机械臂VLA。

同样,一个做VLA操作策略的人,也未必能够解决人形机器人的稳定行走和全身控制。

所以企业如果只写:

“强化学习算法工程师”

这个JD其实信息量非常低。

最好直接拆成:

强化学习运动控制工程师

或者:

具身智能强化学习算法工程师

这样人才画像会准确很多。


五、真正难招的,是这三个方向开始交叉以后的人

单独会VLA的人,现在市场上已经开始增加。

单独做强化学习的人,也并不少。

真正稀缺的是:

VLA + RL

World Model + Planning

RL + WBC + Sim2Real

以及更进一步的:

VLA + World Model + RL + Robot System

为什么?

因为机器人最终并不关心你属于哪个算法方向。

它关心的是一件事情:

这个系统到底能不能让机器人完成任务。

例如机器人执行一个“把桌上的杯子拿到厨房”的任务,背后可能同时涉及:

视觉语言理解 → 高层任务规划 → 动作策略 → 环境反馈 → 策略调整 → 底层控制。

VLA负责理解和产生动作;

世界模型可能参与预测未来状态;

强化学习优化策略;

最终还需要控制系统真正把动作执行出来。

所以越往真实机器人系统走,岗位边界反而会越来越模糊。


六、机器人公司招聘这类人才,我更建议看“四层能力”

企业面试VLA、世界模型和强化学习候选人,可以不用一上来就问论文,而是先判断四层能力。

第一层:模型能力

Transformer、VLM、Diffusion、RL、生成模型这些基本能力是否扎实。

这是算法基础。

第二层:机器人能力

有没有机器人学基础,是否理解机械臂、移动机器人、人形机器人以及action space、坐标系、控制接口等问题。

第三层:真机能力

有没有真正部署过机器人。

有没有碰到过:

延迟、噪声、摩擦、控制周期、执行器限制、相机误差、通信异常、数据分布变化。

这一层往往最能拉开候选人差距。

第四层:闭环能力

有没有经历过完整的:

Data → Training → Deployment → Evaluation → Data Feedback。

真正成熟的机器人学习人才,往往不是只负责Training这一段。


七、猎头找这类人,也不能只靠岗位关键词

如果只搜:

“VLA算法工程师”

“世界模型算法工程师”

“强化学习算法工程师”

能够找到的人其实非常有限。

真正做Talent Mapping的时候,反而需要根据技术来源去找。

比如VLA人才,可以往机器人学习、多模态、大模型、视觉语言模型、模仿学习团队找;

世界模型人才,可以从视频生成、自动驾驶预测、model-based RL、多模态生成等团队寻找;

强化学习运动控制,则可以往人形机器人、四足机器人、无人机、机器人控制甚至部分自动驾驶控制团队扩。

猎头真正有价值的地方,不是知道岗位叫什么,而是知道这类能力可能藏在哪些团队里。

这也是现在具身智能招聘和传统算法招聘最大的区别之一。


我的一个判断

接下来机器人算法招聘会出现一个很明显的变化:

岗位名称会越来越细,但真正值钱的人反而越来越“跨界”。

纯VLA、纯世界模型、纯强化学习都还会存在,但企业真正愿意给高薪争抢的,往往是能够把几层能力连接起来的人。

比如:

  • 多模态 + Policy + Robot Data
  • World Model + Planning + RL
  • RL + Dynamics + WBC + Sim2Real
  • VLA + Manipulation + 真机部署

未来真正稀缺的机器人算法人才,可能越来越难用一个岗位名称定义。

因为企业真正想招的,并不是“会某一种模型的人”。

而是能够把模型、数据、策略和机器人真正连成闭环的人。

这也是现在做VLA、世界模型和强化学习招聘时,最应该先想明白的一件事。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐