这两年我做机器人招聘,见过最容易写错的岗位之一,就是具身智能算法工程师

很多JD看起来都差不多:

熟悉强化学习、VLA、多模态、ROS、MuJoCo、Isaac Sim,有真机经验优先。

问题是,这里面其实混了至少四种完全不同的人。

有人负责让机器人听懂任务;有人负责让机器人站稳、走稳;有人专门解决仿真一切正常、上真机就出问题;还有一批人几乎天天在处理遥操作、数据清洗和训练数据质量。

所以企业招聘具身智能算法工程师,第一件事不是找人,而是先回答:

你到底希望这个人负责机器人的哪一段能力?

如果这个问题没说清楚,HR搜再多简历都没有意义。


一、具身智能算法工程师,和传统AI算法工程师差在哪?

最大的区别很简单:

传统AI的结果大多停留在数字世界,具身智能最后一定要落到机器人动作上。

一个大模型回答错一句话,最多重新生成。

机器人判断错了,可能直接出现:

  • 手没有抓住物体;
  • 关节动作超限;
  • 双足失去平衡;
  • 机械臂撞到环境;
  • 策略在仿真里有效,上真机却完全失效。

所以具身算法真正难的地方,不只是模型精度,而是同时处理:

视觉、语言、机器人状态、动作、实时控制和物理环境。

RT-2最早把这类模型称为Vision-Language-Action Model:输入视觉和语言,同时输出能够真正驱动机器人的动作;后来的OpenVLA等工作进一步把VLA训练扩展到大量真实机器人示范数据上。

但这里很容易产生一个误区:

不是所有具身智能算法工程师都在做VLA。

现在企业招聘里,这个岗位至少应该拆成下面四类。

在这里插入图片描述

二、第一类:具身大脑——VLA、世界模型到底在干什么?

这一类最接近现在大家讨论的“机器人基础模型”。

工作目标不是“让机器人会聊天”

而是让机器人能够:

看见环境 → 理解人的指令 → 判断应该做什么 → 输出动作。

比如用户说:

“把桌上的红色杯子收进柜子。”

机器人不是识别出“杯子”就结束了。

它还要知道:

  • 哪个杯子是目标;
  • 柜子在哪里;
  • 门是否需要先打开;
  • 手应该从什么方向靠近;
  • 抓住以后怎么移动;
  • 中间失败以后怎么办。

VLA工程师日常真正做什么?

通常包括:

  • 视觉、语言、机器人状态数据对齐;
  • Action Token或连续动作表示设计;
  • VLA预训练与后训练;
  • 多机器人数据混合训练;
  • 长序列任务训练;
  • 模型评测;
  • 真机Fine-tuning;
  • 推理速度与部署优化。

这类工程师和传统LLM工程师最大的差别,是动作不是文本答案

模型多输出一个错误Token可能只是语义问题,机器人动作误差最终会进入关节和末端执行器。

所以招聘VLA人才,我最关心的一句话不是:

“做过多大的模型?”

而是:

“你的模型最后有没有真正上机器人?”

只做过VLM、多模态理解,与真正做过Robot Policy,不是一类经验。

三、第二类:具身“小脑”——WBC、MPC和强化学习的人在干什么?

如果说大脑解决的是:

“我要干什么?”

小脑更接近解决:

“这台机器人到底怎么把动作稳定做出来?”

人形机器人要走路、转身、下蹲、受到外力后恢复平衡,背后大量工作都在运动控制。

常见路线包括:

  • WBC(Whole-Body Control);
  • MPC(Model Predictive Control);
  • 强化学习RL;
  • 动力学建模;
  • 状态估计;
  • 步态规划;
  • 接触控制。

这类人每天处理的问题很“物理”

比如:

机器人一抬腿就开始晃。

原因可能不是算法“不会走路”,而是:

  • 质心模型不准;
  • 足底接触状态判断错;
  • 编码器有噪声;
  • 电机实际扭矩和模型不一致;
  • 控制周期抖动;
  • 地面摩擦系数发生变化。

所以运控工程师最大的分水岭,是真机经验

会PPO、SAC当然重要,但真正经历过机器人摔倒、振荡、关节超限,然后一点一点把问题查出来的人,价值完全不同。

现在Isaac Lab已经能够大规模并行训练人形机器人、机械臂等策略,并支持强化学习和模仿学习;但仿真工具解决的是训练效率,并不会自动解决真实硬件误差。

招聘时不要把两种人混掉

候选人 更适合什么岗位
强化学习论文很多,但没有真机 仿真训练、策略研究
熟悉动力学、WBC/MPC 传统运控与系统控制
RL+双足真机调试 学习型运动控制
控制+本体+系统调试经验 运控Leader/系统负责人

“会强化学习”和“能把双足机器人调稳”之间,还有很长一段工程距离。

四、第三类:Sim2Real——专门处理“仿真里很好,上真机就不行”

Sim2Real是现在具身智能招聘中特别容易被滥用的一个词。

JD写:

“有Isaac Sim或MuJoCo经验优先。”

这最多证明候选人使用过仿真平台。

MuJoCo本身是面向机器人接触动力学、控制、状态估计和系统辨识等任务的物理引擎;真正的Sim2Real工作,则要继续处理模型和真实机器之间的差异。

什么差异?

非常具体:

  • 电机输出和仿真模型不完全一样;
  • 减速器存在回差和摩擦;
  • 编码器存在噪声;
  • 通信有延迟;
  • 机器人质量、惯量存在制造误差;
  • 地面接触条件变化;
  • 传感器会漂;
  • 硬件版本还会不断修改。

所以一个真正做过Sim2Real的人,你问:

“仿真成功率很高,上真机以后腿一直抖,你从哪里开始查?”

他不会只回答:

“增加Domain Randomization。”

而会继续追:

硬件版本、系统辨识、控制频率、观测延迟、关节参数、摩擦、状态估计。

这才是真正的工程经验。

关于“零飞车、零摔机”

行业里经常这样讲,但招聘时不要把它当成技术标准。

Sim2Real真正追求的是:

尽量缩小Reality Gap,并建立安全、可复现的真机部署方法。

不是谁能保证机器人永远不摔。

五、第四类:具身数据——现在越来越重要,却最容易被HR忽略

现在很多企业说:

“我们准备做VLA。”

我通常会继续问一句:

“你们的数据谁负责?”

如果没有答案,后面的模型招聘大概率也会有问题。

VLA和模仿学习不是凭空训练出来的。

机器人得先有人教。

目前比较常见的数据来源包括:

  • 主从遥操作;
  • VR遥操作;
  • 动捕;
  • 人类示范;
  • 真机自主运行数据;
  • 仿真及合成数据。

数据算法工程师具体在干什么?

不是简单“存视频”。

真正需要处理:

  • 多相机时间同步;
  • 关节状态同步;
  • Action与Observation对齐;
  • 数据清洗;
  • 失败轨迹识别;
  • 自动标注;
  • 数据分桶;
  • 数据版本管理;
  • 不同机器人之间的数据转换;
  • 训练集质量评估。

Diffusion Policy等机器人策略学习工作已经说明,高质量示范数据可以直接用于学习复杂的视觉运动策略,而后续VLA路线把数据规模和多本体数据的重要性进一步放大。

这也是为什么现在机器人公司除了抢模型人才,还在大量招:

Robot Data、遥操作、Data Pipeline、自动标注、数据平台主管。

有时候模型效果长期不涨,不一定是模型不行。

可能只是训练数据本身有问题。

六、一张表看懂具身智能算法工程师到底分哪几种

方向 真正负责什么 常见关键词 最看重的经验
VLA/具身大脑 理解任务并生成机器人动作 VLA、VLM、Transformer、Action Token 大模型+机器人真机
世界模型 学习环境、状态与动作之间关系 Video Prediction、Dynamics、World Model 时序建模+机器人决策
运控/小脑 站稳、走稳、完成动作 WBC、MPC、RL、动力学 双足/四足真机
Sim2Real 仿真策略迁移到真实机器人 Isaac Lab、MuJoCo、System ID 仿真+硬件调试
操作策略 抓取、双臂、灵巧操作 Diffusion Policy、Imitation Learning 真机Manipulation
具身数据 给模型生产训练数据 Teleoperation、Data Pipeline 遥操作+数据工程
空间感知 理解机器人周围3D环境 RGB-D、Point Cloud、Pose 3D视觉+机器人场景

所以企业如果JD上写:

VLA+WBC+Sim2Real+3D视觉+数据平台主管,一个人全部负责。

大概率不是市场上没人。而是岗位本身就应该拆。

七、技术栈到底应该怎么要求?

很多HR喜欢把工具写得越多越专业。实际上更建议分层。

能力 基础要求 真正拉开差距的地方
编程 Python、C++、PyTorch CUDA、训练/推理性能优化
机器人 ROS 2、坐标变换、机器人基础 真机调试与系统问题定位
仿真 MuJoCo、Isaac Lab等 System ID、Sim2Real
学习算法 RL、Imitation Learning VLA、Diffusion Policy、World Model
感知 RGB/RGB-D、基础3D视觉 视觉+状态+动作联合建模
工程 能部署模型 能处理实时性、延迟和硬件差异

这里还有一个招聘误区:

不要为了显得岗位高级,把CVPR、ICRA、IROS论文写成所有岗位的Must-have。

研究型VLA岗位,论文很重要。

但一个Sim2Real或者运控工程师,如果真正把三代双足机器人从“站不住”调到稳定运行,哪怕论文没有那么漂亮,也可能正是企业最缺的人。

八、企业招聘具身智能算法工程师,我建议先问自己三个问题

第一:我们现在卡在哪?

如果目前连机器人都站不稳,先招聘10个VLA工程师意义不大。

如果整机已经稳定,但机器人不知道怎么完成复杂任务,那才应该重点补具身大脑。

按企业阶段看人

当前阶段 优先补什么
本体还不稳定 运控、系统、Sim2Real
本体稳定,操作能力弱 Manipulation、模仿学习
已有操作能力,希望泛化 VLA、世界模型
模型很多但效果不涨 Robot Data、数据工程
Demo可以,换环境就失败 Sim2Real、感知、评测

第二:这个人负责研究,还是负责结果?

这两种人才价格和画像完全不一样。

例如VLA岗位:

研究型人才可能重点看:

模型结构、预训练、Scaling、论文。

产品型负责人还必须承担:

数据、真机、评测、部署、团队进度。

同一个岗位名称,市场上可能根本不是同一种人。


第三:技术面到底怎么验证?

不要只问:

“你熟不熟VLA?”

可以直接问项目。

例如:

面VLA

“你们模型输出的Action是怎么表示的?训练数据里Observation、语言和Action怎么对齐?”

面Sim2Real

“仿真策略上真机以后成功率掉一半,你第一天会查什么?”

面运控

“机器人受到侧向冲击以后恢复不了,可能有哪些原因?”

面数据

“两套遥操作设备采出来的数据质量差异很大,你怎么判断哪套数据值得进入训练集?”

真正做过的人很快会进入细节。

只背概念的人很容易停在框架名称。

九、为什么这个岗位越来越难招?

从人才市场看,现在最稀缺的不是纯算法,也不是纯机器人。

而是跨过两层以上技术边界的人

例如:

  • VLM+Robot Policy;
  • RL+双足真机;
  • 仿真+电机/关节调试;
  • 数据工程+机器人学习;
  • 3D视觉+操作策略。

北京更容易找到VLA和世界模型人才,上海的Sim2Real、系统与跨界工程人才相对集中,深圳在硬件、本体和机器人产品工程上优势明显,杭州则有比较强的运控和机器人研发人才基础。

所以具身智能算法招聘,本身就不能只靠招聘网站按关键词搜索。

如果企业确实处于核心算法团队重建、VLA/运控负责人寻访或者跨城市组网阶段,可以使用**倍利福猎头(Believe Consulting)**这类长期研究具身智能与硬科技人才的垂直团队做Talent Mapping。真正有价值的部分不是多推几份简历,而是先判断:这个岗位应该去哪类公司、实验室和相邻行业找人,以及哪些候选人的经验能够真正迁移。

十、写在最后:以后看到“具身智能算法工程师”,先别急着问薪资

我做机器人猎头David,碰到这类岗位时,现在第一反应已经不是:

“预算多少?”

而是先问:

“你说的具身算法,到底是哪一层?”

因为这六个字下面,可以同时藏着:

VLA、世界模型、强化学习、WBC、Sim2Real、操作策略、3D感知和机器人数据。

它们彼此有关,但绝对不是一个岗位。

对于企业来说,岗位拆得越清楚,招聘越快。

对于工程师来说,也不要笼统地说:

“我是做具身智能的。”

更有价值的表达应该是:

“我负责VLA的后训练和真机部署。”

或者:

“我做双足RL运控,主要解决Sim2Real和真机稳定性。”

一句话就能判断你的技术位置。

这才是2026年具身智能人才市场真正开始成熟的表现:大家不再只讨论“机器人会不会变聪明”,而开始知道——

到底是谁,在负责让它聪明;又是谁,在负责让它真的动起来。

CSDN读者讨论

  1. 目前具身智能真正最缺的是VLA人才,还是Sim2Real和真机运控人才?
  2. Diffusion Policy与VLA继续发展以后,WBC/MPC这类传统控制方法会消失,还是长期共存?
  3. 企业招聘“全栈具身算法工程师”,到底是真的需要,还是JD没有拆清楚?
Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐