最近一年,具身智能领域的讨论焦点明显从“能不能发论文”转向了“能不能在真实场景里稳定跑起来”。尤其是 VLA(Vision-Language-Action)模型,作为连接视觉、语言与机器人动作的桥梁,在轮式双臂、人形灵巧手等平台上展现出了很强的潜力,但真正落地时依然面临数据、训练、部署和泛化的一系列难题。等同路人。
VLA 模型为什么重要
传统机器人操作依赖感知-规划-控制的分层架构,每个模块单独设计和调参,泛化能力差,换一个场景往往需要重新适配。VLA 模型尝试把视觉理解、语言指令和底层动作生成统一到一个端到端的框架里,让机器人可以直接根据图像和自然语言指令输出动作序列。这种思路在 pi0、openVLA 等模型上已经验证了可行性,尤其是 pi0 系列在复杂操作任务中表现出了不错的灵巧性和泛化能力。
但 VLA 不是银弹。模型本身的推理速度、对硬件算力的要求、真机部署时的实时性、以及从仿真到实车的 sim2real 差距,都是实际工程中必须跨过去的坎。我们在做轮式双臂和灵巧手操作时,花了很多时间在动作表征设计、数据回流和在线微调上,而不是单纯堆模型参数。
比较特殊——依托国内一家头部非营利 AI 研究机构孵化,专注于机器人“具身大脑”的商业化落地。目前团队六十多人,研发占比六成以上,算法团队二十到三十人。业务上不是纯 demo,已经有长期订单,服务方向包括医药、物流等对稳定性要求较高的行业,落地场景覆盖双臂拣选、叉车操作,以及商超药店取货、衣物叠放这类需要精细操作的任务。
技术栈上,主要围绕几条线展开:
VLM 后训练:在通用视觉语言模型的基础上做面向操作任务的微调,提升对物体属性、空间关系和任务意图的理解。
pi 系列模型的训练与部署:包括 pi0 及后续版本的适配、蒸馏和量化,目标是能在嵌入式计算设备上实时推理。
diffusion policy:针对连续动作空间,用扩散策略生成平滑、可执行的动作轨迹,特别适合双臂协调和灵巧手控制。
RL 训练:结合仿真环境做强化学习,解决长时序任务中的稀疏奖励问题,并与模仿学习互补。
仿真平台:Isaac Gym/Sim、MuJoCo、Bullet、SAPIEN 等都有涉及,用于数据增强、策略预训练和 sim2real 迁移。
真实场景中,VLA 模型的痛点往往不在模型结构本身,而在数据。我们花了很多精力构建“数据飞轮”——从真机采集、人工标注、自动清洗到模型迭代,再回流到真机验证。这个闭环跑通之后,模型的泛化能力提升比单纯加数据量要明显得多。
工程挑战与我们的解决思路
举一个具体例子:商超药店的拣选任务。货架上的商品种类多、摆放姿态随机、光照变化大,而且机械臂需要在狭窄空间里完成抓取和放置。直接用仿真训练的模型放到真机上,成功率会掉得很厉害。我们的做法是:
仿真与现实混合训练:在仿真里大规模生成不同商品、不同姿态的交互数据,同时用少量高质量真机数据做域适应。
动作表征优化:不直接输出关节角度,而是输出末端位姿或关键点轨迹,再通过逆运动学映射到关节空间,减少模型学习负担。
在线学习与缓存复用:部署时收集失败案例,利用晚上的时间做增量训练,第二天更新模型,逐步提升成功率。
模型轻量化:pi0 原版模型对于嵌入式平台太大,我们做了剪枝、量化和蒸馏,在保持精度的前提下把推理延迟降到了可接受范围。
这些工作听起来不性感,但正是决定落地成败的关键。
等同路的算法团队,重点关注在 VLA 方向有实际项目积累的工程师。
硕士及以上学历,计算机、自动化相关专业,博士优先;
对 pi0、openVLA 等 VLA 模型有深入理解,能独立完成训练、微调和部署;
有 轮式双臂或人形灵巧手 的 VLA 系统开发经验,知道真机部署时有哪些坑;
熟悉 Python 和 C++,能写高效的数据处理和推理代码;
有仿真平台开发经验(Isaac Gym/Sim、MuJoCo、Bullet、SAPIEN 等)是加分项;
在 CVPR、ICCV、ECCV、NeurIPS、ICLR、ICML、RSS、ICRA、IROS、TPAMI、TRO 等会议或期刊上以第一作者发表过 VLA 相关论文的,尤其欢迎。
不需要全能选手,但希望对某个环节有深钻的能力,同时愿意接触完整闭环——从数据、训练到真机部署。团队目前算法组相对扁平,个人发挥空间大,
简单说几点实际的:
现金回报:这个方向上资深工程师的市场价格目前在 80 到 100 万这个区间,12 薪加年终。如果背景特别匹配,尤其是从千寻、自变量、星海图等对标团队出来的,还有谈的空间。
工作节奏:双休,弹性上下班,早八晚五、早九晚六、早十晚七都可以选,不强制打卡。
团队氛围:研发氛围浓,没有繁文缛节,大家更关心技术方案能不能跑通。公司刚成立一年,很多流程还在建设,适合喜欢从 0 到 1 的人。
资源支持:背靠国家级研究机构,算力和数据资源比一般创业公司充足,同时有商业订单保证现金流,不是纯粹烧钱做研究。
写在最后
VLA 模型正处在从实验室走向产业化的关键窗口期。对机器人操作、多模态学习、具身智能这些方向有热情,并且希望自己的代码能真实驱动一台机械臂完成复杂任务,而不是只停留在论文指标上,敲门哈。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐