标注猿的第97篇原创  

  一个用数据视角看AI世界的标注猿   

别再争VLA和WAM了,机器人真正缺的是“技能培训学校”

最近,具身智能圈最热的争论之一,

就是VLA和WAM到底谁代表未来。

一边是已经能落地、能交付、能跑项目的VLA;

另一边是被大厂押注、看起来更接近通用机器人的WAM。

于是很多人开始问:

VLA是不是要过时了?

WAM是不是要彻底替代VLA?

机器人厂商是不是必须马上all in世界模型?

说实话,这个问题很热闹,但不够产业。

真正做过项目的人都知道,机器人落不了地,

很多时候不是模型名字不够先进,

而是数据不干净、训练不成体系、真机失败后没人给它“补课”。

VLA也好,WAM也好,最后拼的不是谁概念更性感,

而是谁能让机器人真正干活。

一、VLA负责当下赚钱

VLA,全称是视觉-语言-动作模型。

简单理解,就是机器人看到画面,听懂人的指令,然后直接输出动作。

你对机器人说:“把桌上的杯子拿过来。”

它看到杯子,理解任务,然后调用训练里学过的动作完成抓取、移动、放置。

这套逻辑非常适合当下的服务机器人。

它推理快、延迟低,适合机械臂和服务机器人实时控制;

它语言理解能力强,适合餐饮、商超、酒店、养老等高频人机交互场景;

它训练链路成熟,本体厂商不需要从零搭建特别复杂的系统。

更重要的是,它便宜、稳定、容易交付。

餐饮上菜、货架分拣、封闭巡检、简单搬运,这些任务不一定需要机器人理解复杂物理世界,

首先需要的是稳定完成标准动作。

所以短期来看,VLA不是落后技术,而是服务机器人当下商业化的主力底座。

但VLA也有明显短板。

它更像是在学习“画面和动作之间的对应关系”,并不真正理解重力、碰撞、摩擦和环境变化。

桌面光线变了,物体位置偏了,中间多了一个障碍物,

抓取时出现打滑,它就容易翻车。

这就是为什么很多机器人在展厅里很丝滑,

一到真实场景就露馅。

二、WAM负责未来进化

WAM,也就是世界动作模型。

它和VLA最大的区别是:

VLA想的是“我现在该怎么做”,

WAM想的是“我这么做之后,会发生什么”。

这就像人拿杯子,不只是看到杯子就伸手,

而是会判断杯子会不会滑、旁边有没有障碍、拿起来会不会碰倒其他东西。

WAM的价值,就在于让机器人行动前先做一次内部预演。

从长期看,WAM确实更接近通用机器人方向。

家庭陪护、开放商超、酒店服务、人形机器人,

这些场景都不是标准化环境,有杂物、有人走动、有突发变化、有各种长尾问题。

没有物理预判能力,机器人很难真正进入复杂开放场景。

但问题是,未来方向不等于今天马上量产。

WAM现在最大的难点是贵、重、难

它需要更高算力,部署成本更高,训练流程更复杂。

很多中小本体厂商还不具备完整世界模型训练能力。

所以,WAM很重要,但不能神化。

今天让所有服务机器人厂商直接all in WAM,

就像让一家刚开始赚钱的公司直接上马核聚变项目,

方向没错,但节奏可能错了。

三、别二选一:VLA量产,WAM进化

真正清醒的判断是:

VLA不会马上被WAM淘汰,WAM也不是PPT概念。

二者不是替代关系,而是分层关系。

标准化场景,用VLA快速交付。

复杂开放场景,用WAM提升鲁棒性。

低成本商用机型,用VLA控制成本。

高端通用机器人,用WAM拉开差异化。

真正危险的不是选VLA还是WAM,而是只押注一个模型,

却没有自己的数据资产、训练平台和真机闭环。

机器人行业最终不是比谁论文读得多,

而是比谁能在真实场景中持续迭代。

四、机器人真正缺的是“技能培训学校”

我认为,未来具身智能行业一定会出现一种新角色:

机器人技能培训学校。

它不是简单做机器人本体,

也不是单纯做大模型算法,更不是传统数据标注外包。

它要做的是一整套机器人技能训练体系。

  • 机器人不会上菜?给它上“餐饮服务课”。

  • 机器人不会分拣?给它上“货架分拣课”。

  • 机器人在酒店容易撞障碍物?给它上“复杂环境避障课”。

这套课程体系背后,本质上就是四件事:

高质量数据集、标准化训练管线、场景化技能模板、真机失败数据闭环。

  • 所谓“教材”,就是清洗后的机器人训练数据。

  • 所谓“课堂”,就是VLA和WAM双范式训练平台。

  • 所谓“考试”,就是仿真和真机评测。

  • 所谓“补课”,就是真机失败数据自动回流,再清洗、再训练、再上线。

当机器人可以像人一样不断学习、复盘、补课,

机器人行业才真正从“Demo时代”进入“上岗时代”。

我们面向全品类机器人本体厂商,以用为导向,以真实落地场景为核心,

提供端到端机器人综合训练解决方案,不做单一模型研发,

而是搭建通用训练中台,

打通VLA成熟量产路线、WAM长期进化路线,

解决机器人本体厂商数据、训练、迭代落地的全链条痛点。

01精细化自监督数据清洗引擎(双范式通用底层)

不管厂商训练VLA还是WAM,高质量干净数据是基础,内置自研逐帧粒度清洗技术。

图片

图片

02、双范式一体化训练中台(核心教学课堂)

一套平台兼容两条技术路线,厂商按需切换,无需两套研发系统。

图片

03、分场景标准化技能课程库(预制教学教材)

对标新东方标准化课程体系,沉淀商用服务机器人高频成熟技能,厂商开箱即用、少量自有数据微调即可落地。

图片

04、仿真+真机双维度自动评测系统(技能结业测验)

训练完成自动输出量化达标报告,适配VLA、WAM两套评测指标。

图片

图片

05、真机故障数据闭环迭代系统(课后持续补课)

图片

五、数据标注公司的新机会来了

这件事对数据标注行业意味着什么?

意味着下一轮机会,可能不在传统图片框选里,

而在具身智能训练数据服务里。

过去,我们做的是图像标注、文本标注、语音转写、视频审核。

但机器人时代的数据更复杂。

一条机器人训练数据,可能同时包含,

视觉画面、语言指令、机械臂轨迹、传感器状态、

任务目标、失败原因、环境变化和物理反馈。

这不是简单标一个框、打一个标签就结束了。

未来的数据标注公司

必须具备采集、清洗、标注、训练、闭环五种能力。

能采集机器人遥操作数据,能清洗失败轨迹和无效片段,

能标注动作、状态、意图和风险,能沉淀场景化技能数据集,

能对接VLA和WAM训练,能把真机失败数据重新回流,形成持续迭代。

也就是说,未来的数据标注公司,不能只做“人工加工厂”,

必须升级成“机器人训练数据服务商”。

以前我们帮AI看懂世界,未来我们要帮机器人学会干活。

六、机器人下半场,拼的是补课能力

别再简单争论VLA和WAM谁赢谁输了。

VLA赢在当下量产,WAM赢在长期进化。

但真正决定机器人能不能进入真实世界的,

是有没有高质量数据、标准化训练管线、场景技能库,

以及真机失败后的持续补课能力。

具身智能的下半场,不是模型发布会,而是数据训练场。

谁能成为机器人行业的“技能培训学校”,

谁就有机会站在具身智能商业化的关键入口。

过去,数据标注行业解决的是“AI怎么看懂世界”。

现在,机器人时代给了我们一个更大的命题:

如何让机器真正学会干活

这件事,才刚刚开始。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐