这半年,具身开始出现了两条同时加速的线。

一条线上,VLA、世界模型、跨本体学习不断地进行能力提升。机器人正在学会理解更长的指令,处理更多场景,也开始尝试把一种本体上的能力迁移到另一种本体。

另一条线上,工厂提出的问题却越来越具体。

POC是否完成了?整个系统能连续工作多久?失败之后会不会自己恢复?换一条产线还要重新训练多少?

模型端在讨论能力上限,产业现场开始计算系统下限。

今年值得关注的另一条暗线,很可能是机器人行业开始补过去很长时间里缺失的一层:连接模型研发与真实产业部署。

前段时间,和几家做汽车制造业的公司负责人聊天。

他们给出的判断有点犀利:

学术圈,模型也许能做的很好,但工业场景落地,必须是那批懂工程的人来做。

这句话并不是在降低模型研究的价值。而是工业具身的难题,早已经延伸到模型之外。

而且活很“脏”,还不是每家公司都能进去。

有几道坎要过。

原文链接:调研了一整圈,具身在工业上“又脏又累”,不懂工程的人很难做得好。

01 第一道门槛,是拿到真实场景的入场券。

之前Figure进入宝马的工厂,但这个叙事,不是所有家都能有的。

图片

原因有几种。

1)先看能不能进去。

这次WRC和WAIC上,我们调研了一些真实产线,了解了许多B端客户的考究。

许多产线涉及工艺保密、生产节拍和安全管理,生产方要求不低。

他们的关切是:

“不能耽误生产,也不能花很大成本单独建一个数据采集产线”。

还有就是信息安全:“采集的数据,会泄漏生产资料,如果服务的另外一个客户,是这家的竞对怎么办???”。

这些其实说到底是客户信任本身。

另外就是,非常考验对工业生产的了解,具身这个名字喊了千八百遍,但能否真的能为客户解决痛点也不好说。

你看,上面这几个难点,足够拦住很多家了。

如果说哪个更重要,第一个是要客户真的认可你。但对于新团队来说,这个磨合期是绕不开的。

不可能是今年展示了能力,生产方直接给你入驻。

2)进场之后,第二个问题是要采什么。

普通视频只记录“看见什么”。

机器人学习需要完整的因果链:环境观测、本体状态、任务约束、动作、末端受力,以及成功、失败或人工接管。

如果只是物流产线上,分拣一下快递,二指夹爪就够了,加上力控足矣。

但对一些容错率低的任务呢?

工业要求的是99.99%,小数点后2位。

所以,多模态数据的同时采集很重要,甚至需要相当多的数据冗余。

现在可以不用,但要用的时候,得有。

还有就是对齐问题。如果数据处理做得不好,规模扩大的同时,噪声也会明显扩大。

这就要求,常见的模态,比如视觉、深度、位姿、关节角、力矩、触觉、任务语义和结果反馈,要在同一时间轴上对齐。

3)第三个问题更容易被忽略:真实任务怎样定义。

数据有没有围绕真实任务组织,才是关键。

任务没有拆清楚,即使采集了几百小时视频,也未必能形成有效数据。真正可用于训练的轨迹,需要把环境观测、机器人状态、动作、物理反馈和任务结果放在同一时间轴上,形成“观察—状态—动作—结果”的完整链路。

不能只记录机器人做了什么,还要记录它为什么成功,以及失败发生在哪里。

02 工厂里需要采什么样的数据?怎么用?

1)模型在工厂里完成一项任务,很少只依赖单一类型的数据。

上面其实也说了。

工业上不是抓取一堆纯人类视频来训练这么简单,大多需要多模态数据。

场景的需求大多是稳定,所以多类数据是必要的。

图像、深度和点云数据可以用于目标识别、场景分割、缺陷检测和位姿估计。

机器人关节、末端位姿和力矩数据可以用于动作学习。

任务指令、视觉观测和动作序列完成对齐后,可以用于VLA模型的训练或微调。

如果进一步加入动作执行后的环境变化和任务结果,数据还可以帮助世界模型或WAM类能力学习。

2)之后,可以进入仿真和训练。

真实数据进入训练,就不说了。

还有一个路径是进入仿真。

真实数据解决的是物理基准问题:工厂实际长什么样,设备如何分布,光照和材质有什么特点,机器人动作会产生什么反馈。

但规模化,短期内可以靠仿真来做,把真实任务扩展成大量可控制、可重复的训练与测试任务。

还有就是,一些异常工况很难依靠真实采集获得足够数据。

设备故障、物料掉落、产线堵塞、人员闯入、烟雾或火焰等事件,要么发生频率低,要么不适合在真实产线中反复制造。

所以,采集的数据可以real2sim,在仿真里可以再做很多其他的事情。

03 大多数工业任务,都不会交给一个模型从头做到尾

通用泛化模型可能用不到工业中。

业务上,也不会允许只用某个VLA or WAM or 其它。

就像星海图高继扬之前说的,具身的GPT时刻不会突然到来,会从逐个的模型和能力中涌现。

你要让机器人抓取一个part,几个拆分的流程中,用的模型不会是一样的。

检测和语义模型可以先发现具体的目标。

之后,VLA这类可以负责理解任务、识别目标和生成粗粒度动作,世界模型则用于预测轨迹是否可能引发碰撞、卡滞或目标偏移。

进入精细操作阶段后,毫米级对准、接触检测和作用力调整,更依赖视觉伺服、运动规划与力控。

系统还要判断插接是否到位,并在异常情况下选择重试、退出或请求人工接管。

一项看似简单的插接任务,实际跨越了感知、规划、精细定位、接触控制、结果验证和异常恢复。

现阶段,一个模型很难同时做好所有环节。

高阶智驾到今天也还要靠规则兜底安全,工业现场只会更保守。

04 机器人部署之后,真正的数据飞轮才开始转动

机器人第一次进入现场,并不意味着系统已经成熟。

恰恰相反,现场部署会开启新一轮数据生产。

机器人在真实运行中会遇到训练阶段没有覆盖的新物体、新设备、新光照和新任务。

它也会暴露新的失败模式:目标没有识别出来,定位发生漂移,任务顺序判断错误,轨迹无法执行,接触作用力异常,或者通信波动导致控制指令延迟。

这些数据往往比普通成功轨迹更有价值。

但工业上,并非所有现场失败都应该交给模型再训练。

如果没有失败归因,团队很容易陷入“模型不行就继续补数据”的循环,结果数据越来越多,真正的问题依然没有解决。

而且噪声也可能会越来越大。

所以,只有完成归因之后,高价值现场数据才会进入下一轮迭代。

05 写在最后

写到这里,我们大概能理解,工业场景最终还得由真正懂工程的人来做。

这并不是在降低模型研究的价值。模型决定能力的想象空间,工程系统决定这些能力能不能进入生产。

当然,还有成本问题。

真正做过工业项目的人会清晰,如果产品的开发逻辑和项目设计结构出现了问题,后面将会是不断的人力和物力投入。

别说赚钱了,亏钱都很正常。

重磅!

全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)

推荐阅读

真机强化入门的一套完整教程!pi*0.6复现方案

我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~

具身智能的WAM与世界模型一份完整指南~

一览具身智能的行业全局,从产品经理的角度出发!

VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~

好用,高性价比!面向具身科研领域打造的轻量级机械臂

VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~

从零训练你的足式机器人!让你的足式机器人真正动起来~

1v1 科研论文辅导来啦!

重磅!具身智能之心论文辅导来啦(近20+方向,顶会/顶刊/SCI/EI/中文核心/申博等)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐