调研了一整圈,具身在工业上“又脏又累”,不懂工程的人很难做得好。
这半年,具身开始出现了两条同时加速的线。
一条线上,VLA、世界模型、跨本体学习不断地进行能力提升。机器人正在学会理解更长的指令,处理更多场景,也开始尝试把一种本体上的能力迁移到另一种本体。
另一条线上,工厂提出的问题却越来越具体。
POC是否完成了?整个系统能连续工作多久?失败之后会不会自己恢复?换一条产线还要重新训练多少?
模型端在讨论能力上限,产业现场开始计算系统下限。
今年值得关注的另一条暗线,很可能是机器人行业开始补过去很长时间里缺失的一层:连接模型研发与真实产业部署。
前段时间,和几家做汽车制造业的公司负责人聊天。
他们给出的判断有点犀利:
学术圈,模型也许能做的很好,但工业场景落地,必须是那批懂工程的人来做。
这句话并不是在降低模型研究的价值。而是工业具身的难题,早已经延伸到模型之外。
而且活很“脏”,还不是每家公司都能进去。
有几道坎要过。
01 第一道门槛,是拿到真实场景的入场券。
之前Figure进入宝马的工厂,但这个叙事,不是所有家都能有的。

原因有几种。
1)先看能不能进去。
这次WRC和WAIC上,我们调研了一些真实产线,了解了许多B端客户的考究。
许多产线涉及工艺保密、生产节拍和安全管理,生产方要求不低。
他们的关切是:
“不能耽误生产,也不能花很大成本单独建一个数据采集产线”。
还有就是信息安全:“采集的数据,会泄漏生产资料,如果服务的另外一个客户,是这家的竞对怎么办???”。
这些其实说到底是客户信任本身。
另外就是,非常考验对工业生产的了解,具身这个名字喊了千八百遍,但能否真的能为客户解决痛点也不好说。
你看,上面这几个难点,足够拦住很多家了。
如果说哪个更重要,第一个是要客户真的认可你。但对于新团队来说,这个磨合期是绕不开的。
不可能是今年展示了能力,生产方直接给你入驻。
2)进场之后,第二个问题是要采什么。
普通视频只记录“看见什么”。
机器人学习需要完整的因果链:环境观测、本体状态、任务约束、动作、末端受力,以及成功、失败或人工接管。
如果只是物流产线上,分拣一下快递,二指夹爪就够了,加上力控足矣。
但对一些容错率低的任务呢?
工业要求的是99.99%,小数点后2位。
所以,多模态数据的同时采集很重要,甚至需要相当多的数据冗余。
现在可以不用,但要用的时候,得有。
还有就是对齐问题。如果数据处理做得不好,规模扩大的同时,噪声也会明显扩大。
这就要求,常见的模态,比如视觉、深度、位姿、关节角、力矩、触觉、任务语义和结果反馈,要在同一时间轴上对齐。
3)第三个问题更容易被忽略:真实任务怎样定义。
数据有没有围绕真实任务组织,才是关键。
任务没有拆清楚,即使采集了几百小时视频,也未必能形成有效数据。真正可用于训练的轨迹,需要把环境观测、机器人状态、动作、物理反馈和任务结果放在同一时间轴上,形成“观察—状态—动作—结果”的完整链路。
不能只记录机器人做了什么,还要记录它为什么成功,以及失败发生在哪里。
02 工厂里需要采什么样的数据?怎么用?
1)模型在工厂里完成一项任务,很少只依赖单一类型的数据。
上面其实也说了。
工业上不是抓取一堆纯人类视频来训练这么简单,大多需要多模态数据。
场景的需求大多是稳定,所以多类数据是必要的。
图像、深度和点云数据可以用于目标识别、场景分割、缺陷检测和位姿估计。
机器人关节、末端位姿和力矩数据可以用于动作学习。
任务指令、视觉观测和动作序列完成对齐后,可以用于VLA模型的训练或微调。
如果进一步加入动作执行后的环境变化和任务结果,数据还可以帮助世界模型或WAM类能力学习。
2)之后,可以进入仿真和训练。
真实数据进入训练,就不说了。
还有一个路径是进入仿真。
真实数据解决的是物理基准问题:工厂实际长什么样,设备如何分布,光照和材质有什么特点,机器人动作会产生什么反馈。
但规模化,短期内可以靠仿真来做,把真实任务扩展成大量可控制、可重复的训练与测试任务。
还有就是,一些异常工况很难依靠真实采集获得足够数据。
设备故障、物料掉落、产线堵塞、人员闯入、烟雾或火焰等事件,要么发生频率低,要么不适合在真实产线中反复制造。
所以,采集的数据可以real2sim,在仿真里可以再做很多其他的事情。
03 大多数工业任务,都不会交给一个模型从头做到尾
通用泛化模型可能用不到工业中。
业务上,也不会允许只用某个VLA or WAM or 其它。
就像星海图高继扬之前说的,具身的GPT时刻不会突然到来,会从逐个的模型和能力中涌现。
你要让机器人抓取一个part,几个拆分的流程中,用的模型不会是一样的。
检测和语义模型可以先发现具体的目标。
之后,VLA这类可以负责理解任务、识别目标和生成粗粒度动作,世界模型则用于预测轨迹是否可能引发碰撞、卡滞或目标偏移。
进入精细操作阶段后,毫米级对准、接触检测和作用力调整,更依赖视觉伺服、运动规划与力控。
系统还要判断插接是否到位,并在异常情况下选择重试、退出或请求人工接管。
一项看似简单的插接任务,实际跨越了感知、规划、精细定位、接触控制、结果验证和异常恢复。
现阶段,一个模型很难同时做好所有环节。
高阶智驾到今天也还要靠规则兜底安全,工业现场只会更保守。
04 机器人部署之后,真正的数据飞轮才开始转动
机器人第一次进入现场,并不意味着系统已经成熟。
恰恰相反,现场部署会开启新一轮数据生产。
机器人在真实运行中会遇到训练阶段没有覆盖的新物体、新设备、新光照和新任务。
它也会暴露新的失败模式:目标没有识别出来,定位发生漂移,任务顺序判断错误,轨迹无法执行,接触作用力异常,或者通信波动导致控制指令延迟。
这些数据往往比普通成功轨迹更有价值。
但工业上,并非所有现场失败都应该交给模型再训练。
如果没有失败归因,团队很容易陷入“模型不行就继续补数据”的循环,结果数据越来越多,真正的问题依然没有解决。
而且噪声也可能会越来越大。
所以,只有完成归因之后,高价值现场数据才会进入下一轮迭代。
05 写在最后
写到这里,我们大概能理解,工业场景最终还得由真正懂工程的人来做。
这并不是在降低模型研究的价值。模型决定能力的想象空间,工程系统决定这些能力能不能进入生产。
当然,还有成本问题。
真正做过工业项目的人会清晰,如果产品的开发逻辑和项目设计结构出现了问题,后面将会是不断的人力和物力投入。
别说赚钱了,亏钱都很正常。
重磅!
全网首个!具身智能开源知识库来啦(技术/产业/投融资/上下游)
推荐阅读
我们用低成本的机械臂完成pi0/pi0.5/GR00T/世界模型等VLA任务~
VLA+RL方向首个系统教程来啦!Online RL/Offline RL/test time RL等~
VLA/VLA+触觉/VLA+RL/具身世界模型等!具身大脑+小脑算法与实战全栈路线来啦~
1v1 科研论文辅导来啦!
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)