2天前,公开媒体上的一则消息提醒大家关注:

佳明在蚂蚁灵波的优秀工作发布了,Zero-WAM,大规模训练出小尺寸世界模型,打磨了大半年的工作,实现In-context Human Promt(人类视频演示)即可让积极人零样本完成复杂操作任务。

发帖人是香港科技大学人工智能助理教授梁俊卫。

一场大的变化正在上演,谁跟迟了就可能会被远远甩在后面。

8月19日,硅谷公司Generalist发布新模型GEN-1.5:给它看一段3到12秒的人类演示——开个笔袋、拧个瓶盖——机器人当场就试着做,哪怕这个任务它从没练过。不重新训练,不改任何参数。

8月25日,Skild AI发布S1:给它看一段第一视角的人类视频,它能照着完成从未见过的长程任务——手冲咖啡、移栽盆栽、组装零件,最长10分钟、几十个步骤。中途研究员故意把东西挪走、换掉道具、改变灯光,没影响,它自己接着干。

8月26日,一支包含港科大(广州)研究者的团队把论文挂上arXiv:这就是刚才梁俊卫提醒的,蚂蚁灵波模型的最新模型Zero-WAM,人类视频上下文世界动作建模——把人类干活的视频本身当Promt,机器人照着视频,甚至可以做没训练过的新任务。

上述提醒也提到,Figure AI也正在这个研究方向上发力。

1

ICL:现在能到什么水平?

国内外的顶级团队们,8天,同一个方向:ICL(In-context robot Learning),这不像是巧合。

三家公司的具体路径略有不同,各有侧重。

Generalist AI押注的是Physical Data Scaling——相信物理经验足够多以后,会自然涌现出通用智能。GEN-1.5在只给一次Physical Prompt、零梯度更新的情况下,平均成功率达到59%;如果每个任务再给5分钟数据做10次梯度更新,成功率可以进一步提升到83%。

GEN-1.5还能把两段不同的教学演示拼起来学。先看一段A动作,再看一段B动作,模型自己把两项技能串成一个连续任务,中间那些没人演示过的衔接动作也得自己搞定。模拟器里看一遍,转头到了真实世界,也能直接上手。

Skild AI走的是“Cross-Embodiment + ICL + Industrial Deployment”路线。S1的测试结果显示,在预训练阶段从未出现的长程任务中,成功率高达66%,而按照传统模式给模型读一句文字指令,成功率只有9%——差出七倍。

更惊人的是,想追平S1只看一次演示的效果,传统后训练微调路线大概要喂进去380次任务演示。S1还能根据现场状况调整做法——示范中是用浇水壶浇水,实际执行时若只有一个杯子,S1会改用杯子完成工作。

蚂蚁灵波的Zero-WAM,则将重点放在开放式、任务级零样本泛化上。团队构建了HumanGen数据集,覆盖8,600个任务、74,200对人类-机器人ICL样本对。在RoboTwin 2.0的7个完全没见过的任务上,Zero-WAM的平均成功率达到46.95%,相比video-action baseline提升了29.5个百分点。

这些数据可以看到,进步是惊人的。

2

“机器人学的伟大日子”

要理解这惊人的程度,得先补一块背景——大模型历史上那次著名的换挡。

GPT-3之前的AI,是“一个任务训练一次”:模型再聪明,换个任务就得拿新数据回炉重造。

GPT-3之后,出现一种新玩法:在对话里给它几个例子,它当场就会——不用训练,例子本身写在对话里。正是这个变化,把AI从专用工具变成通用工具,ChatGPT才在两年后姗姗来迟。

而机器人行业,至今还是“一个任务训练一次”的老模式。教机器人一个新动作,流程是:人遥控着机器人,同一个动作重复几百上千遍,收集数据、训练、微调、部署——工程师跟着耗几周到几个月。

Skild在自家博客里说得直白:机器人,至今还卡在“BERT时代”。

现在,一周之内,三家接连宣布:给机器人看一遍,它直接做。机器人的“看例子”,已经摸到了大模型当年的门槛。

昨晚,英伟达机器人部门总监Jim Fan对Generalist的GEN-1.5评价:这是机器人学的一个伟大日子。

——教机器人,这已经接近人类妈妈教小宝宝做事:看一遍,照着做。

3

ICL路线,成本将断崖式降低

做深ICL方向,Skild得出一句很贵的话:对于教机器人,一段演示视频,抵得上文字说不清的一切。所以呢?VLA以及过往的思路可能都要被颠覆了。

以前教机器人一个新动作,要花多少?Skild算过一笔账:要教会一个中等复杂度的任务,需要几十到几百小时的遥操数据——还得在真实工作环境里一点一点收集。Generalist的数据引擎,光预训练就连续跑了八个多月。

现在这道题的解法,变成拍一段视频。

Skild内部评测:一段人类视频演示的教学效果,约等于380次人工示教。而传统微调要把成功率做到86%,代价是2000次示教。

把账摆在一起看更清楚:教会一个新任务,过去是工程师加几百小时数据;现在是一段视频加几分钟等待。教一个动作的成本,塌掉的不是一个数量级。

当前大热的数据采集赛道或许需要调整方向了?

ICL的出现,并不会让数据采集变得不重要,但可能会从根本上改变数据的采集模式和价值。

不再是孤立动作的重复,而是带有“场景记忆”的情境数据In-Context Data Collection,需要记录下动作的前因后果。Ego数据价值将更为凸显,成为新的数据富矿。至于ICL路线下,数据的标注还重要吗?欢迎评论区讨论。

4

这算“Chat GPT时刻”信号吗?

S1发布后,它的投资方红杉资本直接盖章,称这是“机器人学的ChatGPT时刻”。

这也解开一桩旧悬案:Skild今年1月融了14亿美元、估值140亿美元——是它当时收入的470倍,贵得离谱,没人说得清这笔钱赌什么。现在,答案揭晓一半:他们赌的,就是“看一遍就会”这条路。

这算“信号”吗?算。因为GPT-3当年“看一遍”也只有45%,照样不能用——两年半之后才有ChatGPT。真正该盯的不是今天的数字,是曲线的形状:Generalist透露,他们模型的适应成本是一路自动降下来的,从几百步训练,降到几十步,降到10步,降到1步,现在降到零步。方向只有一个,而且是自己走出来的。

还有没有问题呢?当然有。

第一:这里的“会”,是当场学,不是记住。机器人看完视频照着做,全程模型参数一个没动——像临时抱佛脚,考完全忘。换个新任务,得重新看一遍;今天学会的手艺,不会存进它的“脑子”。Generalist自己也承认,当场学的稳定性还不如微调过的模型。顺带说一句,GPT-3的“看例子”同样是这个性质,所以类比本身没错——但别理解成机器人从此过目不忘。

第二:成绩单全是自报的。S1没有论文、没有公开接口,66%出自自家内部测试的四个任务;GEN-1.5的59%来自十个偏简单的短任务;Zero-WAM的46.95%是在仿真环境里跑出来的。目前没有一家的数字经过第三方复现。

第三:今天,老办法反而更准。传统微调能做到86%的成功率,高于看一遍的66%。而且在训练数据只有1000小时的规模下,老办法还整体领先——文字指令版53%,看视频版只有43%。“看一遍”的优势,要到10万小时的数据规模才显现。

5

“ICL→Interaction→RL→FleetLearning”闭环

同时,我们也要知道,机器人和ChatGPT的根本不同。ChatGPT有90%的正确率在很多场景已经很好用了,但机器人90%的成功率意味着每执行10次就失败一次——在工业场景中几乎无法接受。真正困难的可能不是从0到60%,而是从60%到90%、到99%、到99.9%——后面的每一个“9”都极其艰难。

PI正在做的思路是:World Model + Memory + ICL能不能真正解决跨环境Generalization,Robot-generated Experience + RL能不能把60%自主推到99.9%。

谁先跑通“ICL→Interaction→RL→FleetLearning”这个闭环,谁可能才真正掌握Physical AI的Scaling Engine。

现在只是第一步,当一台机器人学到的Experience能传给100台、1万台、10万台机器人的时候,具身智能的ChatGPT时刻,就真的来了。

文末附上蚂蚁灵波的两条链接,感兴趣的朋友可以自行查看。Enjoy:

论文:https://arxiv.org/abs/2608.26103

项目主页:https://robbyant-research.github.io/Zero-WAM

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐