给机器人看一段视频,它就学会了没做过的活儿

你有没有想过一个问题:教小孩子做一件从没做过的事,最好的办法是什么?
不是给他念一段说明书,而是做给他看。你切一个苹果,倒一杯水,孩子在旁边看着,看两遍他就能自己上手。语言在这里其实是笨拙的工具,你很难用语言把"怎么捏勺子的角度"或者"手腕转多少度"讲清楚,但视频不需要讲,它直接把过程摆在你眼前。
机器人研究者们最近也在琢磨同一件事。一直以来,教机器人干活的主流方式是给它一句话指令,比如"把杯子放进篮子里",然后它照着做。这套办法这几年发展得不错,但有个致命短板:机器人只会做训练时见过的任务。你让它拿一个没见过的物体去完成一个没见过的动作组合,它大概率会懵。这就是机器人学习领域里一个很硬核的难题,业内叫它**零样本跨任务泛化**。
论文的标题是《Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization》,来自Robbyant和港科大的团队。他们做的事情说起来简单:让机器人看一段人类做同样任务的视频,然后照着这个视频的"意思"去干活,而不是靠一句语言指令。
这事听着朴素,但真做起来牵扯到好几层难题,接下来我们一层一层拆。
**当时的机器人政策模型到底卡在哪**
先说清楚现状有多难。视觉语言动作模型
VLA:全称Vision-Language-Action,是一类接收图像和语言指令、输出机器人动作的模型,是当前机器人操作领域的主流框架。
这类模型这几年发展很快,π0、OpenVLA、RT-2 这些名字业内人不陌生,它们能处理的任务种类越来越多,但一遇到"完全没见过的任务"就露怯。有篇叫AGNOSTOS的工作专门测试过这件事,发现主流VLA模型在零样本跨任务场景下表现很差,甚至要靠"作弊"手段,给模型一条对应任务的机器人轨迹作为参考才能勉强完成,这等于说测试时还得先手动喂一条答案,实用性大打折扣。
问题出在哪?语言这个接口天生就有信息瓶颈。你让机器人"把碗放到左边第三个格子里,注意别碰到旁边的盘子",这句话已经很啰嗦了,但依然没告诉机器人手该怎么转、力度多大、中间该经过什么姿态。空间约束、中间状态、时序节奏,这些东西用语言描述起来又累赘又模糊,而且哪怕你说得再细,语言本身也不提供任何视觉上的"演示",机器人拿到的只是抽象符号,得靠自己脑补画面。
如果不解决这个问题会怎样?答案已经摆在眼前了:现有VLA模型在没见过的任务上普遍失效,逼得研究者不得不去喂"参考答案"这种笨办法。这就好比你请了一个只会照本宣科的厨师,菜谱上没写的菜他一道都不会做,你只能提前把成品端给他看一眼,他才敢下刀。
这篇论文的思路是,与其死磕语言这个接口,不如换个接口:让人类演示视频直接当任务说明书。
**人类视频不是万能钥匙,但缺了它开不了这把锁**
用人类视频当任务指令这个想法本身不新鲜,此前已经有BC-Z、Vid2Robot这类工作尝试过。但真正把这条路走通,需要解决两个硬骨头。
第一个硬骨头是数据。你想让机器人学会"看视频执行任务"这个能力,前提是你得有大量的训练样本,每个样本包含一段人类做某任务的视频,加上一段机器人做同一任务、并且带有真实动作标注的轨迹,两者要严格对应。这种成对数据极其稀缺,人工采集的成本高到离谱,因为你不仅要采机器人轨迹,还要专门找人来演示同一个任务,还得保证任务种类足够多。此前的数据集比如MIME、EgoMimic、RH20T,规模都停留在几千到十万级别,覆盖的任务种类最多也就一两百个,远远撑不起"零样本泛化"这种需要海量任务多样性的目标。
第二个硬骨头更隐蔽,是模型的"偷懒"问题。假如你真的拿到了成对数据去训练模型,模型在训练阶段完全可以只看机器人自己过去的历史动作,就能八九不离十地猜出下一步该干什么,压根不需要认真看那段人类视频。这就好比老师留作业时把答案抄在了黑板边上,学生做题时眼睛瞟一下黑板就能蒙对,根本不需要理解题目本身。等到考试(也就是遇到没见过的新任务)时,历史经验这块"黑板"上没有现成答案了,学生却已经习惯了不看题目直接抄,结果自然是懵掉。
论文管这种现象叫捷径学习。模型在训练时看似学得很好,损失函数降得很低,但它偷偷绕开了本该学习的信号,也就是人类视频里携带的任务信息,转而依赖那些更容易获取但只在训练分布内有效的线索。
这两个问题一个是数据够不够,一个是模型学没学对。论文分别给出了对策,我们一个一个看。
**先解决数据荒:一条流水线批量造出7万多组人机配对**
数据不够,那就自己造。论文设计了一套自动化流水线,叫**上下文人类视频生成管线**
ICL:全称In-Context Learning,即上下文学习,指模型不通过更新参数,而是通过输入内容里给出的示例或提示来完成新任务的能力,这个概念最早在大语言模型领域被提出。
这套流水线的起点是已有的机器人视频轨迹数据。研究者们先按"任务"这个维度对现有的公开机器人数据集重新切分和采样,包括AgiBot、InternData-A1、Open-X-Embodiment等五个数据源,这一步保证了后续挑出来的机器人视频覆盖的任务足够五花八门,而不是被少数几个重复录制了几百遍的任务淹没。这部分整理出来的数据,论文管它叫Task-diverse VA,每个训练轮次大约包含40万条机器人轨迹,覆盖超过6000个任务。
接下来是关键的转换步骤。对每一条采样出来的机器人视频,流水线先用一个大语言模型(论文里用的是Gemini 3.1 Pro或Qwen3.6-Plus)分析这段视频在干什么,抽取出任务名称、物体的初始状态、状态怎么变化、最终状态是什么。同时这个语言模型还会生成一段图像编辑提示词,用来把机器人视频的第一帧改造成一个人类操作场景的初始画面。这一步顺便还会注入一些视觉上的变化,比如换个背景、换个视角、换个物体的样子,这样做的目的是让人机配对数据的视觉多样性更丰富,模型不至于只学到某一种固定场景下的对应关系。
拿到这张编辑过的初始人类观测图之后,流水线再调用图像编辑模型(Nano Banana 2或Qwen-Image-2.0)生成真正的初始画面,接着让大语言模型根据物体状态信息生成一段视频生成提示词,描述人类的手该怎么动来完成这个任务。这段提示词交给视频生成模型(Wan 2.7或Kling AI 3.0)合成出完整的人类操作视频。最后还有一道质检环节,还是用大语言模型给生成的视频打分,检查任务语义有没有保留、物理表现合不合理,不合格的直接丢掉。
整个流程走下来,人不用亲自演示一次,就能批量产出海量的、语义对应准确的人机配对样本。这套流水线最终产出了一个叫**HumanGen**的数据集,包含7.42万组人机上下文学习配对,覆盖8600个任务,涉及超过45种机器人形态。相比之前那些依赖人工采集的数据集,样本规模翻了好几倍,任务种类更是碾压式的领先,此前最大的RH20T也只覆盖147个任务种类。
这里有个细节值得说一说:论文里区分了"外部预训练"和"自建"两种数据来源,对外部公开数据集,他们故意加大了视觉上的变化幅度,包括场景、物体、视角的变化,逼着模型去学习那种"哪怕画面完全不一样,任务语义是一致的"这种抽象对应关系;而对自家采集的数据,则调低了变化幅度,让配对更贴近实际部署场景。这种设计其实是一种平衡术,既要让模型见多识广,又要让它在真实场景里落地时不至于水土不服。
如果没有这套自动生成流水线会怎样?答案很直白,回到人工采集的老路上,成本高到没法覆盖8600个任务这种规模,最终只能像之前的数据集一样停留在几十到几百个任务,撑不起"零样本泛化"这个野心。这就好比你想开一家能做全球任何菜系的餐厅,但如果只能靠自己一道一道菜手把手学,一辈子也学不完菜谱,你必须找到一种方法批量获取"菜谱视频",哪怕这些视频是别人帮你录的。
**破解模型偷懒的招数:逼它必须往前看得更远**
数据问题解决了,接下来是模型训练时的偷懒问题。论文给出的方案叫**上下文未来片段预测**
IFP:全称In-context Future chunk Prediction,是一种训练阶段专用的辅助监督目标,要求模型从当前的机器人视频表征出发,预测多个跨越不同时间跨度的未来视频片段,从而抑制模型只依赖短期历史进行预测的捷径行为。
具体怎么做的?先说清楚模型的基本结构。Zero-WAM的核心是一个因果视频动作模型,它每一步会先根据历史观测和任务指令,预测接下来一小段机器人视频会长什么样,再根据这段预测出的视频反推出应该执行什么动作。这是个"先想象再动手"的两阶段流程,论文管后半段叫逆动力学解码,意思是给定一个想象出来的未来画面,倒推出让画面实现所需要的动作指令。
问题出在第一阶段的"想象"环节。如果模型只被要求预测下一个紧邻的视频片段,它完全可以靠外推最近的历史动作来蒙对答案,根本不需要认真参考那段人类视频给出的长期任务线索。IFP的解法是,不只让模型预测下一步,而是同时要求它并行预测好几个跨度更大、时间上更靠后的未来片段,比如隔两步、隔四步、隔六步之后的画面。这些预测任务被专门设计成不能靠简单外推蒙对的难度,模型必须真正理解任务接下来会怎么演变,才能准确预测出这些跳跃式的未来画面。
论文里还特意强调了一个设计细节:这些负责预测未来片段的辅助模块,并不直接看那段人类视频,它们只能通过主干网络处理完人类视频之后产出的"融合表征"来获取任务信息。这个设计的用意是防止辅助模块自己另起炉灶,学出一套独立的、只在训练时有效的捷径,如果辅助模块能直接看人类视频,它完全可能绕开主干网络单独学会预测,那样一来主干网络该学的东西反而没学到,而这些辅助模块在真正部署时是要被拿掉的,等于白费功夫。
这套设计消融实验测出来的效果很直观:加上IFP之后,七个未知任务上的平均成功率从28.55%涨到46.95%,涨幅接近20个百分点。尤其在"打开微波炉"和"盖章"这两个此前从没见过的任务上,提升特别明显,甚至在"叠三块积木"这个最难的长时序任务上,IFP把成功率从彻彻底底的0%拉到了9%,直接打破了"完全做不到"的僵局。
这个设计让我想起小时候做数学题,如果老师只考你下一步该怎么算,你很容易靠套路蒙混过关,但如果老师要求你同时预判后面第三步、第五步的结果,你就没法只靠套路了,必须真正理解整道题的逻辑走向。如果不设这道"远期考题",模型的行为会退化成什么样?实验数据已经给出了答案,退化成一个只会看眼前一步、完全无视人类视频里长期任务信息的偷懒学生。
**看视频还是看文字,模型自己两条腿走路**
Zero-WAM的架构还有个值得说的地方,它同时支持两种任务指定方式:一种是纯语言指令,一种是人类视频指令,两者用的是同一套模型参数,不需要为了支持视频指令另外训练一个模型。
技术实现上,模型采用了一种叫**混合Transformer**
MoT:全称Mixture-of-Transformers,是一种架构设计,视频部分和动作部分各自拥有独立的参数(比如各自的注意力投影层和前馈网络),但两部分的表征放在同一个序列里,通过共享的注意力层进行信息交互。
的设计,视频预测和动作预测各用各的一套参数,但两边的信息在注意力层里可以互相看到。当人类视频作为提示输入时,它会被放在整个序列的最前面,充当一种"前缀记忆",机器人视频的预测过程可以随时回头参考这段前缀。这里还有个细节,动作预测这部分并不直接看人类视频,它只看预测出来的机器人未来画面,逻辑是人类视频里的任务语义已经被吸收进了那个预测出来的机器人画面里,动作解码这一步就退化回了标准的"看画面想动作",不需要再额外操心视频指令的事。
为了让人类视频和机器人视频在同一个序列里不至于混淆,论文还用了一个挺巧妙的位置编码技巧,通过
RoPE:全称Rotary Position Embedding,一种旋转式位置编码方法,常用于给序列中的每个元素标记它的位置信息,让模型知道"这是第几帧、第几行、第几列"。
的高度轴坐标偏移,人类视频的坐标被整体往外挪了一段距离,机器人视频保留原来的坐标范围,这样模型在注意力计算时能明确区分"这是参考视频"还是"这是自己正在执行的画面",不会把两者的空间信息搅在一起。
这套双模态设计带来的好处是,部署时你可以灵活选择用哪种方式给机器人下指令。对于容易用语言描述清楚的任务,直接说一句话就行;对于那些语言难以精确表达的任务,比如物体摆放的精确位置、多个物体的操作顺序,直接给它看一段视频,机器人就能领会你的意图。
**实验结果:七个没见过的任务,平均成功率翻了将近三倍**
说了这么多设计,最终还是要看数据说话。论文在RoboTwin 2.0仿真平台上做了主实验。
RoboTwin 2.0:一个双臂机器人操作仿真基准平台,包含50个操作任务,每个任务有50条示范轨迹,常用于评测机器人策略的泛化能力。
论文把这50个任务按任务级别切分,43个用来训练,剩下7个完全没在训练里出现过,用来测试模型有没有真正学会"举一反三",而不是死记硬背。这7个任务包括把物体放上秤、盖章、开微波炉、把订书机移到垫子上、把面包放进篮子、放空杯子、叠三块积木,覆盖了没见过的物体操作、关节类物体操作、双臂协同和长时序任务好几种类型。
| 任务 | WAN-Action | LingBot-VA | Zero-WAM |
|---|---|---|---|
| 把物体放上秤 | 3.00% | 6.17% | **24.67%** |
| 盖章 | 7.33% | 3.67% | **47.00%** |
| 开微波炉 | 2.26% | 29.33% | **59.00%** |
| 移动订书机到垫子 | 10.67% | 23.33% | **69.14%** |
| 面包放进篮子 | 15.26% | 17.33% | **35.00%** |
| 放空杯子 | 38.33% | 42.33% | **84.87%** |
| 叠三块积木 | 0.00% | 0.00% | **9.00%** |
| 平均 | 10.98% | 17.45% | **46.95%** |
七个任务里Zero-WAM全部领先,平均成功率46.95%,比业内此前较强的视频动作模型LingBot-VA高出29.5个百分点,比另一个直接基于Wan-2.2训练的基线高出35.97个百分点。放空杯子这个任务甚至跑到了84.87%,是另两个基线的两倍还多。最难的叠三块积木任务,其他两个方法全都是0%,Zero-WAM好歹啃下来9%。
这组数字什么概念?相当于原来10个未知任务里成功不到2个,现在10个里能成功接近5个,翻了差不多三倍。
除了仿真,团队还在真实的双臂Franka机器人上做了三类任务的验证:物体放入容器、三个物体的连续操作、两根桌腿的精细插孔。
| 任务 | 训练组合数 | 训练演示数 | LingBot-VA | Zero-WAM |
|---|---|---|---|---|
| 物体放入容器 | 30 | 120 | 43.3% | **53.3%** |
| 三物体连续操作 | 16 | 96 | 10.0% | **33.3%** |
| 两桌腿插孔 | 无 | 36 | 0.0% | **16.7%** |
最能说明问题的是插孔任务。这个任务要求把两根颜色不同的桌腿分别插进指定的孔位,孔位是靠人类视频里演示的顺序来指定的,属于那种语言很难精确描述、但视频一看就懂的场景。LingBot-VA靠语言指令完全没能成功,一次都没有,而Zero-WAM靠人类视频指令拿下了16.7%的成功率,尽管这个绝对数字听起来不算高,但从0到16.7%已经是质的飞跃。这也印证了开头那个直觉:有些事情,说不清楚,但演示一下就懂了。
**几个消融实验,把每个部件的价值都摆出来看**
论文还专门做了拆解实验,看看每个设计到底贡献了多少。
第一个实验单独看人类视频指令有没有用,把所有变体都限制在只用43个已知任务的数据上训练,去掉大规模预训练的干扰。结果显示,加了人类视频指令之后,平均成功率从10.98%直接跳到36.36%,涨了25个百分点,证明视频指令确实带来了纯文字指令给不了的额外信息。但即便如此,这个小规模训练出来的版本在叠三块积木这个任务上依然是0%,说明光有视频指令这个机制还不够,还得靠大规模、任务多样的预训练数据来撑起真正的长时序推理能力。
第二个实验专门看任务均衡采样的预训练数据有没有用,构造了一个把人类视频条件屏蔽掉的纯文字版本Zero-WAM,跟LingBot-VA对比。结果这个纯文字版本平均成功率39.44%,比LingBot-VA高出21.99个百分点,证明单单是把训练数据按任务重新做均衡采样这一步,就已经能带来实打实的泛化能力提升,跟有没有视频指令是两件独立起作用的事。
第三个实验就是前面提过的IFP模块,效果前面已经说过,从28.55%涨到46.95%。
三个实验拼起来看,整套Zero-WAM的提升不是靠单一某个技巧,而是数据均衡、视频指令、防捷径训练目标三件事一起发力的结果。这就好比一道菜好吃,不是因为某一种调料特别神奇,而是火候、食材新鲜度、调味比例这几件事都做对了,缺一个都不行。
**写在后面**
读完这篇论文,我最先想到的不是机器人技术本身,而是"教学"这件事的本质。人类教小孩、教徒弟,从来都不是只靠语言,示范永远是更古老、更有效的教学方式,这篇论文其实是把这个朴素的道理重新搬进了机器学习框架里,而且搬得挺讲究,没有直接套用现成思路,而是先解决了数据从哪来,再解决模型会不会偷懒学习这两个具体又棘手的问题。
有个细节我觉得特别值得单独说一说:论文提到,动作预测模块并不直接看人类视频,它只通过预测出的机器人未来画面来间接获取任务信息。这个设计初看有点绕,但仔细想想背后的逻辑是,如果任务语义已经被正确编码进了"想象中的画面",那动作生成这一步就应该只关心怎么让手臂动起来去实现这个画面,不需要再重复理解一遍任务是什么。这其实是把"理解任务"和"执行动作"这两件事彻底拆开,理解归视频预测模块管,执行归动作模块管,两者各司其职。这种拆分思路让我联想到人类做事的分工,一个人负责看懂说明书,另一个人负责照着做,中间用一张清晰的效果图作为交接凭证,比让同一个人既要理解又要执行要清晰得多。
论文里没有回答的一个问题是,这套自动生成人类视频的流水线依赖多个大模型串联,中间任何一环出错,比如任务语义分析错了、生成的视频物理上不合理,都会污染最终数据集的质量。论文提到有质检环节会打分筛掉不合格样本,但没有细说筛掉的比例有多高,这个流水线的实际"良品率"到底怎样,是个我很好奇但没在论文里找到答案的问题。
另外一个让我一直琢磨的地方是,这套方法目前的验证还局限在桌面级别的双臂操作,论文自己也承认了这一点,未来要走向移动机器人、走向更复杂动态的真实环境,人类视频指令这个思路还能不能撑住,这是个悬而未决的事。毕竟桌面操作的视频里,背景相对干净,物体数量有限,而真实世界里的场景要嘈杂得多,人类演示的动作里可能混杂着大量跟任务无关的信息,模型能不能从中准确抓出关键的任务语义,这是个更大的考验。
如果有一天你走进一家餐厅,看到机器人厨师只是看了一眼厨师长切菜的视频,就学会了一道从没做过的新菜,你会作何感想?
Q&A
Q1:Zero-WAM是什么?
A:Zero-WAM是一种因果视频动作模型,机器人可以通过跟随人类演示视频或语言指令来执行从未训练过的操作任务,实现零样本跨任务泛化。
Q2:HumanGen数据集是怎么造出来的?
A:研究团队设计了一套自动化流水线,利用大语言模型、图像编辑模型和视频生成模型,把已有的机器人操作视频批量转换成语义匹配的人类演示视频,最终生成7.42万组人机配对数据,覆盖8600个任务。
Q3:Zero-WAM在测试中表现如何?
A:在RoboTwin 2.0仿真平台的七个未见任务上,Zero-WAM平均成功率达到46.95%,比此前最强的视频动作模型高出29.5个百分点,真实机器人实验中同样全面领先。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)