Franka 赋能模型应用新研究,Zero-WAM:基于人类视频上下文的世界-动作模型与零样本任务泛化
项目概述
零样本跨任务泛化是机器人操作领域的一项核心挑战:策略需要在未经训练的新任务上执行,而无需更新任何模型参数。受大语言模型中上下文学习(In-Context Learning)范式的启发,研究团队提出了一种思路——将任务泛化转化为任务规范问题,即通过在部署时提供任务上下文来驱动策略执行。
基于这一理念,Zero-WAM(Zero-Shot World-Action Model) 应运而生。Zero-WAM是一个因果视频-动作模型,能够通过上下文的人类视频指导来执行未见过的任务。与依赖语言指令的视觉-语言-动作(VLA)模型不同,Zero-WAM将人类演示视频作为任务规范的核心载体——视频能够直接呈现期望的视觉状态变化及其时间演化,为策略提供语言难以精确描述的丰富视觉线索。

Zero-WAM的核心方法与数据支撑
Zero-WAM支持两种任务规范形式:语言指令和人类演示视频。给定任一种指令,模型能够自回归地预测未来的机器人视频和可执行动作。为实现这一能力,研究团队构建了HumanGen数据集,包含7.42万个人类-机器人上下文学习对,覆盖8.6K项任务。数据集通过自动化“上下文人类视频生成管道”将任务采样的机器人轨迹转换为语义匹配的人类操作视频。
Zero-WAM:基于人类视频上下文的世界-动作模型与零样本
在模型训练中,Zero-WAM引入了上下文未来块预测(IFP)目标,该目标通过监督多个跨步的未来机器人视频块,鼓励模型从人类视频中编码长期任务演化信息,而非依赖已见任务的捷径。

在RoboTwin 2.0仿真的七项未见任务上,Zero-WAM取得了46.95%的平均成功率,较最强的视频-动作基线提升了29.50个百分点。在真实世界实验中,Zero-WAM展示了在多物体场景、长时序操作和精细插装等未见任务配置上的泛化能力。
Franka Research 3在Zero-WAM项目中的角色
Zero-WAM的真实世界验证基于双臂Franka Research 3(FR3 Duo) 系统。Franka Research 3是此前广泛使用的Franka Panda机械臂的升级型号,其技术特性为Zero-WAM的复杂任务评估提供了硬件基础:

七自由度与力敏感控制:Franka Research 3具备7个自由度,每个关节均集成扭矩传感器。这一力敏感特性使得机器人能够在接触丰富的操作中感知并响应外力变化,对于需要精细力控的任务(如插装、推压等)较为关键。
3kg有效载荷与855mm臂展:有效载荷和臂展覆盖了94.5%的工作空间,能够处理Zero-WAM评估中涉及的多种日常物品(书本、碗、盒子、桌腿、灯泡等)的搬运与操作。
±0.1mm重复定位精度:有助于在多步操作和精密插装任务中保持动作的一致性。
ROS兼容性与开源生态:Franka Research 3深度集成ROS,为Zero-WAM的软件栈部署提供了便利。双臂配置支持“一臂固定、一臂操作”的协作模式,在Zero-WAM的“双桌腿插装”和“三物体顺序操作”等任务中得到了应用。
在真实世界评估中,Zero-WAM在“物体到容器放置”任务上达到53.3%的成功率,“三物体顺序操作”为33.3%,“双桌腿插装”为16.7%,均优于语言指令驱动的LingBot-VA基线。双臂Franka Research 3系统为这些评估提供了可重复的实验平台。
总结
Zero-WAM展示了将人类视频作为上下文任务规范,实现零样本跨任务泛化的可行性。而Franka Research 3双臂系统凭借其七自由度构型、全关节扭矩传感和稳定的重复定位精度,为Zero-WAM在真实世界的多物体、长时序和精密操作评估提供了可靠的硬件平台。随着世界-动作模型研究的不断深入,兼具力敏感特性和开放软件生态的硬件平台有望继续作为重要的实验基准。
项目详情:
Zero-WAM: In-Context World-Action Modeling from Human Videos for Open-Ended Task Generalization
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐

所有评论(0)