机器人走出固定工位,进入真实生活环境后,会不断遇到训练数据没有覆盖的任务、物体摆放和交互情况。人可以通过观察示范、参考例子、回顾自己的尝试来应对变化,机器人能否也利用这些信息,在执行任务的过程中调整行为?

上海创智学院、华中科技大学、复旦大学等机构的研究者,在报告 《In-Context Robot Learning with VLM Agents》 中提出 GPT-Policy,系统研究通用视觉语言模型的机器人上下文学习能力。

报告围绕一个问题展开:一个参数保持不变的通用模型,能否从部署时提供的示范、目标和交互反馈中获取任务信息,并将其转化为真实机器人可执行、可验证的行为? 团队通过五类上下文、十项真实机器人任务,分析这种适应能力在哪些环节有效,以及它与可靠物理执行之间还有多大距离。

图 1|报告总体概览。任务指令、初始状态和上下文共同引导通用视觉语言模型生成机器人动作。五类上下文分别提供流程、动作、目标、交互和历史信息。图中包含操作、人机互动与移动取物等示意案例。

一、研究动机:让机器人在部署时获得缺失的任务信息

“把物体拿起来”这样的指令,往往没有交代从哪里抓、怎样配合双臂、先后执行哪些步骤。眼前的一张图像,也可能无法说明物体此前的位置,或人刚刚改变的意图。机器人需要把当前观察与更多任务信息联系起来。

报告将机器人上下文学习定义为:利用测试时给出的示范、例子或交互经验调整行为,期间不进行梯度更新,也不持久改变任务专用参数。适应能力需要体现在新初始状态下的实际行为中。

这项研究承接了两类已有工作:一类让语言与视觉语言模型参与技能选择、程序生成和动作决策;另一类让机器人策略通过示范轨迹、几何表示或人类视频获得任务信息。GPT-Policy 进一步考察,现成的通用多模态智能体在没有额外机器人专项训练的情况下,能够发挥多少上下文学习能力

不同上下文补充的信息并不相同:人类视频展示操作程序;机器人视频和对齐动作记录提供运动参考;目标图片明确最终布局;自身交互历史保留已经尝试的动作及结果;在线人机交互则传达人的实时意图和任务轮次。

二、方法:从上下文到动作,再用执行结果更新决策

GPT-Policy 的核心是一套共享的上下文到动作接口。通用视觉语言模型负责理解任务和选择工具,不同机器人平台的适配器负责将请求转化为可以执行的运动。

图 2|GPT-Policy 整体架构。任务指令、当前相机画面与机器人状态、任务参考、在线交互历史共同构成模型输入。模型参数保持固定,执行层返回新的观测和反馈,供下一步决策使用。

上下文如何组织? 系统将示范视频表示为按时间排列的关键帧,并保留视角标识、可用注释,以及对应的状态或动作记录。目标图片提供期望结果;执行过程中积累的观察、工具请求、返回结果和操作者反馈,则构成在线历史。历史示范与当前试验的实时状态保持区分,避免把过去的动作当成眼前已经发生的事实。

模型如何发出动作? 每一步,模型结合上述信息和上一次工具执行结果,提出一项结构化请求。请求可以指定机械臂末端的目标位置与姿态,也可以包含有序的目标序列;夹爪开合通过单独的工具控制。模型因而能够表达抓取、移动和双臂配合等操作意图。

动作如何落到机器人上? 执行层在目标之间插值、采样,对采样位姿求解逆运动学并检查误差,再安排满足相应运动限制的时序。动作完成或被拒绝后,系统返回测量状态、执行情况或错误信息,让模型据此继续规划。

图 3|从工具请求到机器人执行。上半部分展示模型输入与结构化请求;下半部分依次处理目标位姿、路径采样、逆运动学与时序、执行与观测。虚线表示返回下一步决策的反馈。

这一闭环让示范成为可供参考的信息,并允许机器人根据当前场景与执行结果调整行动。与此同时,模型声称“完成”与物理任务确实成功仍是两回事,最终需要检查真实场景是否达到任务标准。

三、真实机器人实验:五类上下文分别带来什么?

报告以 GPT-6 Astra 为主要评估模型。每次试验从重置后的场景开始,在成功、执行预算耗尽或触发安全终止条件时结束。实验记录任务完成情况、决策次数和执行时间;平均决策次数与时间包含失败试验。

1. 人类视频:从人的操作过程获取程序性指导

团队首先比较了有无人类视频示范时,机器人取红色毛巾和取笔记本的表现。两种条件使用相同的任务指令与现场观测,区别在于是否提供一段人类操作视频。

以下视频按实验条件对照展示,均为选取的单次运行。

取红色毛巾:有无人类视频示范的对比

相同任务指令与现场观测,对比人类示范如何影响双手配合和抓取顺序。

无人类视频示范

取红色毛巾:有无人类视频示范的对比|无人类视频示范

20 倍加速 · 73.5 秒;本片结果:放弃。

有人类视频示范

取红色毛巾:有无人类视频示范的对比|有人类视频示范

20 倍加速 · 45.5 秒;本片结果:成功。

图 4|人类视频如何影响执行。每项任务分别展示人类示范、无示范条件和加入人类视频后的机器人执行,画面从左向右按时间排列。示范不包含机器人动作标签。

取红色毛巾

指标

无人类示范

加入人类视频

完成情况

未成功完成

部分试验成功

平均决策次数

96.3

76.7

平均耗时

24.6 分钟

18.9 分钟

取笔记本

指标

无人类示范

加入人类视频

完成情况

未成功完成

部分试验成功

平均决策次数

94.0

66.7

平均耗时

24.6 分钟

16.1 分钟

加入人类视频后,两项任务均出现成功完成的试验,平均决策次数与执行时间也有所减少,但仍存在失败案例。机器人没有获得人类动作对应的机器人控制标签,需要从视觉过程理解抓取方式和操作顺序,再结合自身与现场情况生成运动目标。这为跨越人手与机械臂差异、迁移操作策略提供了初步证据。

2. 机器人视频与动作参考:为接触敏感操作补充运动细节

拧瓶盖和插头拔出再插回,对姿态与接触关系提出了更细的要求。团队比较了无示范、机器人视频、机器人视频加对齐动作参考三个条件。动作参考在同一视频基础上增加了末端位姿、夹爪状态和动作指令。

图 5|机器人示范与执行对照。上半部分为开瓶盖,下半部分为插头拔出再插回。金色框标记示范中的参考区域,红色标记局部偏离,绿色标记更接近示范的表现。

任务

无示范

机器人视频

视频+动作参考

拧开瓶盖

未成功完成

部分试验成功

均成功完成

拔出并重新插入插头

未成功完成

未成功完成

部分试验成功

成功判据关注最终物理状态:开瓶后,瓶子要稳定站立;插头需要插回原插座,并在夹爪松开后保持完全就位。加入动作参考后,两项任务在当前评估中取得了更好的完成表现,但并非所有执行成本都会降低。例如,开瓶任务的平均耗时从仅视频条件的 15.2 分钟变为 17.9 分钟。

拧开瓶盖:三种上下文条件对比

移开瓶盖后,将瓶子稳定放回桌面。

无示范

拧开瓶盖:三种上下文条件对比|无示范

20 倍加速 · 66.6 秒;本片结果:预算耗尽。

仅机器人视频

拧开瓶盖:三种上下文条件对比|仅机器人视频

20 倍加速 · 33.5 秒;本片结果:成功,但动作变形。

视频+动作参考

拧开瓶盖:三种上下文条件对比|视频+动作参考

20 倍加速 · 45.0 秒;本片结果:成功。

插头拔插:三种上下文条件对比

拔出插头后插回原插座,松开夹爪后仍需完全就位。

无示范

插头拔插:三种上下文条件对比|无示范

20 倍加速 · 20.9 秒;本片结果:放弃。

仅机器人视频

插头拔插:三种上下文条件对比|仅机器人视频

20 倍加速 · 25.9 秒;本片结果:放弃。

视频+动作参考

插头拔插:三种上下文条件对比|视频+动作参考

20 倍加速 · 30.3 秒;本片结果:成功。

为什么动作信息可能有帮助?报告进一步分析了开瓶任务中的姿态。选取的执行案例显示,加入动作参考后,机器人请求的姿态和测得的支撑姿态更接近示范。

图 6|动作参考如何约束运动选择。左侧比较支撑夹爪的实际倾角,以及不同阶段目标姿态与示范的差异;右侧前三列按接近瓶盖、旋拧、离开瓶口三个动作阶段对齐,末列单独展示最终状态。D、V、A 分别表示示范、仅视频、视频加动作参考,编号与左侧时间曲线上的取样点对应。这是选取案例的分析。

开瓶示范中,13 个视频关键帧对应保留了 205 个动作样本;插头任务中,14 个关键帧对应 131 个动作样本。研究者提出,更密集的动作信息可能减少模型对关键帧之间运动过程的猜测,为姿态选择和夹爪变化提供更具体的依据。

3. 目标图片:直接说明最终应该摆成什么样

在摆出 T 形积木和按参考布局摆放水果的任务中,机器人获得一张目标图片,两项任务在本轮试验中均成功完成,平均耗时分别为 15.8 分钟和 12.4 分钟。

图片能够同时表达物体身份、相对位置和间距,补充语言指令难以简洁描述的空间要求。系统根据最终布局安排中间步骤,无需由目标图片指定完整的动作序列。

4. 自身交互历史:利用已经发生的事情继续探索

“把柠檬放到粉色盘子里”和移动探索两项任务,保留了机器人此前的观察、动作及执行结果,在本轮试验中均成功完成。

在柠檬任务中,机器人主动移开毛巾,露出并找到被遮挡的粉色盘子,再完成放置;移动探索中,机器人在搜索目标时主动避开路径上的障碍。这些行为展示了对中间目标的推理:通过改变场景获得缺失信息,或选择可行路线继续搜索。

移动探索:寻找雪碧瓶并放入篮子

通过改变视角、移动和持续搜索找到目标,再完成取放。

自身交互历史

移动探索:寻找雪碧瓶并放入篮子|自身交互历史

30 倍加速 · 44.9 秒;本片结果:成功。

5. 在线人机交互:用手势和轮次理解人的意图

井字棋和按人指向拾取水果,分别测试轮流行动与目标指示。模型需要利用人的落子、棋盘状态或指向,更新自己接下来的行动。两项任务在本轮试验中均成功完成,其中井字棋将获胜与和棋都计为成功。

在线交互:机器人与人轮流下井字棋

结合人的落子与棋盘状态轮流行动;胜局与和局均计为任务成功。

在线人机交互

在线交互:机器人与人轮流下井字棋|在线人机交互

20 倍加速 · 48.9 秒;本片结果:成功。

图 7|后三类上下文的执行案例。从上到下依次为 T 形积木、水果布局、柠檬放盘、移动探索、井字棋和指向拾取水果,每行按时间展开。它们分别展示目标表达、探索记忆和在线协作的作用。

这六项任务呈现了不同上下文的用途。其主结果表未逐一提供移除相应上下文后的对照,因此,这些成功案例展示了上下文的应用方式,尚不能单独量化各类上下文带来的增益。

四、讨论:上下文改善了决策,可靠执行仍需继续突破

报告还选取红色毛巾任务的个别运行,比较不同模型及上下文条件的执行过程。对 GPT-6 Astra,加入人类视频后,所选案例的任务进度从 55% 变为 100%,运行时间约缩短 35.6%,估计 token 用量约减少 58.9%。Fable 5.1 与 Kimi K3 的所选案例分别达到 30% 和 20% 的任务进度。

图 8|红色毛巾任务的案例对比。左侧为任务进度、运行时间和估计 token 用量,右侧为执行过程。这里的百分比表示个别运行的任务完成程度,不是多次试验成功率,也不足以建立可靠的模型排名。

结合这些实验,报告归纳了三点认识。

少量相关上下文能够改变机器人行为。 人类视频提供操作流程,动作参考补充运动细节。将这些信息组织为清晰、与当前任务相关的上下文,有助于通用模型利用示范,尝试精细操作和可变形物体处理。

理解任务之后,还需要把动作做准确。 上下文能够改善目标理解、规划与适应,但精确位姿、接触执行、结果核验和物理安全仍需单独解决。团队在试验中观察到双臂碰撞,也说明现有执行约束尚不足以保障可靠自主操作。

模型决策的时间与成本值得关注。 当前多项任务仍需分钟级执行。报告提出,可以让通用智能体承担上下文推理、任务调整和重新规划,让 VLA 等快速控制器负责局部姿态修正与双臂协调。

围绕这些问题,报告进一步提出六个研究方向:建立独立的物理安全层;引入抓取稳定性、滑移和受力等接触反馈;结合快速控制与较慢的深度推理;发展主动感知和移动操作;从多个示范组合长程任务;利用近期交互适应摩擦、柔顺性等物理变化。

受真实机器人评估耗时较长及可用 token 预算限制,当前评估覆盖的任务与平台仍有限,消融分析尚不完整,模型预训练经历的影响也难以完全厘清。因此,更广泛的泛化能力、全新技能获取和稳定自主执行,仍需进一步验证。

GPT-Policy 将机器人上下文学习落实到一条可研究的感知与动作链路:机器人从示范、目标和互动中获得信息,形成决策,再通过执行结果更新判断。让这种适应能力贯穿感知、记忆、精细控制与安全机制,是通用智能体走向真实物理世界的下一步。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐