不更新模型参数,机器人如何从上下文中学习?GPT-Policy 的真实世界探索
机器人走出固定工位,进入真实生活环境后,会不断遇到训练数据没有覆盖的任务、物体摆放和交互情况。人可以通过观察示范、参考例子、回顾自己的尝试来应对变化,机器人能否也利用这些信息,在执行任务的过程中调整行为?
上海创智学院、华中科技大学、复旦大学等机构的研究者,在报告 《In-Context Robot Learning with VLM Agents》 中提出 GPT-Policy,系统研究通用视觉语言模型的机器人上下文学习能力。
报告围绕一个问题展开:一个参数保持不变的通用模型,能否从部署时提供的示范、目标和交互反馈中获取任务信息,并将其转化为真实机器人可执行、可验证的行为? 团队通过五类上下文、十项真实机器人任务,分析这种适应能力在哪些环节有效,以及它与可靠物理执行之间还有多大距离。

图 1|报告总体概览。任务指令、初始状态和上下文共同引导通用视觉语言模型生成机器人动作。五类上下文分别提供流程、动作、目标、交互和历史信息。图中包含操作、人机互动与移动取物等示意案例。
一、研究动机:让机器人在部署时获得缺失的任务信息
“把物体拿起来”这样的指令,往往没有交代从哪里抓、怎样配合双臂、先后执行哪些步骤。眼前的一张图像,也可能无法说明物体此前的位置,或人刚刚改变的意图。机器人需要把当前观察与更多任务信息联系起来。
报告将机器人上下文学习定义为:利用测试时给出的示范、例子或交互经验调整行为,期间不进行梯度更新,也不持久改变任务专用参数。适应能力需要体现在新初始状态下的实际行为中。
这项研究承接了两类已有工作:一类让语言与视觉语言模型参与技能选择、程序生成和动作决策;另一类让机器人策略通过示范轨迹、几何表示或人类视频获得任务信息。GPT-Policy 进一步考察,现成的通用多模态智能体在没有额外机器人专项训练的情况下,能够发挥多少上下文学习能力。
不同上下文补充的信息并不相同:人类视频展示操作程序;机器人视频和对齐动作记录提供运动参考;目标图片明确最终布局;自身交互历史保留已经尝试的动作及结果;在线人机交互则传达人的实时意图和任务轮次。
二、方法:从上下文到动作,再用执行结果更新决策
GPT-Policy 的核心是一套共享的上下文到动作接口。通用视觉语言模型负责理解任务和选择工具,不同机器人平台的适配器负责将请求转化为可以执行的运动。

图 2|GPT-Policy 整体架构。任务指令、当前相机画面与机器人状态、任务参考、在线交互历史共同构成模型输入。模型参数保持固定,执行层返回新的观测和反馈,供下一步决策使用。
上下文如何组织? 系统将示范视频表示为按时间排列的关键帧,并保留视角标识、可用注释,以及对应的状态或动作记录。目标图片提供期望结果;执行过程中积累的观察、工具请求、返回结果和操作者反馈,则构成在线历史。历史示范与当前试验的实时状态保持区分,避免把过去的动作当成眼前已经发生的事实。
模型如何发出动作? 每一步,模型结合上述信息和上一次工具执行结果,提出一项结构化请求。请求可以指定机械臂末端的目标位置与姿态,也可以包含有序的目标序列;夹爪开合通过单独的工具控制。模型因而能够表达抓取、移动和双臂配合等操作意图。
动作如何落到机器人上? 执行层在目标之间插值、采样,对采样位姿求解逆运动学并检查误差,再安排满足相应运动限制的时序。动作完成或被拒绝后,系统返回测量状态、执行情况或错误信息,让模型据此继续规划。

图 3|从工具请求到机器人执行。上半部分展示模型输入与结构化请求;下半部分依次处理目标位姿、路径采样、逆运动学与时序、执行与观测。虚线表示返回下一步决策的反馈。
这一闭环让示范成为可供参考的信息,并允许机器人根据当前场景与执行结果调整行动。与此同时,模型声称“完成”与物理任务确实成功仍是两回事,最终需要检查真实场景是否达到任务标准。
三、真实机器人实验:五类上下文分别带来什么?
报告以 GPT-6 Astra 为主要评估模型。每次试验从重置后的场景开始,在成功、执行预算耗尽或触发安全终止条件时结束。实验记录任务完成情况、决策次数和执行时间;平均决策次数与时间包含失败试验。
1. 人类视频:从人的操作过程获取程序性指导
团队首先比较了有无人类视频示范时,机器人取红色毛巾和取笔记本的表现。两种条件使用相同的任务指令与现场观测,区别在于是否提供一段人类操作视频。
以下视频按实验条件对照展示,均为选取的单次运行。
取红色毛巾:有无人类视频示范的对比
相同任务指令与现场观测,对比人类示范如何影响双手配合和抓取顺序。
无人类视频示范
取红色毛巾:有无人类视频示范的对比|无人类视频示范
20 倍加速 · 73.5 秒;本片结果:放弃。
有人类视频示范
取红色毛巾:有无人类视频示范的对比|有人类视频示范
20 倍加速 · 45.5 秒;本片结果:成功。

图 4|人类视频如何影响执行。每项任务分别展示人类示范、无示范条件和加入人类视频后的机器人执行,画面从左向右按时间排列。示范不包含机器人动作标签。
取红色毛巾
|
指标 |
无人类示范 |
加入人类视频 |
|---|---|---|
|
完成情况 |
未成功完成 |
部分试验成功 |
|
平均决策次数 |
96.3 |
76.7 |
|
平均耗时 |
24.6 分钟 |
18.9 分钟 |
取笔记本
|
指标 |
无人类示范 |
加入人类视频 |
|---|---|---|
|
完成情况 |
未成功完成 |
部分试验成功 |
|
平均决策次数 |
94.0 |
66.7 |
|
平均耗时 |
24.6 分钟 |
16.1 分钟 |
加入人类视频后,两项任务均出现成功完成的试验,平均决策次数与执行时间也有所减少,但仍存在失败案例。机器人没有获得人类动作对应的机器人控制标签,需要从视觉过程理解抓取方式和操作顺序,再结合自身与现场情况生成运动目标。这为跨越人手与机械臂差异、迁移操作策略提供了初步证据。
2. 机器人视频与动作参考:为接触敏感操作补充运动细节
拧瓶盖和插头拔出再插回,对姿态与接触关系提出了更细的要求。团队比较了无示范、机器人视频、机器人视频加对齐动作参考三个条件。动作参考在同一视频基础上增加了末端位姿、夹爪状态和动作指令。

图 5|机器人示范与执行对照。上半部分为开瓶盖,下半部分为插头拔出再插回。金色框标记示范中的参考区域,红色标记局部偏离,绿色标记更接近示范的表现。
|
任务 |
无示范 |
机器人视频 |
视频+动作参考 |
|---|---|---|---|
|
拧开瓶盖 |
未成功完成 |
部分试验成功 |
均成功完成 |
|
拔出并重新插入插头 |
未成功完成 |
未成功完成 |
部分试验成功 |
成功判据关注最终物理状态:开瓶后,瓶子要稳定站立;插头需要插回原插座,并在夹爪松开后保持完全就位。加入动作参考后,两项任务在当前评估中取得了更好的完成表现,但并非所有执行成本都会降低。例如,开瓶任务的平均耗时从仅视频条件的 15.2 分钟变为 17.9 分钟。
拧开瓶盖:三种上下文条件对比
移开瓶盖后,将瓶子稳定放回桌面。
无示范
拧开瓶盖:三种上下文条件对比|无示范
20 倍加速 · 66.6 秒;本片结果:预算耗尽。
仅机器人视频
拧开瓶盖:三种上下文条件对比|仅机器人视频
20 倍加速 · 33.5 秒;本片结果:成功,但动作变形。
视频+动作参考
拧开瓶盖:三种上下文条件对比|视频+动作参考
20 倍加速 · 45.0 秒;本片结果:成功。
插头拔插:三种上下文条件对比
拔出插头后插回原插座,松开夹爪后仍需完全就位。
无示范
插头拔插:三种上下文条件对比|无示范
20 倍加速 · 20.9 秒;本片结果:放弃。
仅机器人视频
插头拔插:三种上下文条件对比|仅机器人视频
20 倍加速 · 25.9 秒;本片结果:放弃。
视频+动作参考
插头拔插:三种上下文条件对比|视频+动作参考
20 倍加速 · 30.3 秒;本片结果:成功。
为什么动作信息可能有帮助?报告进一步分析了开瓶任务中的姿态。选取的执行案例显示,加入动作参考后,机器人请求的姿态和测得的支撑姿态更接近示范。

图 6|动作参考如何约束运动选择。左侧比较支撑夹爪的实际倾角,以及不同阶段目标姿态与示范的差异;右侧前三列按接近瓶盖、旋拧、离开瓶口三个动作阶段对齐,末列单独展示最终状态。D、V、A 分别表示示范、仅视频、视频加动作参考,编号与左侧时间曲线上的取样点对应。这是选取案例的分析。
开瓶示范中,13 个视频关键帧对应保留了 205 个动作样本;插头任务中,14 个关键帧对应 131 个动作样本。研究者提出,更密集的动作信息可能减少模型对关键帧之间运动过程的猜测,为姿态选择和夹爪变化提供更具体的依据。
3. 目标图片:直接说明最终应该摆成什么样
在摆出 T 形积木和按参考布局摆放水果的任务中,机器人获得一张目标图片,两项任务在本轮试验中均成功完成,平均耗时分别为 15.8 分钟和 12.4 分钟。
图片能够同时表达物体身份、相对位置和间距,补充语言指令难以简洁描述的空间要求。系统根据最终布局安排中间步骤,无需由目标图片指定完整的动作序列。
4. 自身交互历史:利用已经发生的事情继续探索
“把柠檬放到粉色盘子里”和移动探索两项任务,保留了机器人此前的观察、动作及执行结果,在本轮试验中均成功完成。
在柠檬任务中,机器人主动移开毛巾,露出并找到被遮挡的粉色盘子,再完成放置;移动探索中,机器人在搜索目标时主动避开路径上的障碍。这些行为展示了对中间目标的推理:通过改变场景获得缺失信息,或选择可行路线继续搜索。
移动探索:寻找雪碧瓶并放入篮子
通过改变视角、移动和持续搜索找到目标,再完成取放。
自身交互历史
移动探索:寻找雪碧瓶并放入篮子|自身交互历史
30 倍加速 · 44.9 秒;本片结果:成功。
5. 在线人机交互:用手势和轮次理解人的意图
井字棋和按人指向拾取水果,分别测试轮流行动与目标指示。模型需要利用人的落子、棋盘状态或指向,更新自己接下来的行动。两项任务在本轮试验中均成功完成,其中井字棋将获胜与和棋都计为成功。
在线交互:机器人与人轮流下井字棋
结合人的落子与棋盘状态轮流行动;胜局与和局均计为任务成功。
在线人机交互
在线交互:机器人与人轮流下井字棋|在线人机交互
20 倍加速 · 48.9 秒;本片结果:成功。

图 7|后三类上下文的执行案例。从上到下依次为 T 形积木、水果布局、柠檬放盘、移动探索、井字棋和指向拾取水果,每行按时间展开。它们分别展示目标表达、探索记忆和在线协作的作用。
这六项任务呈现了不同上下文的用途。其主结果表未逐一提供移除相应上下文后的对照,因此,这些成功案例展示了上下文的应用方式,尚不能单独量化各类上下文带来的增益。
四、讨论:上下文改善了决策,可靠执行仍需继续突破
报告还选取红色毛巾任务的个别运行,比较不同模型及上下文条件的执行过程。对 GPT-6 Astra,加入人类视频后,所选案例的任务进度从 55% 变为 100%,运行时间约缩短 35.6%,估计 token 用量约减少 58.9%。Fable 5.1 与 Kimi K3 的所选案例分别达到 30% 和 20% 的任务进度。

图 8|红色毛巾任务的案例对比。左侧为任务进度、运行时间和估计 token 用量,右侧为执行过程。这里的百分比表示个别运行的任务完成程度,不是多次试验成功率,也不足以建立可靠的模型排名。
结合这些实验,报告归纳了三点认识。
少量相关上下文能够改变机器人行为。 人类视频提供操作流程,动作参考补充运动细节。将这些信息组织为清晰、与当前任务相关的上下文,有助于通用模型利用示范,尝试精细操作和可变形物体处理。
理解任务之后,还需要把动作做准确。 上下文能够改善目标理解、规划与适应,但精确位姿、接触执行、结果核验和物理安全仍需单独解决。团队在试验中观察到双臂碰撞,也说明现有执行约束尚不足以保障可靠自主操作。
模型决策的时间与成本值得关注。 当前多项任务仍需分钟级执行。报告提出,可以让通用智能体承担上下文推理、任务调整和重新规划,让 VLA 等快速控制器负责局部姿态修正与双臂协调。
围绕这些问题,报告进一步提出六个研究方向:建立独立的物理安全层;引入抓取稳定性、滑移和受力等接触反馈;结合快速控制与较慢的深度推理;发展主动感知和移动操作;从多个示范组合长程任务;利用近期交互适应摩擦、柔顺性等物理变化。
受真实机器人评估耗时较长及可用 token 预算限制,当前评估覆盖的任务与平台仍有限,消融分析尚不完整,模型预训练经历的影响也难以完全厘清。因此,更广泛的泛化能力、全新技能获取和稳定自主执行,仍需进一步验证。
GPT-Policy 将机器人上下文学习落实到一条可研究的感知与动作链路:机器人从示范、目标和互动中获得信息,形成决策,再通过执行结果更新判断。让这种适应能力贯穿感知、记忆、精细控制与安全机制,是通用智能体走向真实物理世界的下一步。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)