26年8月Generalist AI发布GEN 1.5 “embodied foundation models as one-shot learner”: https://generalistai.com/blog/gen-1.5。

人类拥有惊人的能力,仅凭一个或几个例子就能掌握新的物理技能。最新的机器人基础模型 GEN-1.5 也展现出这种能力的雏形:它无需梯度更新或微调,仅凭一个例子就能在几秒钟内学习一项新任务。它在单样本和少样本演示学习以及零样本物理泛化方面都展现出广泛的能力。尽管这些任务简单且周期短,但这是一个能够大规模实现单样本和少样本物理技能学习的模型。这些成果是其构建物理世界通用智能这一使命的重要一步。


机器人基础模型的优势显而易见:走到机器人跟前,它几乎可以立即执行任何任务。无论是零样本、单样本还是少样本学习,从能力角度来看,关键在于即时性和通用性:模型能否快速学习新任务并推广到新的情境?对于物理任务而言,这种智能水平既要求机器人具备理解任务意图的广泛能力,也要求其能够实时、闭环地适应现实世界中意想不到的变化。

对于语言模型而言,仅凭一个或几个示例就能快速学习新任务的能力是 GPT-3 的标志性功能。在广泛的语言任务中,GPT-3 在未经训练的情况下,仅凭一次上下文提示就能达到约 45% 的平均准确率,而使用少量示例(约 100 个示例)时,准确率最高可达约 65%。在 GPT-3 之前,一些模型也展现出零样本学习能力,甚至在少量示例学习方面取得了初步成果,但 GPT-3 在更广泛的少量示例学习方面表现显著更佳,同时在泛化能力方面也实现了当时的巨大飞跃。

在机器人领域,人们数十年来一直在探索如何开发能够从一次或几次演示中概括任务的系统——其历史至少可以追溯到1954年Unimate专利【3】的“引导式教学”以及1970年麻省理工学院的Copy Demo【4】。大量先前的研究,包括其自己的研究【5】,都展示了各种形式的上下文学习,但这些学习仅限于有限的任务变体,或受限于特定的对象、任务类型或感知方式【6,7,8,9,10,11】。仅通过一次或几次演示就能学习闭环物理技能,并且能够在没有这些限制的情况下将其应用于广泛的任务,这一能力一直被认为遥不可及。这种能力很可能建立在能够实现其他广泛泛化能力的基础之上。
请添加图片描述

1 GEN-1.5 推出

开发 GEN-1.5,是最新的机器人基础模型。该模型展现了强大的单样本和少样本演示学习能力,以及零样本泛化能力,例如即兴发挥和使用新工具(如刷子、簸箕等)。GEN-1.5 是一款大型多模态模型,能够处理视频输入(30 秒的记忆,以及其他传感器、语言和本体感觉输入),并生成 100 Hz 的动作轨迹。其功能包括:

通过上下文提示进行单样本学习。只需 3 到 12 秒的单次演示提示,模型即可在几秒钟内学习新任务,无需任何训练。将上下文窗口中的感觉运动示例的使用称为“物理提示”。

组合泛化。给定两个不同的上下文物理提示,模型可以将它们串联成一个持续时间更长的单一行为。

零样本仿真到现实迁移。即使预训练过程中不包含任何模拟数据,模拟中录制的演示也能作为现实世界任务的物理提示。

人机模仿。在某些情况下,人可以在机器人摄像头的视野范围内用自己的双手演示任务,模型会用机器人的双手重现该任务。

基于梯度下降的少样本自适应。模型可以在 1-5 分钟的数据(约 10-50 次演示)上,通过 1-10 个梯度步骤进行微调,以适应新的任务。

即兴创造新的策略和工具使用方法。模型在行为策略层面具有泛化能力:形成全新的路径以达到目标,使用未见过的工具(例如刷子、簸箕等)为使用其他工具演示的任务创造新的解决方案,即使在被提示或微调为使用特定手执行任务时,也能左右手灵活操作。

这些能力似乎直接源于对大量物理交互数据的预训练。其并未针对任何此类任务进行专门训练:没有为了促进上下文学习而进行的架构更改,没有内部或外部元学习循环【12】迫使模型从最少的数据中进行适应,也没有鼓励即兴发挥的辅助目标【13】。令人惊讶的是,GEN-1.5 开箱即用,就能在广泛的物理任务中做到这一点。
请添加图片描述

在10项不同任务的实验中,预训练模型仅需一次上下文提示即可达到平均59%(标准差±10%)的成功率。而通过少样本学习,每个任务使用5分钟数据(约50次演示),并进行10步梯度训练,成功率可提升至83%(标准差±9%)。在某些情况下,上下文学习新任务的性能甚至优于在相同演示数据上进行1-5步梯度训练。尽管这些任务较为简单且周期较短,成功率也相对较低,但这是一个仅凭一次或几次演示就能学习多种灵巧闭环物理任务的模型。
请添加图片描述

2 机器人预训练的规模化

过去两年,其一直致力于构建一个预训练引擎,用于扩展基于物理经验从零开始训练的具身基础模型,同时不断改进算法,从而加速发展。正如在九个月前宣布的那样,在 GEN-0【14】 发布之前,已经开始观察到可预测的扩展规律【15】。五个月后,发布 GEN-1【16】,该模型展现了在 99% 以上的成功率下进行后训练以掌握任务的能力,并初步展现出即兴智能(improvisational AI)的迹象。

GEN-1.5 的初始预训练并行启动——至今已持续训练超过八个月。让它持续运行,因为追踪的每个指标都随着引擎的运行而不断提升:吸收更多数据、计算扩展效率更高,并通过一系列精准的架构和算法改进实现了飞跃式增长。很明显,模型正在不断改进,而且趋势始终如一:新任务的数据效率更高、计算效率更高、通用性更强。
请添加图片描述

随着模型不断训练,开始尝试用最少的微调步骤来适应新任务,结果发现模型能够从数百步、数十步,最终仅需一分钟的数据,就能学习新任务。此前从未观察到如此少的梯度步骤就能学习技能。其随后提出疑问:该模型能否在不进行训练的情况下,完全在上下文中学习新任务,且无需梯度步骤?这一发现改变了对这些模型用途、潜在影响以及构建通用物理智能未来发展方向的思考。

3 上下文中的单样本学习

GEN-1.5 可以通过插入到其 30 秒上下文窗口中的单个演示来触发,其余时间用于记录滚动观察数据。物理提示是感觉运动示例(即传感器数据加上动作轨迹),记录方式可以是使用一对手持式机械臂进行操作的人类数据,也可以是机器人自身的滚动动作。一旦提示信息被纳入上下文,模型便能立即执行任务,无需任何训练步骤。单样本学习在上下文中的性能表现一般(在包括拉拉链、打开罐子、从钱包里掏钱等在内的各种任务中,平均成功率为 59%),但令人惊讶的是,仅仅在上下文缓冲区中插入一个演示,而无需任何训练,就能获得可衡量的能力。这极大地加快了达到基本性能水平的速度,随后可以进一步精进,最终达到精通水平【16】。目前,在上下文中学习到的技能比经过微调的模型更脆弱,但它们可以泛化到一些扰动,进行即兴发挥,并从错误中恢复。

如图所示:物理提示工程采用拖放界面,用户可以通过选择要插入模型上下文窗口的演示内容。这段实时录像展示了如何通过物理提示,让模型连续学习两项不同的任务:(i)拉开铅笔袋拉链,(ii)从铅笔袋中取出钱。
请添加图片描述

并未对 GEN-1.5 进行明确的上下文学习训练,测试任务也并非预先设计在预训练数据中。这是一个通用模型,在训练过程中并未考虑预训练数据的分布情况。

这种能力为何能从预训练中涌现,目前尚难确定。一种假设是,类比语言,物理观察和动作的分布可能呈现出“突发性”和齐普夫(Zipfian)结构,这种结构与语言模型中的上下文学习密切相关【17】。另一种可能是,体力劳动本身就包含自然的重复周期,模型可能已经学会了检测和扩展此类模式,就像语言模型处理一般序列一样【18】。该模型基于从数据引擎中随机抽取的连续数据跨度(记录了家庭、仓库、工厂等场所的活动)进行预训练,没有使用任何专门的基础设施将样本打包到上下文中——物理提示引入了模型在训练过程中从未遇到过的时间上的不连续跳跃。

机器人技术本质上是多模态的;就像人类学习一样,教机器人学习新事物的方法有很多——对于人类来说,最自然的方式或许是(a)演示或(b)语言指令【19】。虽然语言足以满足某些任务的描述需求,但许多物理动作很难用语言精确描述【20】(例如,演示如何摆放两块乐高积木远比用语言描述容易得多)。在自然观察和动作中提示任务也是对感觉运动理解能力的更全面测试:模型必须从演示中推断目标,重新利用现有知识,并在新的初始条件下进行即兴发挥。

基于物理提示工程的组合泛化

物理提示也可以组合。例如,如果把两个不同任务的演示放在同一个情境中(每个演示都是独立录制的,彼此之间没有过渡),GEN-1.5 可以将它们串联成一个连续的行为,执行一个任务后自然过渡到下一个任务。该模型自行连接了两者,产生了在两种演示中均未出现的中间运动(重新定位、重新抓取、错误恢复)。
请添加图片描述

在实践中,这开启“物理提示工程”:无需收集完整的复合任务演示,即可从小型可重用物理提示库中构建该任务。随着模型的改进,在特定情境中组合技能可能成为一种编写长期行为的实用方法;这类似于语言提示中指令的串联。

基于上下文学习的零样本仿真-到-真实迁移

上下文学习也跨越了仿真到真实的鸿沟。提示可以完全由模拟经验构成(例如,来自脚本策略、强化学习智能体或人类远程操控模拟机器人),并用于提示真实机器人。需要澄清的是,“零样本仿真-到-真实迁移”通常指的是在模拟器中针对特定任务训练策略,然后在没有该任务真实世界数据的情况下在真实世界中运行该策略。然而,在展示的案例中,模型既没有在模拟器中,也没有在真实世界中针对该任务进行训练。
请添加图片描述

GEN-1.5 预训练不包含模拟数据,既不包含渲染视频,也不包含模拟动态,但可以通过模拟器的推出来有效地提示模型。然后,提示的行为会像其他物理提示的行为一样进行概括:到不同的手,以及真实场景中的新对象位置和大小。对于任务的子集,这意味着不再需要物理地收集演示 - 可以通过模拟器内的任何方式收集它们。

人机上下文学习

在某些情况下,上下文学习完全跨越了具身差距:人类用自己的双手演示了一项任务,可以通过机器人的相机观察到,然后机器人可以立即重现它。

3 极少梯度步适应

GEN-1.5 能够以极少的梯度步(低至 1 到 10 步)适应新的物理任务。通常,训练之前的机器人模型完成新任务可能需要数万步梯度(有时甚至更多),但基础模型的一个显著特点是,它们只需少量微调即可快速适应新任务【21】。虽然这种机制可以显式地构建,例如使用二阶梯度来促进快速适应【12】,但GEN-1.5 的预训练基础模型无需任何此类机制,也能在极少的梯度步内完成适应。
请添加图片描述

重要的是,如此极少的训练步骤所需的特定任务计算量要少几个数量级,并且相比繁重的微调,它为任务自适应提供了更加灵活的视角。或许更恰当的描述是,在极低数据量的情况下进行测试时训练【22】。测试时训练通常使用数十个梯度步骤;而 GEN-1.5 仅需 1-10 个步骤,就能在 5 分钟的数据上学习一项新的物理任务。10 个步骤对模型在保留任务上的权重影响不到 0.15%,这表明微调只是对已有的知识进行轻微的重新配置,而不是构建新的表征。

在 10 步自适应实验中,从 5 分钟的数据中采样序列,并使用与预训练类似的超参数,通过梯度下降法进行训练。在极端的单步条件下(即从 1 分钟的数据中采样),模型在保留任务上的成功率为 66.5%,并且性能会随着更大的批次大小和更高的学习率而提高。我们没有对这一过程进行调整,也没有扫描自适应特有的超参数;这些结果大多是开箱即用的。

4 物理泛化

对于上述每一项任务,经过微调的模型都能很好地泛化到演示之外——不仅能泛化到新的物体、实例和环境,还能泛化到实现同一目标的截然不同的操作策略:例如,不同的抓握和运动方式、清除障碍物以及使用微调数据中未包含的工具。

新工具使用的即兴发挥。例如,演示如何使用刷子将木块扫入碗中,并基于 5 分钟的人类演示对模型进行了微调。该模型能够理解如何使用刷子以外的各种其他工具来完成任务。当模型面对香蕉时,它会将香蕉当作临时刷子使用。然而,当模型面对簸箕时,它表现出与演示更大的策略性差异,并通过多种方式使用簸箕将木块提起并倒入碗中。无论是微调数据还是预训练数据,都没有包含以这种方式使用的簸箕,而且最接近的预训练样本与该任务几乎没有相似之处。给模型一个簸箕后,它无需任何语言指导,就能生成一个全新的接触序列来完成任务。
在意外情况下进行即兴发挥的能力似乎是该模型掌握新任务的关键:它能够纠正自身的错误,有时甚至在错误发生之前就能纠正。最早在 GEN-1【16】 中观察到这种行为的迹象。在 GEN-1.5 中,这种行为更加频繁且更加复杂,并且随着微调梯度步骤数的减少而增强,这可能是因为轻度适应的模型更接近其预训练先验,并且在情况偏离演示时可以调用更广泛的行为库。

处理障碍物。尽管该模型仅经过微调以将积木放入碗中,但它似乎能够移除障碍物(例如覆盖在碗上的纸片)来完成任务,有时还能将纸片放回碗上。在 5 分钟的特定任务数据中(该模型仅使用这些数据进行了 1 个梯度步骤的微调),碗上并没有纸片,而且预训练数据中也没有出现过类似的任务。

5 展望未来

开启这段旅程之初,并非有意构建一个单样本学习器。其团队的大部分时间都致力于构建机器人预训练科学迭代所需的基础架构,从基本原理出发,首先构建一个数据引擎,以便大规模地利用高质量的物理经验来驱动模型科学。

GEN-1.5 是一个具有深远科学意义的里程碑,这并非因为其更高的成功率,而是因为它代表了通用性的新前沿——它挑战了对这些模型在物理交互数据规模下进行预训练时行为方式的理解,而这种规模的预训练在以往几乎无人认为能够实现,除非采用捷径。GEN-0 和 GEN-1 都更加确信,更多(也更好)的预训练将使适应新任务的数据效率更高。测量的每一项趋势都指向同一个方向:更多的预训练使适应更快、更便宜、更通用。目前还无法确定这条曲线的渐近线在哪里。

现在显而易见(事后看来或许也显而易见),预训练达到一定阈值后,适应的成本就变得微不足道了。从几秒钟的数据中涌现出的上下文学习,或者在一分钟的演示中迈出一个梯度步,不再是传统意义上的任务特定训练。它更像是用极少的计算资源,让模型回忆起它几乎已经知道的东西。这种方法的有效性改变了对这些模型用途、潜在影响以及构建通用物理智能未来道路的思考。

几十年来,机器人一直被宣传为“通用”机器,理论上可以做任何事情——这与过去单一用途的工厂自动化形成鲜明对比。但这种承诺始终以专家对其进行编程为前提,而这需要数月的精力和专业知识。如果与机器人的交互简化为简单地告诉它该做什么,那么两件事将发生根本性的变化:机器人变得有用的速度(几秒钟,而不是几个月),以及谁可以与机器人一起工作(任何人)。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐