26年8月来自dyna公司的博客“Dyna-2: A 1-Million-Hour Scaling Law for World-Action Models”:https://www.dyna.co/dyna-2。
一个基于超过 100 万小时人类视频预训练的世界动作模型展示适用于人类和机器人评估的规模化规律,以及其背后的许多技术见解。

请添加图片描述


1 引言

人们对通用机器人的热情空前高涨,而扩展机器人基础模型被认为是实现这一目标最有希望的途径。然而,对于如何扩展数据和模型等最基本的问题,该领域尚未达成共识。或许,可以按以下顺序提出这些问题:

机器人学习的最佳预训练数据来源是什么?
扩展该数据源是否会产生机器人性能的规模化规律?
为了使该规模化规律成立,需要选择哪些建模方法和目标函数?

该领域已经探索了多种机器人学习的预训练数据来源,其中最值得注意的是远程操作和专用捕捉设备。两者都能产生有价值的、带有动作标签的数据,可以自行收集并进行训练。但是,这些数据的每一小时都必须人为生成,这限制了其自身能够进行的预训练的程度。从基本原理出发,答案就在于目标本身:通用机器人最终应该能够完成目前由人类完成的任何具有经济价值的任务。因此,合适的预训练数据来源应该是人类执行这些任务的传感器化记录(例如视频),这类数据已经以近乎无限的规模存在,并且包含了操作策略需要学习的所有信息:场景如何演变、物体如何响应接触以及手如何与物体交互。虽然目前从人类身上学习可能存在具身认知上的差距,但如果能够建立任何迁移规模化定律(即,人类数据的规模化定律蕴含机器人数据的规模化定律),那么未来的技术发展方向就可以相对明确:收集更多传感器化的人类数据,同时使机器人外形更接近人类。

其推出 Dyna-2,全新的旗舰级世界-动作模型 (WAM) [4],它基于超过一百万小时的以自我为中心的人类视频进行预训练——相当于大约 170 年的连续清醒状态经验。Dyna-2 建立了几个新规模化定律,这些定律直接回答了上述问题。具体而言,有

世界动作模型存在一个适用于一百万小时人类数据的规模化定律;
首次发现存在人机迁移规模化定律,即预训练中更多的人类数据能够提升模型对从未见过的机器人数据的离线预测能力;
最后,数据和目标函数对缩放定律都至关重要;视频数据的世界建模和规模化是实现跨具身规模化迁移的关键。

此外,除了上述强调的离线规模化定律结果外,还发现该规模化定律趋势能够迁移到训练后的机器人上。仅需几个小时的机器人数据进行训练,且预训练期间未接触任何机器人数据,训练后的 Dyna-2 模型即可在双手动并联下颚机械臂、半人形机器人和灵巧手平台上执行任务,且其相对性能与离线机器人缩放定律相符。在一个引人注目的例子中,仅需10分钟的远程操作数据即可对Dyna-2进行微调,使其能够使用两只五指机械手完成开瓶盖的操作。除了与规模化定律相关的结果外,还展示Dyna-2的几项创新功能,包括更强的鲁棒性、更高的精度、更强的指令跟踪能力、零样本生产级性能以及一步视频生成能力。总而言之,Dyna-2相比其之前的模型有了显著的改进。同时,它也提供了一些强有力的实证证据,有助于解答该领域的一些未解之谜,并可为未来的研究提供重要的参考。

2 模型架构和训练目标

Dyna-2 是一个世界动作模型 [4]:它是一个单一的生成模型,可以联合或分别对未来视频和未来动作进行去噪,其构建基于视频扩散骨干网络。在架构上,它是 Transformer 的混合体 [2, 3, 28];每种输入模态(包括视频和动作)都被单独token化,并拥有一组不同的 DiT 层 [27],这些层可以通过注意力机制相互关注,而本体感觉则被token化并直接作为动作 Transformer 的输入。视频标记使用因果掩码;动作token使用双向自注意机制(不使用因果掩码),并关注所观察到的上下文中的视频token。视频token会与文本 token进行交叉关注;文本不会直接影响动作token。
请添加图片描述

在早期的架构探索中,其在DiT 风格的视频扩散架构的大部分时间推理能力都保留在早期层 [1]。因此,在此特意将动作transformer设计得更浅,并且仅在早期层连接视频流。这样做可以显著改善模型的实时推理延迟,而不会牺牲性能。

Dyna-2 采用流匹配 [18, 19] 来训练模型。具体来说,令 c 为条件上下文(过去的帧、本体感觉和语言指令),z 为潜在的未来视频,a 为未来的动作块。按照标准的流匹配设置,模型沿着一条直线路径将来自每个模态的真实样本损坏为噪声,

z_t = tz+(1−t)ε_z, a_t = ta+(1−t)ε_a, ε_z, ε_a ∼ N(0,I)

并训练一个网络 u_θ 来预测对损坏样本进行去噪的速度。

对于用于研究规模化规律的 Dyna-2 模型变体,这些模型在视频预测和动作预测上进行联合训练。也就是说,视频损失和动作损失共享一个主干,但拟合(L_co(θ))为两个独立的边缘速度场 uact_θ和uvid-_θ。

由于 uact_θ 从不将 z_t 作为参数,视频损失可以塑造共享表征,但在推理阶段,模型保持被动响应(即,策略在推理阶段既不生成也不关注预测的未来视频)。

3 操作规模化规律:从 1,000 小时到 1,000,000 小时

目标是回答以下问题:

01 对于基于一百万小时人类数据训练的世界动作模型,是否存在规模化规律?
02 是否存在人机迁移规模化规律?也就是说,更多的人类经验是否能提高模型在预训练期间从未见过的机器人数据上的离线预测性能?
03 跨具身规模化规律是否能转化为微调后的机器人性能?
04 哪些因素对跨具身规模化规律的出现至关重要?

首先描述人类预训练数据以及用于评估规模化规律的指标。然后,依次回答这四个问题。

预训练数据:嵌套的、精确到小时的人类经验子集

构建一个人类操作视频语料库,迄今为止总时长已超过一百万小时。其中大部分是头戴式设备拍摄的第一视角视频,记录了人们进行日常操作——例如烹饪、整理、折叠、组装等——这些数据由数据合作伙伴以及内部团队收集。构建一个全面的数据清洗、手部姿态提取、验证和过滤流程,以确保不同来源数据的有效性和一致性。对于通过手部姿态质量标准的片段,其标注包含 3D 手部姿态轨迹,从中提取伪动作监督信息,用于训练动作流:末端执行器轨迹的腕部姿态,以及从拇指-食指张开度提取的连续抓取信号。不进行任何视觉或具身相关的数据处理来缩小预训练数据和下游机器人数据之间的视觉或运动学差距;目标是研究仅通过缩放来提升模型性能。因此,研究结果具有普遍性,也应该适用于本研究中未涉及的其他实施例。

请添加图片描述
请添加图片描述

基于此语料库,构建时长分别为 1,000、10,000、100,000 和 1,000,000 小时的嵌套子集;每个数据源保留相同的比例。这样,更大的预算不会交换数据,只会添加数据,并且缩放律曲线上各点之间的差异不会因子集之间的分布偏移而产生。一个独立的 100 小时验证集(与所有训练子集不相交)在所有人类数据评估中保持不变;所有人类数据的保留值均基于该验证集计算。所有点的训练和评估配置均相同,因此唯一的变量是经验时长。将计算量和模型规模的规模化实验留待未来研究。

评估指标

规模化结论可能受到用于得出该结论的指标的影响:非线性或不连续的指标可能会无意中导致模型平滑改进后出现明显的涌现现象 [7]。为了确保规模化定律不依赖于度量的选择,分别在两个连续误差和两个离散阈值准确率上报告了该定律。对于预测的动作块â和真实值a,计算均方误差(MSE)和L1误差,并分别在动作维度和块范围上取平均值;同时,计算准确率@τ,即落在真实值τ范围内的动作维度比例(以归一化动作单元为单位),并在τ=0.5和0.1处报告。在内部研究中,τ=0.5是衡量一般运动意图的良好指标,适用于研究人机迁移规模化定律;而更严格的阈值(例如0.1)则是运动精度的良好指标,能够反映域内规模化趋势(例如人与人之间的规模化趋势)。

是否存在基于100万小时人类数据训练的世界动作模型的规模化定律?

为了研究这个问题,按照上述方法,使用从 1000 小时到 100 万小时的人类数据阶梯式数据规模训练 Dyna-2 模型,并在预留的人类数据集上进行评估。为了消除检查点偏差,在后期步骤窗口中评估 10 个检查点,并报告每个指标的均值和标准差。如图所示,在每个指标上,预留的预测结果都单调递增,并且每个指标都符合以小时为单位的幂律。这是一个非常重要的结果,因为这是第一个验证了高达 100 万小时的真实世界操作数据扩展规律;同时,它也验证了 Dyna-2 架构的可靠性,能够吸收数百万小时的数据,并在百万小时尺度上持续改进。总之,这些结果证实,在同一具身(即人类)上测量的物理交互精度,可以通过将数据集扩展到百万小时尺度来可预测地提高。

请添加图片描述

人类数据的规模化定律是否也适用于机器人数据?

上述结果以前所未有的规模衡量了模型对预留人类数据的泛化能力。但对于机器人学而言,如果规模化定律同样适用于机器人数据,并且能够对其进行测量,那么人类数据的规模化定律才更有意义。目前尚无研究证明跨具身迁移的规模化定律,这意味着无需任何额外的调整或微调,即可在预训练集中预留的具身数据上测量评估指标[6, 29, 30]。在本研究中,旨在仅基于人类数据进行预训练,并直接在预留的机器人数据上进行评估。具体而言,使用精心整理的预留机器人数据集评估同一组按尺度递增的Dyna-2检查点。该机器人评估数据集包含两个不同的固定式双手动YAM平台上的39个任务; 12 个任务来自内部的静态 YAM 双手动基准测试,27 个任务来自 xdof ABC [31];下图展示评估任务的随机子集。这两个来源共包含 39 个任务,涵盖了广泛的日常操作,例如衣物处理、打结、包装、清洁、餐饮服务和组装。特意纳入外部 YAM 数据集,以确保评估结果不会偏向自行设计的任务。本节中的所有检查点均未使用来自任一来源的单一轨迹进行训练。
请添加图片描述

下图展示了零样本离线机器人评估结果。令人惊讶的是,所有指标都随着预训练人类数据规模的增加而单调递减。这是在具身认知差距中证明的规模化规律:随着纯人类数据的增长,预留的机器人验证指标单调下降。通过经验观察到,预训练时间从 1 万小时到 10 万小时出现了一个拐点,这表明,只要覆盖面足够大,跨具身知识迁移就可能仅仅通过规模就能实现。
请添加图片描述

可以从人类数据中推导出世界动作模型的规模化定律。仅对人类数据进行规模化即可提升机器人对世界动作模型的预测性能。

这种跨具身规模化定律能否转化为机器人性能?

最后,验证跨具身迁规模化放定律能否推广到机器人性能。为此,使用同一组包含 14 个任务的内部基准测试数据集,对规模化阶梯中每个阶梯的等步检查点进行后训练;每个任务最多包含 10 小时的机器人数据。后训练模型之间唯一的变量是仅使用人类数据进行预训练时,人类视频的使用时长。需要注意的是,与之前的人机迁移研究结果 [6, 17] 不同,特意没有进行人机对齐或协同训练 [17, 36]。这样做可能会带来更好的后训练性能,但本研究关注的是预训练规模化带来的性能提升。

这 14 项任务涵盖多种操作能力:精确的拾取和放置(拾取和放置、整理、垃圾桶托盘拾取、急救包准备)、可变形体操作(绳结、裤架准备)、精确操作(食物舀取、冰箱管插入、锁盒钥匙转动)、铰接物体交互(手提袋制作、马克杯开箱)、灵巧的多指操作(抽屉里的荧光笔、瓶盖拧开)以及语言遵循(目标饮料取回,其中策略遵循指定要从冰箱中取回特定饮料的打印指令)。

这些任务在三种机器人模型上运行:11 个任务使用配备 6 自由度 YAM 机械臂和自主研发的平行爪夹爪的固定式双手动平台;2 个任务使用相同的机械臂,但配备一对 WUJI-2 20 自由度灵巧多指手;语言跟随任务则在我们半人形机器人的早期原型上运行。

由于任务的多样性带来了不同的原生指标,因此用每个任务自身的原生指标来报告其结果。为了将它们置于同一坐标轴上,将每个指标归一化为该任务最大可达到分数的一部分(例如,100% 的成功率,即“拾取与放置”任务中所有 10 个物体都被拾取,或“垃圾桶拾取”任务中所有 6 个碎片都被拾取)。14 个任务的这些分数的平均值即为用于构建缩放图的单一归一化分数,其中 50% 表示平均达到每个任务上限的一半。用相同的测试流程,在盲测中(即评估人员未参与模型开发)对每个任务的模型进行 10 次试验(语言跟随任务为 12 次)。
请添加图片描述

汇总所有 14 个任务的数据,平均归一化性能随预训练规模的增加而单调递增,从 20% 提升至 28%,再提升至 45%,最终达到最大值的 53%。在一百万小时的训练后,后训练模型在实际应用中表现最佳,并在 14 个任务中的 9 个任务上表现最优。一些任务似乎需要达到一定的预训练量才能成功解决。“锁箱钥匙转动”任务就是最明显的例子:在长达 10 万小时的训练中,没有一个检查点能够成功转动钥匙。而在一百万小时的训练后,钥匙的转动成功率达到了 90%。

数据效率在另一个极端也同样显著:瓶盖拧开任务仅使用大约 10 分钟的机器人演示进行后训练,但其准确率仍从预算较少时的 10% 提升至预训练规模扩大后的 40% 和 50%。这一趋势也延伸至语言跟踪任务,其中目标饮料取回任务的准确率从 58% 提升至 83%。

在所有任务中,后训练方案均采用相同的方法:仅使用机器人数据,不进行协同训练,也不进行人机对齐。在这种方案下,预训练的扩展规律能够跨任务、跨实例、跨功能地应用于实际机器人。

跨具身模型规模化定律的出现取决于哪些因素?

Dyna-2 是一种世界-动作模型,它能够学习预测未来的世界状态和机器人动作,但这种建模选择真的重要吗?

通过对照实验,实证证明,预测视频是实现跨具身模型规模化的关键:(1) 视频是实现跨具身模型迁移的关键;(2) 视频是具身人工智能的一个新的规模化维度:在预训练中增加仅包含视频的数据量,也能显著提高对预留机器人数据的评估效果。

首先进行三组对照实验,固定动作数据量,改变训练目标和数据构成。也就是说,对于每个固定数量的包含手部姿态标注的人类视频数据(从 5k、50k 到 100k),用以下训练方案训练相同的 Dyna-2 架构:

01仅动作训练(仅动作损失,不进行世界建模)
02联合训练(在同一数据集上同时预测动作片段和未来视频)
03视频协同训练(联合训练,并额外预测相同数量的不包含动作标签的人类视频数据)

与之前一样,所有三种消融方法均在 39 个任务的机器人套件上进行零样本评估,且训练步骤相同。任何形式的未来预测都远优于仅动作训练:联合训练方案在所有动作规模下,39 个任务中均优于仅动作训练方案。此外,随着数据规模的扩大,仅动作训练方案还表现出严重且不可预测的过拟合模式;联合变体虽然过拟合程度较低,但其扩展性也不佳。只有当训练数据中加入大量仅用于视频预测的人类视频时,这种趋势才会逆转。值得注意的是,在小规模(例如 5000 小时)下,这样做实际上并无优势,但随着数据规模的扩大,这种优势会逐渐显现。

视频是新的尺度轴

以上结果报告每个动作数据阶梯对应的单一视频数据尺度。接下来自然而然的问题是:如果固定动作数据量,仅对视频数据进行尺度变换,会发生什么?这个问题不仅出于科学好奇,也具有重要的实际意义。随着进入百万小时规模的预训练数据阶段,发现一个挑战:虽然人类视频数据丰富,但提取准确的手部姿态并非易事;并非所有的人体活动记录设备都能提取出符合内部质量标准的手部姿态。此外,即使拥有良好的记录设备,对数百万小时的数据进行大规模标注本身也是一项巨大的基础设施挑战,导致总数据量与已标注动作并经过质量控制的数据量之间存在滞后。因此,可以合理地假设,在基于人类数据的预训练过程中,始终会存在大量未标注的人类视频数据。如何有效地利用这些视频数据?如果这些低质量的视频数据无需提供动作监督,而仅用于未来大规模的视频预测,又该如何呢?

视频协同训练的关键优势在于能够实现跨具身泛化,且泛化能力会随着视频数据量的增加而增强。具体来说,一项实验,将带有动作标签的人类数据量固定为 50,000 小时,然后逐步增加仅用于视频协同训练目标的人类数据量,从 0 小时、1,000 小时、10,000 小时到 50,000 小时,以此模拟拥有大量无动作标签视频数据的场景。为了验证当人类动作数据和仅包含人类视频的数据量都增加一个数量级时,该结论仍然成立,还重复上述实验,这次使用了 250,000 小时的人类动作数据,并分别搭配 0 小时、250,000 小时和 750,000 小时的仅包含人类视频的数据。最后,用预留的机器人数据对这些模型进行离线评估。在两组固定动作数据量和视频数据规模的条件下,在没有任何视频数据的情况下预训练 Dyna-2(即仅使用动作数据)始终比包含视频数据的效果更差,而单独规模化视频数据则能单调地提升泛化能力。

此外,通过测量归一化相对改进值,展示这些检查点在预留的人类数据集上的表现。规模化人类视频数据没有影响,甚至可能略微降低了人类数据的评估结果;一种可能的假设是,视频训练会稀释动作学习梯度,而对于具身评估而言,足够的动作数据就足够了。

综上所述,关键经验结论是,视频协同训练是建立跨具身迁移规模化规律的主要驱动因素。虽然这些结果令人惊讶,但从基本原理出发,也认为这些结果应该是正确的。世界建模的意义一直在于赋予模型对物理世界的普遍理解;这项功能应有助于模型推广到完全未知的具体实例。而且,这一假设首次在大规模应用中得到验证。


。。。待续。。。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐