RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete

一、研究背景与动机

多模态大语言模型(MLLM)在各种多模态场景中展现出了显著的能力。然而,它们在机器人场景中的应用,尤其是对于长期操作任务,暴露出显著的局限性。这些局限性源于当前的 MLLM 缺乏三种关键的机器人大脑能力:规划能力(将复杂操作指令分解为可管理的子任务)、可操作性感知(识别和解释交互对象的可操作性)和轨迹预测(预测成功执行所需完整操作轨迹)。为了增强机器人从抽象到具体的核心能力,研究者们提出了 ShareRobot 数据集,并基于此开发了 RoboBrain 模型。

二、ShareRobot 数据集

ShareRobot 是一个为机器人操作任务设计的高质量异构数据集,包含多维度信息,如任务规划、对象可操作性和末端执行器轨迹。数据集的主要特点包括:

  • 细致入微 :与提供高级任务描述的 Open X-Embodiment 数据集不同,ShareRobot 的每个数据点都包含与各个帧相关联的详细低级规划指令,提高了模型在正确时刻执行任务的准确性。

  • 多维度 :为了增强 RoboBrain 从抽象到具体的能力,研究者们标记了任务规划、对象可操作性和末端执行器轨迹,使任务处理更加灵活和精确。

  • 高质量 :研究者们建立了严格的数据选择标准,重点关注高分辨率、准确描述、任务执行成功、对象可操作性可见和运动轨迹清晰等方面。基于这些标准,验证了 51403 个实例,确保高质量,为 RoboBrain 的核心能力奠定基础。

  • 大规模 :包含 1027990 个问答对,是最大的开源任务规划、可操作性感知和轨迹预测数据集,有助于深入理解从抽象到具体的关系。

  • 丰富多样性 :与 RoboVQA 数据集的有限场景相比,ShareRobot 涵盖了 102 个不同场景、12 种机器人身体和 107 种原子任务类型,使 MLLM 能够从多样化的现实世界场景中学习,增强复杂多步规划的鲁棒性。

  • 易于扩展 :数据生成流程设计为高度可扩展,随着新的机器人身体、任务类型和环境的发展,数据集能够支持日益复杂的操作任务。

数据集的构建过程如下:

  • 数据选择 :基于 Open X-embodiment 数据集,仔细选择了 51403 个实例,主要关注图像质量、描述准确性和任务成功状态。

  • 数据标注 :提取每个机器人操作演示中的 30 帧,并使用这些帧及其高级描述,通过 Gemini 将其分解为低级规划指令。然后,三名标注者审查并细化这些指令,以确保标注的准确性。之后,为每种问题类型设计了 5 种不同的模板,以生成问答对。同时,对 6522 张图像进行可操作性标注和轨迹标注,并进行严格的手动审查和细化,以确保指令与相关区域的精确对齐。

三、RoboBrain 模型

RoboBrain 是基于 LLaVA 架构开发的,旨在增强机器人在复杂任务中的感知和规划能力。模型采用多阶段训练策略:

  • 第一阶段 :一般 OneVision(OV)训练,旨在开发具有强大理解和指令遵循能力的基础 MLLM,为提升模型在机器人操作规划方面的能力奠定基础。具体包括:

    • 阶段 1 :利用 LCS-558K 数据集的图像 - 文本数据训练 Projector,使视觉特征与 LLM 语义特征对齐。

    • 阶段 1.5 :使用 400 万张高质量图像 - 文本数据训练整个模型,增强模型的多模态通用知识理解能力。

    • 阶段 2 :进一步使用 LLaVA-OneVision-Data 的 320 万单图像数据和 160 万图像和视频数据训练整个模型,增强 RoboBrain 的指令遵循能力,以及对高分辨率图像和视频的理解。

  • 第二阶段 :机器人训练阶段,在第一阶段开发的强大多模态基础模型之上,使模型能够理解复杂的抽象指令,支持历史帧信息和高分辨率图像的感知,并输出对象可操作性区域,同时预测潜在的操作轨迹。具体包括:

    • 阶段 3 :收集 130 万机器人数据,包括来自 RoboVQA-800K、ScanView-318K 以及本文提出的 ShareRobot-200K 子集的数据,这些数据包含大量的场景扫描图像数据、长视频数据和高分辨率数据,以支持模型对多样化环境的感知能力。同时,为了减轻灾难性遗忘问题,从第一阶段选择了约 170 万图像 - 文本数据与阶段 3 收集的机器人数据混合,对整个模型进行微调。

    • 阶段 4 :利用 ShareRobot 数据集和其他开源资源中的可操作性和轨迹数据,通过在训练中引入 LoRA 模块,增强模型从指令中感知对象可操作性和预测操作轨迹的能力。

模型架构包括三个模块:

  • 基础规划模型 :使用 LLaVA 作为 RoboBrain 的基础模型,由视觉编码器(ViT)、投影仪(h(·))和大型语言模型(LLM)组成。给定视觉输入 Xv(图像或视频),ViT 将其编码为视觉特征 Zv = g(Xv),然后通过投影仪将其映射到 LLM 的语义空间,生成一系列视觉令牌 Hv = h(Zv)。最后,LLM 根据人类语言指令 Xt 和 Hv 以自回归方式生成文本响应。

  • A-LoRA 模块(可操作性感知) :在工作中,“可操作性”指的是人手与对象接触的区域。研究者们使用边界框来表示可操作性。具体而言,考虑由多个对象组成的图像 I 及其可操作性,每个对象拥有 N 个可操作性。可操作性的格式定义为 {l(x), l(y), r(x), r(y)},其中 {l(x), l(y)} 代表可操作性的左上角坐标,{r(x), r(y)} 是右下角坐标。

  • T-LoRA 模块(轨迹预测) :在工作中,“轨迹”指的是 2D 视觉轨迹的概念。研究者们将轨迹航点定义为一系列 2D 坐标,表示末端执行器或手在整个过程中的运动。具体而言,在时间步 t,轨迹航点可以表示为 Pt:N = {(xi, yi) | i = t, t + 1, …, N},其中 (xi, yi) 表示视觉轨迹中的第 i 个坐标,N 代表情节中总时间步数。

四、实验

  • 实验细节 :整个训练阶段采用了 Zero3 分布式训练策略,在每台配备 8×A800 GPU 的服务器集群上进行实验。每个训练阶段的图像分辨率设置、批量大小、训练周期和学习率等详细信息见表 1。

  • 评估指标

    • 规划任务 :选择了 RoboVQA、OpenEQA 和 ShareRobot 的测试集作为机器人基准测试,对多个维度进行评估。对于 RoboVQA,采用 RoboMamba 中使用的 BLEU1 至 BLEU4 指标进行评估;对于 OpenEQA 和 ShareRobot,使用 GPT-4o 作为评估工具,根据模型预测与真实值之间的一致性或相似性进行评分,作为模型的最终性能得分。

    • 可操作性预测 :使用平均精度(AP)评估模型的可操作性性能。AP 指标总结了在不同阈值设置下精度 - 召回率可操作性曲线之间的关系,并在多个交并比(IoU)阈值上进行计算,以获得更全面的评估。

    • 轨迹预测 :评估真实轨迹和预测轨迹之间的相似性,轨迹均表示为归一化到 [0, 1000) 的 2D 航点序列。评估使用三种指标:离散 Fréchet 距离(DFD)、Hausdorff 距离(HD)和均方根误差(RMSE)。DFD 捕捉整体形状和时间对齐,HD 识别最大偏差,RMSE 测量平均点误差。这些指标共同提供了轨迹准确性和相似性的全面评估。

  • 机器人大脑任务评估

    • 规划任务评估 :选择了 6 个强大的 MLLM 作为基线进行比较,包括开源和闭源、不同架构的模型。RoboBrain 在三个机器人基准测试中均优于所有基线模型,在 OpenEQA 和 ShareRobot 上显著优于所有基线模型,归因于其强大的机器人任务理解和长视频感知能力。此外,在其他基准测试中,RoboBrain 在 RoboVQA 上的表现也持续优于其他模型,其 BLEU-4 分数比第二名高出 18.75,突出了其分解复杂长期任务规划的能力。

    • 可操作性预测评估 :在 AGD20K 可操作性测试集上对 Qwen2-VL-7B 和 LLaVA-NeXT-7B 模型进行了测试。RoboBrain 的表现显著优于其他模型,超过了 Qwen2-VL [86] 14.6 AP,LLaVA-NeXT 17.3 AP,验证了 RoboBrain 能够理解对象的物理属性并准确提供可操作性。

    • 轨迹预测评估 :比较了模型的几种变体,结果见表 3。每个变体都建立在前一个变体的基础上,最终模型集成了所有组件。与基线相比,DFD、HD 和 RMSE 分别降低了 42.9%、94.2% 和 31.6%。研究发现,添加起始点可以纠正生成轨迹与末端执行器之间的平移偏移。

  • 可视化 :展示了 RoboBrain 的一些可视化示例。在给定人类指令和视觉输入的情况下,RoboBrain 进行多轮交互,理解并规划未来步骤,同时输出更具体的可操作性和轨迹。

五、结论

论文介绍了 ShareRobot,这是一个高质量的数据集,标记了多维度信息,包括任务规划、对象可操作性和末端执行器轨迹。同时,提出了 RoboBrain,这是一个基于 MLLM 的模型,集成了机器人和通用多模态数据,采用多阶段训练策略,并利用长视频和高分辨率图像来增强机器人的操作能力。大量实验表明,RoboBrain 在各种机器人任务中均取得了最先进的性能,突出了其在实际机器人应用中的潜力。

六、核心技术汇总表格

在这里插入图片描述

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐