基于异构数据扩展与涌现能力的具身基础模型探索

论文来源:GigaBrain Team | arXiv:2608.15875v1

近年来,视觉-语言-动作(Vision-Language-Action, VLA)模型已成为构建通用具身智能体的重要技术路径。然而,如何在更大规模、更加异构的数据体系下实现有效的预训练,并在理解、预测与执行之间建立深度协同,仍是该领域面临的核心挑战。GigaBrain-0.7 通过引入三系统架构,将多模态理解、世界模型预测与连续动作生成有机整合,在超过 37000 小时的异构具身数据上展现出强劲的零样本能力与跨本体泛化性能。

一、研究背景与核心挑战

随着预训练数据规模与模型容量的持续扩展,VLA 模型在复杂长程任务中的执行能力显著提升。然而,现有的多数 VLA 系统仍以"感知-动作"的直接映射为主,缺乏对未来状态的显式预测能力,也难以在行为执行过程中评估自身进度。这种架构层面的局限性使得模型在面对需要多阶段推理、动态环境交互以及跨本体迁移的场景时,表现往往难以达到预期。

具体而言,当前 VLA 研究主要面临三方面挑战:其一,机器人数据在本体形态、动作空间与执行条件上差异显著,未经恰当对齐的数据扩展可能引入干扰而非迁移知识;其二,多数模型以反应式观测到动作的预测为中心,缺少对未来状态的预判机制;其三,理解规划、预测评估、动作执行与经验驱动的持续改进在整个学习生命周期中尚未形成有效闭环。

针对上述问题,GigaBrain-0.7 提出了一种统一的三系统架构,通过 System 2(理解与规划)、System 3(预测与评估)与 System 1(动作与控制)的协同配合,构建了从高层语义理解到低层连续控制、再到经验反馈增强的完整链路。该模型基于 PaliGemma2(3B)视觉-语言主干,配合专用的动作专家(Action Expert,0.5B)与世界价值模型(GigaWorld-1,5B),在 16 种机器人本体与约 2.7 亿视觉-语言样本上完成了联合预训练。

图 1:GigaBrain-0.7 整体架构概览。模型通过三系统协同实现理解与规划、预测与评估、动作与控制的有机统一,并支持基于人机交互经验的持续强化学习。

二、数据基石:三万七千小时的异构具身数据

高质量、大规模的异构数据是具身基础模型能力涌现的前提。GigaBrain-0.7 的预训练语料由两大核心部分构成:一是包含 37256.98 小时的具身轨迹数据,二是包含 271976674 条样本的视觉-语言(VLM)图文问答数据。前者提供状态-动作序列与交互过程监督,后者则用于保持模型的通用视觉-语义能力,并强化空间关系推理、物体定位与可供性预测等机器人任务所需的核心技能。

在具身轨迹数据方面,研究团队构建了覆盖多源异构数据的"数据金字塔"。其中,真实机器人轨迹占比 55.12%,涵盖 Maker H01、Maker M01、Agibot-G1、AgileX、Franka、UR5 等 16 种机器人平台,总计超过 20000 小时;通过 Universal Manipulation Interface(UMI)采集的近手视角人类演示数据占比 22.15%,补充了精细手眼协调与局部空间几何的监督信号;第一人称(EGO)人类操作视频占比 7.68%,用于增强语义理解与时间建模;基于物理的仿真数据与世界模型生成数据分别占比 3.90% 与 11.15%,用于扩展长尾场景与视觉多样性。

GigaBrain-0.7 训练数据组成
图 2:GigaBrain-0.7 训练数据组成全景。具身轨迹数据涵盖真实机器人、UMI、EGO、仿真及世界模型生成数据,VLM 数据则覆盖图像描述、视觉问答、空间推理与机器人任务理解等任务类型。

为确保异构数据能够稳定地参与联合训练,研究团队开发了一套统一的数据处理流水线。该流水线首先将原始数据转换为 LeRobot v3.0 统一格式,随后建立跨本体的状态-动作标准化表示:维度顺序遵循左臂、右臂、头部、腰部与底盘/腿部的结构,缺失维度通过掩码处理,避免为每种机器人形态维护独立的数据格式。在语言指令层面,团队采用大语言模型辅助的指令重写与原子子任务标注,消除不同数据源在命名习惯、描述粒度与语言上的不一致性。此外,多阶段质量控制系统通过极端值过滤、静止段检测、末端执行器位姿一致性校正与训练损失异常过滤,进一步保障了数据质量。

**数据扩展的核心发现:**论文中的系统性扩展研究表明,在固定模型配置下,预训练数据规模的持续增加能够一致性地降低验证损失。更重要的是,这种优化层面的改善能够转化为物理执行层面的可靠提升——特别是在折叠衣物等复杂可变形物体操作任务中,数据规模的扩大呈现出近乎"涌现"式的能力跃升。

三、三系统架构深度解析

GigaBrain-0.7 的核心创新在于将具身智能分解为三个既专业化又紧密集成的子系统。这种分工并非简单的模块堆叠,而是通过结构化的语义、视觉与价值接口实现的深度协同。

3.1 System 2:理解与规划

System 2 基于 PaliGemma2(3B)视觉-语言模型构建,负责接收当前视觉观测与高层任务指令,并输出链式思维(Chain-of-Thought)推理过程与可执行的子任务指令。例如,面对"将物品挂在衣架上"的指令,System 2 会首先识别场景中的相关物体(如帽子、包袋),进而将任务分解为"拿起红帽子"等具体子任务。这种分解为 System 1 的动作生成与 System 3 的未来预测提供了显式的任务上下文,从而在高层语义理解与低层运动控制之间建立了桥梁。

3.2 System 3:预测与评估

System 3 是基于 GigaWorld-1(5B)的世界价值模型(World Value Model),也是 GigaBrain-0.7 区别于传统 VLA 模型的关键组件。该模型接收当前具身上下文(包括视觉观测、本体状态与 System 2 输出的子任务),提供两类互补信号:

  • 未来观测预测:

    基于当前上下文与子任务指令,模型生成与动作块时域对齐的未来视频预测,并提取末帧作为子目标图像(subgoal image)。该视觉预测为 System 1 提供了关于预期物理状态的显式表征。

  • 价值评估:

    模型估计标量价值(value),反映当前执行状态相对于子任务完成的进度。该价值经离散化后转换为二元优势条件(advantage),用于在训练与推理阶段区分推进任务进度的有效行为与无效行为。

System 3 在 VLA 后训练阶段保持冻结,其输出作为额外的条件信号接入 System 1。这种设计既保留了世界模型的预测表示,又允许动作生成模块学习如何有效利用这些预测信号。

3.3 System 1:动作与控制

System 1 是 GigaBrain-0.7 的执行核心,采用基于 Mixture-of-Transformers(MoT)的视觉-语言-动作架构。该模型以 PaliGemma2(3B)为视觉-语言主干,并联一个专用的连续动作专家(0.5B)。两者通过联合注意力机制交互:视觉-语言流保持因果自注意力以维持预训练语义能力,动作专家则双向关注两个流的联合表示,从而在不影响 VLM 计算的前提下实现语义引导的动作生成。

图 3:GigaBrain-0.7 三系统架构详图。System 2 负责视觉-语言理解与任务分解;System 3 提供未来状态预测与价值评估;System 1 整合多源信号生成连续动作,并支持离线/在线经验强化学习。

System 1 支持双路径动作表示:一是基于下一令牌预测(NTP)的离散动作路径,用于训练阶段桥接语言理解与运动控制;二是基于流匹配(Flow Matching)的连续动作路径,通过去噪过程生成精确的动作块,用于实际部署。为解决连续动作学习对预训练视觉-语言表示的潜在干扰,研究团队引入了软知识隔离(Soft Knowledge Insulation)机制——流匹配梯度在动作专家内部完整传播,但进入视觉-语言主干时按系数衰减,从而在保留通用多模态能力的同时允许适度的具身适应。

此外,System 1 集成了短时视觉记忆机制,通过时序-空间块对历史帧进行因果聚合。该设计使当前帧表示能够捕捉任务相关区域的时序演化,且无需将大量历史视觉令牌输入主干网络,在提供时序上下文的同时控制了计算开销。

四、四阶段训练体系

GigaBrain-0.7 的训练流程分为四个递进阶段,形成从通用先验到任务专精、再到经验驱动的完整模型生命周期。

4.1 联合 VLA 预训练

在第一阶段,System 1 与 System 2 在完整的异构语料上进行联合预训练。与分阶段训练不同,该阶段同时优化视觉-语言理解、层次化任务预测、离散动作表示与连续动作生成。对于连续动作,模型采用流匹配目标;对于语言与离散动作,则采用下一令牌预测目标。异构本体数据通过统一的状态-动作表示与本体感知掩码实现对齐,确保不同自由度的机器人能够共享核心的操作知识。

4.2 世界模型预训练

第二阶段专注于构建 System 3 的预测与评估能力。该阶段首先在机器人操作数据上对 GigaWorld-1 进行视频预训练,使其适应机器人操作特有的状态转移与接触交互模式;随后扩展为混合架构的世界价值模型,在保持未来视频生成能力的同时,引入基于轨迹完成标注的价值估计路径。完成该阶段后,System 3 参数冻结,作为稳定的预测与评估接口服务于后续阶段。

4.3 世界模型驱动的 VLA 后训练

第三阶段面向特定任务进行适配。在此阶段,System 3 生成的子目标图像与价值衍生条件被接入 System 1 的上下文,System 1 与 System 2 则在下游演示数据上联合优化。为防止对 System 3 信号的过度依赖,训练过程中以一定概率随机丢弃子目标图像(概率 0.5)与价值条件(概率 0.15),使模型能够适应四种不同的条件组合。

4.4 经验驱动的强化学习

第四阶段旨在突破演示数据的分布限制。研究团队采用"离线-在线"渐进式强化学习管线:首先,基于部署策略收集的 rollout 数据,通过优势加权回归(AWR)进行离线策略优化,使模型从成功与失败经验中习得进度感知与错误恢复能力;随后,将优化后的策略重新部署,在困难状态引入人工修正,并通过轻量化的演员-评论家(Actor-Critic)框架进行在线优化。这一闭环使模型能够在自身执行产生的状态分布上持续改进。

图 4:经验强化学习管线。包含监督微调、离线强化与在线强化三个阶段,通过 rollout 数据与人工修正实现策略的持续迭代优化。

五、实验验证与能力涌现

为全面评估 GigaBrain-0.7 的能力边界,研究团队在真实机器人、仿真环境及多模态理解基准上开展了系统性实验,涵盖从零样本泛化到任务专精、再到经验驱动的持续学习。

5.1 数据扩展与架构选型

在模型架构层面,研究团队对比了 PaliGemma2、Qwen3.5 与 Gemma 4 等视觉-语言主干,以及双路流(Dual Stream)、末层交叉注意力与多层交叉注意力等动作专家耦合方案。实验结果表明,基于 PaliGemma2 的双路流架构在结构化操作、语言条件交互与可变形物体操作等任务上取得了最佳平衡,尽管推理延迟略高,但其动作生成能力显著优于耦合更松散的方案。

在数据扩展方面,验证损失随数据规模增加呈现单调下降趋势。更具启发性的是,在真实机器人执行中,简单任务(如水果抓取)随数据扩展平稳提升,而复杂任务(如混乱衣物折叠)则表现出对数据规模的强依赖性——较小规模下几乎无法完成的行为,在数据量达到一定程度后变得可靠。这一现象被研究者视为异构预训练下能力涌现的直接体现。

图 5:数据扩展实验结果。验证损失随预训练数据规模增加而持续下降;真实机器人任务成功率随数据扩展稳步提升,复杂任务表现出更显著的规模敏感性。

5.2 时序上下文与预测评估的作用

实验进一步验证了时序视觉上下文与 System 3 预测信号的关键作用。在存在视觉相似但时序位置不同的重复状态时,缺乏历史信息的单帧策略容易陷入重复动作循环;而引入短时视觉记忆后,模型能够依据前置交互历史正确解歧当前状态,继续推进任务。

System 3 的消融实验显示,子目标图像条件与价值条件均能对任务执行产生积极影响。在礼品包装等挑战性任务中,基础模型完全无法完成,而引入 System 3 的预测与评估信号后,成功率分别提升至 20% 与 60%,两者结合后进一步达到 80%。同时,任务评分与完成时间也同步优化,表明预测性指导不仅提升了任务完成率,也改善了执行过程的流畅度与效率。

图 6:System 3 预测与评估信号的消融实验。基础模型(Base)、子目标图像(+SubImage)、价值条件(+Value)及两者结合(+SubImage+Value)在多项任务上的成功率、平均得分与完成时间对比。

5.3 基础模型的零样本能力

在未经任何任务特定适配的情况下,GigaBrain-0.7 展现出显著的零样本执行与泛化能力。在 AgileX PiPER 与 Maker H01 两种差异显著的本体上,预训练策略能够直接执行语言条件的多项操作任务,包括基于颜色、物体身份与空间关系的指令跟随。在分布外(Out-of-Distribution)测试中,面对训练数据中未出现的物体实例、未观测过的场景布局以及未组合过的任务配置,模型仍能保持可执行的行为输出,体现出目标理解、空间定位与组合泛化的基础能力。

图 7:GigaBrain-0.7 零样本能力评估。涵盖 AgileX PiPER 与 Maker H01 上的语言条件任务跟随与复杂长程操作,包括分布内(In-Domain)与分布外(Out-of-Domain)设置。

在复杂操作层面,预训练策略在可变形物体折叠、多阶段整理等需要持续接触与多步执行的任务上表现出非平凡的零样本能力。值得注意的是,面对训练时未见的衣物实例与高度非结构化的初始状态,模型能够通过反复建立适当接触、响应不断变化的物体几何形状来维持折叠行为,而非依赖固定的物体形状或记忆轨迹。

5.4 后训练与跨本体迁移

经过任务特定的监督微调后,GigaBrain-0.7 在语言跟随与复杂操作任务上均取得显著提升。在 AgileX PiPER 的六项语言条件任务中,模型在颜色辨识、目标选择与方向推理上达到或超过现有先进基线;在 Maker H01 人形平台上,平均成功率从上一代模型的 69.6% 提升至 84.2%。在复杂操作任务中,GigaBrain-0.7 在桌面整理、橡皮泥揉捏、物品收纳与餐具洗涤等多任务上均展现出跨本体的稳健性能。

图 8:后训练复杂操作任务对比。上排为 AgileX PiPER 平台结果,下排为 Maker H01 平台结果,涵盖物体排序、可变形物体操作、餐具整理与清扫等任务。

5.5 仿真基准评测

在标准化仿真评测中,GigaBrain-0.7 同样表现出色。在 RoboTwin 2.0 双臂操作基准的 Co-Train 协议下,模型在困难的域随机化(Hard)设置中取得 67.9% 的成功率,显著优于对比方法;在 EBench 移动操作与长程交互基准上,模型在公开可比的 VLA 模型中取得了最高的整体成功率(33.30%)与综合得分(46.1);在 RoboColiseum 的四个评测维度(指令跟随、空间推理、鲁棒性、通用操作)中,GigaBrain-0.7 均位列开源模型首位,尤其在空间推理维度优势突出。

5.6 经验驱动的持续改进

在经验强化学习阶段,研究团队选取了四项具有代表性的真实机器人任务进行评估:礼品盒包装、轴承安装、连杆安装与扎带插入。结果显示,从监督微调(SFT)基线到离线强化学习,再到在线强化学习,模型成功率呈现持续的阶段式提升。SFT 基线的平均成功率为 30.0%,离线强化后提升至 57.5%,而经过在线强化学习后,四项任务的成功率均达到 100%。特别是在连杆安装与扎带插入等需要高精度对齐与穿引的任务中,在线阶段通过人工在困难状态的精准修正,实现了从 40% 到 100% 的跨越。

图 9:经验驱动强化学习的代表性真实机器人任务。包括礼品盒包装(A)、轴承安装(B)、连杆安装(C)与扎带插入绑扎(D),覆盖长程序列执行与高精度接触操作。

六、总结与展望

GigaBrain-0.7 通过三系统架构与大规模异构数据预训练,为具身基础模型的发展提供了一条可扩展的技术路径。其在理解、预测与执行层面的深度协同,不仅提升了模型在单一任务上的执行精度,更重要的是赋予了模型跨本体、跨任务与跨场景的通用性与适应性。从 37000 小时异构数据中的预训练,到世界模型驱动的后训练,再到基于 rollout 经验的持续强化,GigaBrain-0.7 展示了一个具身智能模型从通用先验到持续进化的完整生命周期。

展望未来,随着异构具身数据的进一步扩展、跨源对齐技术的完善,以及长程预测与自主闭环学习能力的持续增强,具身基础模型有望在更加开放、动态的真实世界环境中展现出更为广泛的通用性与鲁棒性。GigaBrain-0.7 的相关训练代码与预训练模型权重将公开发布,为学术界与产业界的后续研究提供基础支撑。

**参考资料:**GigaBrain Team. GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture. arXiv:2608.15875v1, 2026.论文项目主页:https://gigaai.cc/blog/gigabrain07

具身智能&世界模型blog: https://jinxindeep.github.io/blog/blog2026.html

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐