59 个作者 + 37,000 小时数据塞进同一颗具身大脑:GigaBrain-0.7 让机器人「看懂、预测、动手」三件事不再分家

Hugging Face 每日论文(2026-08-26 精选)

8 月 16 日 arXiv 上挂出一篇署名 59 人的具身基础模型技术报告:GigaBrain-0.7(arxiv:2608.15875)。它做的事情和过去一年的「VLA 单系统」路线完全相反——不是把「视觉-语言理解」和「动作预测」当成两个串联模块,而是把「看懂世界」、「预测下一步会发生什么」、「真正动手执行」三件事一次性塞进同一颗基础模型里,用 37,000 多个小时的异构具身数据,单阶段对齐训练同时优化视觉-语言理解与多本体动作生成,对比业界基线 π₀.₅ 在零样本、指令跟随、任务成功率上都给出了实质提升,并且把模型权重与训练代码全部开源。在所有人都默认「具身大脑必然是多模块拼装」的 2026 年,59 个作者用一篇 50 多页的报告告诉我们:单一模型也可以把三件难事同时做对。

图:三系统架构把理解、预测、动作统一进同一颗具身基础模型的边界示意

一件反直觉的事:把三件难事压成一件

过去两年整个具身智能赛道的工程思路,几乎都遵循同一个「拼装模板」:用一个 VLM 做理解,用一个世界模型做预测,用一个动作头做执行,三者通过中间表征或动作 token 串起来。这种拼装的好处是每件子任务都可以用现成最强模型单独堆,坏处也对应——三个模块之间的语义漂移、推理时延、知识传递损耗会随着任务复杂度线性放大,最后压垮长程任务的完成度。

GigaBrain-0.7 的 59 位作者把这个「常识」整个翻了过来。他们的核心论点是:理解、预测、动作不是三个独立能力,而是同一颗具身大脑在三个不同时间尺度上的表现——「我现在看见了什么」、「下一步世界会怎么变」、「我的手该怎么动」本质上是同一个物理因果链在 t=0、t=δt、t=动作执行窗口的三个切面。当这三件事在训练时就被塞进同一组参数、共享同一个潜在表征时,模块之间的语义漂移从根上被消除了。

这套思路的工程难度非常高,过去一年里所有想走「单一模型」的团队都在两件事上栽过:
- 数据异构:机器人数据来自几十种本体(机械臂、人形、四足),关节定义、动作空间、传感器配置差异巨大
- 目标冲突:理解任务的训练目标是「描述正确」,动作任务的训练目标是「动作可执行」,把两者放在同一梯度里很容易梯度打架

GigaBrain-0.7 给出的解决方案,是用一种叫「三系统架构」的网络拓扑把这两件事分别处理:

系统主要职责时间尺度训练目标
视觉-语言理解系统解析场景、任务指令、物体关系慢(秒级)跨模态对齐 + 任务语义对齐
世界预测系统在动作执行前/中预测下一帧观测中(百毫秒级)视频预测 + 物理因果一致性
动作生成系统输出多本体可执行动作 token快(毫秒级)跨本体动作分布对齐 + 指令跟随

关键点在于:三个系统虽然职责不同,但共享同一个骨干 Transformer 和同一套潜在表征,并通过单阶段对齐训练联合优化。论文里给出的训练数据规模是 37,000+ 小时异构具身数据,覆盖机械臂、双足、四足、移动操作机器人等多种本体,单阶段训练不冻结任何子模块。

37,000 小时数据是怎么被消化的

把 37,000 小时具身数据「喂进去」和「消化掉」是两件事。GigaBrain-0.7 团队在数据侧做了三件关键工程:

第一,异构本体动作归一化。不同机器人的动作空间差异极大——人形机器人是 30+ 维连续关节角度,移动操作机器人是底盘速度 + 机械臂 6 自由度,桌面机械臂可能只有 6-7 自由度。论文给出的解法是把所有动作统一映射到「本体无关的相对位移 token」:无论什么机器人,都用「末端执行器在工具坐标系下的目标位移 + 抓取状态变化」来描述动作。这样动作空间从几十种归一化成一种,骨干 Transformer 不需要为每个本体单独调容量。

第二,时间对齐的多频率采样。理解系统看的是 1-2 Hz 的场景帧,预测系统看的是 10-30 Hz 的连续视频,动作系统看的是 50-200 Hz 的关节控制信号。三种频率的数据在时间轴上做对齐采样,确保同一段轨迹在三个系统里看到的是「同一时刻的世界」。

第三,单阶段联合损失。论文给出的损失函数是三部分加权和:视觉-语言对齐损失(跨模态对比 + 任务语义匹配)、视频预测损失(光流 + 像素重建)、动作分布对齐损失(跨本体 KL + 任务成功 token)。三部分损失不轮流切换、不分阶段解冻,而是同一 batch 同一梯度流里同时算、同时反向传播。

图:37,000 小时异构具身数据被三系统按时间尺度共享同一组参数的归一化流程

对比 π₀.₅:单一模型在多基准上的实际表现

论文给出的对比对象是 π₀.₅——这是 2025-2026 年具身基础模型赛道最有代表性的基线之一,同样是 VLA 路线、同样训练在多本体数据上、同样开源。GigaBrain-0.7 在三组关键评测上给出了显著优于 π₀.₅ 的数字(具体数值以论文 Table 4-6 为准):

  • 零样本跨本体迁移:在训练时没见过的机器人本体上,GigaBrain-0.7 任务成功率相对 π₀.₅ 提升明显,论文把这归因于「本体无关动作 token + 三系统共享表征」
  • 长程指令跟随:跨 30 步以上的复合任务(取物 → 放置 → 检查 → 报告),GigaBrain-0.7 在指令完成率上领先 π₀.₅ 两位数百分点
  • 视频预测 + 动作决策联合测试:在「先看 5 秒未来、再决定下一步动作」的闭环评测里,GigaBrain-0.7 的预测-动作一致性显著高于「预测系统 + 动作系统分开训练」的 baseline

需要说明的是,论文并未在所有 benchmark 上都比 π₀.₅ 强——在某些极度依赖「精确抓取位姿」的窄域任务上,单一模型的细粒度动作精度仍弱于专门优化的动作头。但综合长程任务完成度、跨本体泛化、指令理解三件大事,三系统单一模型的综合能力显著领先。

三系统架构不是「三个模型拼装」

这里有一个关键区分需要厘清:「三系统」不等于「三个独立模型」。如果是三个独立模型用同一个骨干,那本质上还是拼装。GigaBrain-0.7 的三系统指的是「同一组参数里三组不同的注意力 head 群 + 三组不同的输入/输出投影」,三组 head 共享底层 Transformer 的潜在表征,但各自的 query/key/value 投影、注意力偏置、输出头是分开的。

这种设计的好处是:
- 共享表征带来的「跨任务语义一致性」被保留——理解系统看到的「杯子」和动作系统抓取的「杯子」是同一个潜在 token
- 各自 head 的优化目标可以独立设计——理解系统的 attention 偏置可以偏向长程语义,动作系统的 attention 偏置可以偏向短程物理
- 单阶段训练时三组 head 的梯度不会相互抵消——因为它们的输入已经是同一组共享表征,梯度信号天然解耦

论文里给出了一组消融实验:把三系统共享表征拆成各自独立的 Transformer,三件任务同时下降;把单阶段训练换成两阶段(先训练理解、再冻结训练动作),跨本体迁移能力显著下降。这些消融共同证明,「共享表征 + 单阶段联合」是这套架构能跑通的两个不可分割条件。

图:三系统在共享 Transformer 骨干内的 head 群切分与梯度解耦示意

开源的诚意:权重 + 训练代码 + 数据流水线

这篇论文的工程诚意值得单独拎出来讲。GigaBrain-0.7 团队同步开源了三件东西:

第一,模型权重。覆盖 7B 和 34B 两个规模,主干 Transformer + 三系统 head 群全部公开,可以在 HuggingFace 上直接拉取。

第二,训练代码。从异构本体数据加载、动作 token 归一化、三系统联合损失计算,到分布式训练配置,全部开源——这意味着任何团队都可以在自己的机器人数据上继续预训练或微调。

第三,数据处理流水线。包含 37,000+ 小时异构数据的来源清单、本体元数据(关节定义、传感器配置、动作频率)、预处理脚本。这部分的开源对于具身赛道的基础设施建设价值可能比模型权重本身还大——过去一年阻碍团队快速复现的核心瓶颈就是「数据格式不统一」,GigaBrain-0.7 把这个瓶颈直接消除了。

局限:三件难事塞进一颗大脑的代价

论文自己承认了几条边界。

第一,推理算力成本。单一模型同时做三件事的代价是单次前向的 FLOPs 显著高于「VLM + 动作头」拼装方案。在边缘部署场景(机器人车载计算平台),37B 级别的三系统模型需要至少 24GB 显存的边缘 GPU 才能跑到实时,这对消费级机器人是不友好的。论文给出的折中是用 7B 版本做边缘部署、长程任务才上 34B 版本,但「何时切换」本身又是一个需要训练的问题。

第二,单阶段对齐的梯度稳定性。三种损失在同一梯度流里联合优化,对学习率、batch size、数据配比的敏感度显著高于单任务训练。论文里给出了一组超参数扫描结果——batch size 减半、长程任务完成度掉 8 个百分点;学习率翻倍,训练直接发散。这意味着复现团队需要相当仔细的超参调优,不能简单套用 VLM 的训练 recipe。

第三,物理一致性边界。论文在仿真环境里验证了三系统联合的视频预测-动作一致性,但在真实物理世界里,预测系统看到的「下一步世界」和真实世界之间的分布漂移仍然会导致「预测正确但动作错误」的情况。这个问题不是三系统架构独有的,而是整个具身预测赛道的开放问题。

这篇论文传递的最大信号

把 59 个作者、37,000 小时数据、单一模型同时做三件事这件事放在一起看,传递的核心信号是:具身基础模型的下一阶段竞争,已经从「谁的 VLM 更强 + 哪个动作头更准」转向「谁能把这三件事真正统一进同一颗大脑」。

过去一年的拼装路线,本质上是把 VLM 赛道的进步直接搬运到具身领域,省掉了大量基础工作但也背上了语义漂移的包袱。GigaBrain-0.7 的 59 位作者用一篇 50+ 页的报告证明:把三件事塞进同一组参数、用 37,000+ 小时异构数据做单阶段联合训练,开源全部权重 + 代码 + 数据流水线,这件事在工程上是可行的、在性能上是领先的、且对社区是开放的。这对正在做具身基础模型研发的团队意味着:当你在评估「是该把 VLM 换更大、还是把动作头再精修」时,更值得花时间评估的,可能是「能否把理解、预测、动作三件事真正共享同一组参数」。

这件事也再次印证了 2026 年具身赛道的一个底层趋势:数据规模与架构统一性的乘积,比单点模块的极致优化更重要。37,000 小时异构数据 + 三系统单阶段对齐的组合,给出的综合能力提升幅度,明显大于「VLM 升级一个版本 + 动作头再叠一层」的增量。

图:三系统单一模型在长程任务、跨本体泛化、指令跟随三个维度的综合能力边界

论文之外值得思考的事

对今天已经在做具身智能落地的团队来说,GigaBrain-0.7 给出的最大启示是:训练数据的异构性不是负担,而是被低估的资产。过去很多团队倾向于「只在我自己的机器人本体上收集数据」,因为不同本体的数据混在一起训会让损失难调、容量难估。GigaBrain-0.7 用「本体无关动作 token + 时间对齐采样」证明:异构数据不仅能混训,还能成为跨本体迁移能力的核心来源。

对做基础模型研究的团队来说,这篇论文传递的另一条信号是:单阶段联合训练在「多任务共享表征」上的潜力远未被挖尽。过去两年大部分多任务训练都收敛到「冻结主干 + 任务特定 head」的拼装范式,但 GigaBrain-0.7 的消融实验清楚显示,把任务 head 的梯度也纳入联合优化、让所有 head 共享底层 Transformer 的表征,三件事可以一起变好且互不抵消。这对接下来所有「多能力单一模型」方向的研究都有方法论层面的参考价值。

而对关注具身智能商业化的人来说,论文同步开源的「数据处理流水线」可能是被低估的部分。当整个行业还在为「不同团队的机器人数据格式不统一」付出大量 ETL 成本时,一个开源的、覆盖几十种本体的统一数据格式与预处理流程,其价值远超模型本身。这件事可能比 7B 或 34B 的权重更快地改变行业生态。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐