写在前面

从零走向AGI】旨在深入了解通用人工智能(AGI)的发展路径,从最基础的概念起,逐步构建完整的知识体系。
项目地址🔗:https://github.com/AI-mzq/From-Zero-to-AGI.git

魔方AI空间
猫先生
从零走向AGI
面试面经

AIGC算法岗/开发岗面试面经交流社群(涵盖AI Agent、AIGC图像创作、AI视频、LLM大模型、AI多模态、数字人、传统深度学习、具身智能等AIGC面试干货资源)欢迎大家加入:https://t.zsxq.com/YtJ09

导读

RynnBrain 1.1 试图解决的,不是“让视觉语言模型多回答几道机器人题”,而是把机器人执行前需要的空间信息变成统一的模型输出:目标在何处、三维框如何摆放、接触位置在哪里,以及这台机器人的身体有哪些可用自由度。论文将这些能力组织为具身基础模型 RynnBrain 1.1,并在其上训练 RynnBrain-VLA。

模型提供 2B、9B 和 122B-A10B 三个规模。2B、9B 支持原生 3D grounding;最大 MoE 模型主要用于扩展具身认知、空间推理与定位能力。动作端则以 Flow Matching 生成动作块,并用 81 维跨本体动作空间和本体掩码,适配 Unitree G1、Astribot-S1、Tianji-Wuji 等不同形态的机器人。

整篇论文的论证顺序很清楚:先定义统一视觉语言骨干与空间 token(Section 2),再用多类具身数据完成预训练(Section 3);随后将骨干后训练为 VLA 策略(Section 4),最后依次评估具身认知、定位、扩展性、3D grounding、接触点和真机执行(Section 5)。

图 1:RynnBrain 1.1 的能力总览,覆盖具身认知、定位、3D grounding、接触点预测与跨本体动作。

图 1:论文用这张总览图定义 RynnBrain 1.1 的能力边界:三种规模的基础模型覆盖认知、定位、3D 与接触点,RynnBrain-VLA 再延伸到跨本体动作。来源:论文 Figure 1。

猫先生认为,RynnBrain 的关键不在于把“VLM + VLA”并列在同一篇论文中,而是把 2D/3D grounding 与接触点 明确设为二者之间的接口:理解结果要能被身体和控制器继续使用。

  • 论文标题:RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model
  • 论文地址:https://arxiv.org/pdf/2607.17977
  • 项目主页:https://alibaba-damo-academy.github.io/RynnBrain/
  • 代码与模型:https://github.com/alibaba-damo-academy/RynnBrain
  • Hugging Face:https://huggingface.co/collections/Alibaba-DAMO-Academy/rynnbrain-11
  • ModelScope:https://modelscope.cn/collections/DAMO_Academy/RynnBrain-11

原文脉络

Introduction 将具身智能的缺口落在“通用视觉语言理解无法直接提供物理可执行信息”上。Section 2 给出模型概览和统一空间表示;Section 3 说明预训练任务、数据配方及接触点形式;Section 4 才进入 RynnBrain-VLA 的动作生成、统一动作空间、跨本体部署与实时 chunking;Section 5 用分层评测检验每一个能力环节。下面按这一顺序阅读。

1. Introduction:具身模型缺少的是可执行的空间语义

通用 VLM 可以识别物体、理解语言关系,甚至描述操作步骤;但对机器人而言,“杯子在左边”远远不够。控制链路还需要目标的像素或三维位置、可接触部位、相机与本体状态,以及最终落到关节或末端执行器的动作。将检测、抓取、规划和控制分别拼接,常会遇到接口不统一、误差累积与换本体后需要重训的问题。

RynnBrain 1.1 的定位因此是具身基础模型:不只学习视觉问答,还学习时间维度的观测、空间定位、三维几何、接触点和操作规划。论文没有声称用一个模型取代所有低层控制模块,而是先把这些任务转化为共享的视觉语言表示,为后续 VLA 提供连续的语义与几何条件。

2. Overview:用统一自回归架构承接时空与空间 token

2.1 Model Architecture:视觉、语言与多帧观测进入同一骨干

认知骨干采用 decoder-only 视觉语言架构:图像经视觉编码器和视觉—语言投影层进入语言模型,文本指令、单帧或多帧观测在同一序列中建模。论文基于 Qwen3.5 系列构建 2B、9B、122B-A10B 三种规模,并使用 Deep-Stack 与 Interleaved MRoPE 扩展长时序视觉上下文。

图 2:RynnBrain 1.1 的统一具身基础模型架构,将视觉观测、语言指令、2D/3D 空间任务纳入同一自回归预测过程。

图 2:RynnBrain 1.1 的统一具身基础模型架构。它对应论文的 Overview:同一个骨干既处理时空视觉理解,也预测空间与接触相关 token。来源:论文 Figure 2。

2D 框、关键点和轨迹坐标被归一化、离散为 0 到 1000 的空间 token,模型仍以预测下一个 token 的方式训练:

L = − ∑ i log ⁡ P ( y i ∣ y < i , V ; θ ) \mathcal{L}=-\sum_i\log P(y_i\mid y_{<i},\mathcal{V};\theta) L=ilogP(yiy<i,V;θ)

其中 V \mathcal{V} V 表示视觉观测, y i y_i yi 可以是文本,也可以是离散的空间输出。这种设计减少了为检测、指向、轨迹等任务分别增加头部的需求;相应地,坐标精度会同时受离散粒度与自回归解码误差限制。

猫先生认为,统一 token 的意义不是“所有任务看起来都一样”,而是让语言、位置和几何共享上下文。对于多步操作,这比把定位结果作为一次性外部接口交给策略更容易保留指令中的指代关系。

3. Pretraining:把具身能力写入预训练配方

3.1 Training Recipe:2D、3D 与接触点使用不同的物理表述

预训练混合了通用多模态指令、具身认知、定位、3D、机器人感知和规划数据。2D 空间任务继续输出离散坐标;对 3D grounding,2B 与 9B 模型在给定图像、指令和相机内参后预测 9 个量:三维框中心 ( c x , c y , c z ) (c_x,c_y,c_z) (cx,cy,cz)、尺寸 ( w , l , h ) (w,l,h) (w,l,h) 与朝向 ( p i t c h , y a w , r o l l ) (pitch,yaw,roll) (pitch,yaw,roll)。长度以米、角度以弧度表示,再映射为 token。

接触点的定义更具操作意味。论文不沿用通用抓取矩形,而将动作接触抽象为二维中心 p = ( x , y ) p=(x,y) p=(x,y) 和平面内手指朝向 θ \theta θ。夹爪宽度会随硬件改变,矩形也不一定对应功能接触位置;用 ( p , θ ) (p,\theta) (p,θ) 至少能把“碰哪里、以什么方向接近”保留下来,便于接到不同执行器。

3.2 Pretraining Data:大规模数据服务于不同层次的空间能力

三维部分既使用人工核验的 WildDet3D Essential,也包含自动筛选的合成样本;接触点数据来自 Grasp-Anything、Jacquard V2、GraspFactory、GraspNet-1B 与 GraspClutter6D,论文合计约 260 万条样本。数据构成表明,模型先从大规模视觉世界学习对象、关系和几何,再用贴近操作的数据约束什么是可行动的空间信息。

这种统一并不意味着数据问题已经消失。不同来源的相机参数、标注协议和可抓取性定义仍有差别;统一 token 格式解决的是输入输出接口,不会自动消除数据分布的冲突。接触点结果在论文中也主要是定性展示,因为尚缺统一的标准度量。

4. Post-training for Vision-Language-Action Model:让 RynnBrain 生成动作

4.1 Model Architecture:以 Flow Matching 预测连续动作块

RynnBrain-VLA 将视觉语言骨干改造成单流 DiT。语言指令、多相机观测、机器人状态与带噪动作共同构成条件序列,模型通过 Flow Matching 预测动作 chunk。动作被放在序列末端,已编码的视觉语言前缀可以复用 KV cache,减少闭环控制时重复计算。

4.2 Unified Cross-Embodiment Action Space:81 维不是统一身体,而是共享字典

图 3:RynnBrain-VLA 的动作生成链路与跨本体动作空间。不同机器人激活不同动作维度,并用本体掩码计算训练损失。

图 3:RynnBrain-VLA 使用 Flow Matching 生成动作块;81 维动作字典通过本体掩码适配不同机器人。来源:论文 Figure 3。

动作向量划分为 14 维机械臂关节、18 维末端执行器、2 维二指夹爪、40 维灵巧手、4 维躯干和 3 维头部,共 81 维。训练时,每台机器人仅激活实际拥有的维度,损失也只在这些维度上计算。Tianji-Wuji 使用机械臂关节与灵巧手共 54 维;Astribot 同时使用夹爪、头部和躯干;G1 的灵巧手动作还需额外的 SONIC 控制器解码。

4.3–4.5 Cross-Embodiment Deployment、RTC 与 Fine-tuning:将共享表示落到各自控制栈

本体掩码使多机器人演示能够共同训练,但不假装它们的动力学完全一致。论文还通过 cross-driver 部署将上层动作映射给不同执行端,并采用 Real-Time Chunking(RTC)维持实时性。G1 额外使用 64 维 SONIC token 的事实尤其说明:81 维空间是上层策略的共同接口,而不是能够替代每一种低层控制器的万能命令。

猫先生认为,这是一种相对克制的跨本体方案。它把能共享的视觉语义、任务意图和部分动作坐标共享起来,把难以等价的驱动细节留在本体侧;泛化是否成立,仍要由真机迁移而不是维度对齐来证明。

5. Evaluation:从认知、定位到真机操作的分层证据

5.1–5.3 Embodied Cognition、Localization 与 Scaling Analysis

论文先评估具身认知、复杂推理和具身定位,再观察参数扩展。由 2B 增至 122B-A10B 后,三类任务的平均成绩分别从 65.9、51.1、71.8 上升至 72.5、70.8、77.5;复杂空间关系推理的增幅尤为明显。对比对象为同系列基础 Qwen3.5,因此这些结果最直接支持的是:具身继续训练能够显著改变同源模型在空间与推理任务上的能力曲线,而非证明对所有模型均绝对领先。

图 4:不同规模 RynnBrain 与基础 Qwen3.5 在具身认知、复杂推理和定位任务上的对比。

图 4:扩展性分析显示具身继续训练在三个能力维度上均有收益,复杂推理的增幅最突出。来源:论文 Figure 4。

5.4–5.5 3D Grounding 与 Contact Point Prediction

9B 模型在 SUN RGB-D 取得 41.12 AP@15,在真实互联网图像构成的 WildDet3D 上达到 23.44 AP3D,并高于论文比较的专用 WildDet3D 方法(22.6)。这表明视觉语言骨干能够承担一部分三维定位,但该能力只在 2B、9B 版本中提供;不能将 122B-A10B 的认知扩展成绩直接视为最大模型的 3D 结果。

接触点部分给出抓取和操作场景中的定性样例,尚未形成统一的定量基准。它验证了该输出形式能表达接近方向与落点,但还不能单凭可视化证明接触预测本身就是提升真机成功率的主要原因。

5.6 Real-Robot Evaluation:三类机器人上的联合训练收益

真实机器人实验覆盖开门、端菜、煎牛排、摆盘和倒酒等任务,每个任务进行 20 次随机化试验,并记录过程得分与最终成功率。单独训练的 RynnBrain-VLA 平均过程得分为 91.28%,成功率为 86.67%;多本体联合训练的 Generalist 版本达到 94.14% 和 91.67%。论文表中 Qwen-based VLA 为 68.33%/60.00%,GR00T N1.7 为 83.31%/73.33%,π0.5 为 72.44%/65.00%。

图 5:RynnBrain-VLA 在人形、双臂和移动操作机器人上的真实任务案例与成功率。

图 5:真机评测覆盖移动操作、烹饪和服务任务,图中同时展示了不同本体上的任务成功率。来源:论文 Figure 8。

多本体联合训练至少没有明显牺牲各自的任务表现,并显示出正迁移迹象。证据的边界也应保留:每个任务只有 20 次试验,且 GR00T、π0.5 与 RynnBrain 的动作块长度不同,端到端比较并非完全的单变量控制实验。

评测顺序本身也值得留意:前面的认知、定位和接触点并不是直接等同于控制成功率,而是分别验证 VLA 所依赖的感知与空间接口。真机结果将这些能力汇合到端到端策略中,却还没有逐项做完因果拆分;例如去掉 3D grounding 或接触点后,成功率下降多少,仍需要更完整的消融来回答。

6. Conclusion and Future Work:从统一接口走向可复用的具身底座

RynnBrain 1.1 将时空视觉、2D/3D grounding、接触点与动作生成串成一条模型路线。其价值不只是增加几项具身 benchmark,而是把“在哪里、怎样接触、当前身体能怎样动”写成同一基础模型可以表达和传递的中间语言。

猫先生认为,后续最关键的检验有三项:接触点是否能在受控实验中独立带来操作收益;原生 3D grounding 能否扩展到最大模型;以及统一动作空间在更多控制频率、末端工具与机器人本体上能否保持迁移。只有这些问题经受住更严格的真机验证,具身基础模型才会更接近可复用的“认知—行动底座”。

参考资料

推荐阅读

► 技术资讯: 魔方 AI 新视界

► 项目应用:开源视界

► 技术专栏: 多模态大模型最新技术解读专栏 | AI 视频最新技术解读专栏 | 大模型基础入门系列专栏 | 视频内容理解技术专栏 | 从零走向 AGI 系列

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐