26年3月来自阿里达摩院的论文“RynnBrain: Open Embodied Foundation Models”。

尽管多模态基础模型取得了飞速进展,但具身智能领域仍缺乏一种统一的、基于物理规律的基础模型,能够将感知、推理和规划整合于现实世界的时空动态之中。推出 RynnBrain,这是一个面向具身智能的开源时空基础模型。RynnBrain 在一个统一框架内强化四大核心能力:全面的自我中心视角理解、多样化的时空定位、基于物理规律的推理以及物理-觉察的规划。RynnBrain 系列包含三种规模的基础模型(2B、8B 和 30B-A3B MoE)以及四种针对下游具身任务(如 RynnBrain-Nav、RynnBrain-Plan 和 RynnBrain-VLA)或复杂空间推理任务(如 RynnBrain-CoP)进行后训练的变体模型。在涵盖 20 个具身智能基准测试和 8 个通用视觉理解基准测试的广泛评估中,RynnBrain 基础模型超越现有的具身智能基础模型。这套后训练模型进一步验证 RynnBrain 基础模型的两大关键潜力:(i) 实现基于物理规律的推理与规划;(ii) 作为强大的预训练骨干网络,能够高效适配各种具身智能任务。


如图1所示,RynnBrain在四个关键维度上展现出强大的能力:

  1. 全面的以自我为中心的理解能力:RynnBrain在空间理解、具身问答、以自我为中心的计数及OCR(光学字符识别)等方面表现卓越。值得一提的是,它还引入细粒度视频理解能力——这是以往具身智能系统常被忽视的一环。
  2. 多样化的时空定位能力:RynnBrain能够在其整个情景记忆范围内定位物体和目标区域,甚至预测运动轨迹,从而赋予机器人全局空间感知能力。
  3. 基于物理环境的推理:不同于传统的文本推理,RynnBrain采用一种交替推理策略,在文本处理与空间定位之间进行切换,确保其推理过程牢固地建立在物理环境之上。
  4. 具备物理-觉察的规划:为了向下游策略模型提供更精确的规划指令,RynnBrain将affordance、区域及物体的位置信息直接整合到规划输出中。因此,即使是极其复杂且精细的任务,也能在分层式的系统架构下得到有效处理。
    请添加图片描述

1 模型架构

RynnBrain 架构的概述如图 2 所示。RynnBrain 采用遵循 Qwen3-VL [6] 设计原则的仅解码器视觉语言架构。它包括一个视觉编码器、一个视觉语言投影器和一个从 Qwen3-VL 变体 (Qwen3-VL-2B/8B/30B-A3B-Instruct) 初始化的大语言模型 (LLM) 主干。此外,还采用DeepStack [68]和Interleaved MRoPE [41]技术来更好地集成多模态信息。
请添加图片描述

2 基础设施

作为通用的具体化基础模型,RynnBrain 的训练数据由多种模式组成,包括视频、图像和文本,涵盖广泛的任务。这些任务的范围从短响应任务(例如定位和空间感知)到涉及详细多模态字幕和复杂推理的长格式任务。这种固有的任务多样性导致序列长度分布具有高方差和明显​​的长尾特征。由于计算复杂性随序列长度而变化,因此在数据并行 (DP) 训练环境中样本的简单分布会导致严重的掉队效应,使分配繁重工作负载的工作人员成为吞吐量瓶颈。

为了缓解这个问题,实施在线负载平衡管道。具体来说,首先根据预计算的图像大小和文本tokens的数量来估计所有样本的序列长度。在训练过程的批量采样阶段,不是为每个 数据并行(DP) Worker 分配相同数量的样本,而是聚合 DP 组中的所有样本,并基于最小化每个 DP Worker 内的最大累积序列长度的目标重新分配它们。为了有效地解决这种重新分配问题,采用一种优先处理较长序列的贪心近似算法:初始化等于 DP 世界大小的缓冲区,按长度降序对序列进行排序,并迭代地将每个序列分配给当前总长度最小的缓冲区。该过程在数据预取时执行;在单程序多数据(SPMD)框架下,稳定排序可确保全局数据分布在所有工作人员中保持一致。这种快速、动态的分配可以防止训练停滞,同时保持灵活性,从而无需在超参数或数据集发生变化时进行昂贵的数据预处理。

为了在样本重新分配后保持收敛稳定性,在传统的每token损失公式下需要全局 token数量。然而,计算全局 Token 数量(即分母)需要在数据并行(DP)组内进行额外的全收集(all-gather)操作,这会引入同步开销并降低训练效率。为了规避这一问题,采用逐样本损失归约策略。该策略消除额外通信的需求,从而提高效率。这种整体性方法在保持模型稳定性和收敛特性的同时,使训练效率翻了一番。

为了在单块 GPU 的显存限制内容纳这些模型,在训练 RynnBrain-2B 和 RynnBrain-8B 时采用 ZeRO-1 优化器 [77] 和逐块梯度检查点(per-block gradient checkpointing)技术。考虑到 Logits 占用大量显存,在输出头的正向传播过程中有选择地过滤掉无需计算损失的 Token(例如多模态 Token)。对于规模更大的 RynnBrain-30B-A3B 模型,采用 ZeRO-2 优化器 [77] 以及世界大小(world size)为 2 的专家并行(EP)技术,以便将模型切分并适配到单块 GPU 上。为了优化计算吞吐量,基于 NVIDIA CUTLASS 1 的算子模板,针对采用打包输入和权重的 MoE 层实现分组线性运算。EP 所需的跨 GPU Token 调度则通过 DeepEP [57] 实现。为了确保广泛的易用性与可扩展性,训练和推理框架基于 HuggingFace Transformers [101] 库构建,并已开源发布。


要使具备泛化能力的机器人能够与现实世界环境自然交互,需要具备两项基本能力:(1) 时空记忆:机器人必须通过历史视觉记忆,建立涵盖空间、位置、事件、轨迹等多维信息的表征,从而适应复杂且动态的环境。(2) 物理世界接地(Physical World Grounding):机器人的所有认知过程都必须从根本上植根于物理世界的客观现实。

1 训练方案

为了赋予 RynnBrain 时空记忆和物理接地能力,采用一种统一的预训练框架,将多模态输入映射到共享的语义表征空间。该训练方案围绕两个核心组件构建:统一的输入输出表征和物理感知优化策略。

统一的时空表征。为了支持时空记忆,将图像和视频视为统一的视觉模态。形式上,视觉输入 V 被表示为帧序列 {I_t},其中静态图像对应 T=1,视频对应 T>1。对于视频,采用均匀采样以保持时间连续性。每一帧都被编码为视觉 Token,并结合时间位置嵌入(temporal positional embeddings)以编码帧的顺序。这种表征方式使 RynnBrain 能够捕捉长视觉序列中的时间依赖关系、运动模式及轨迹动态特性。
物理接地的输出空间。为了确保与物理世界的接地,明确构建输出空间,以连接高层推理与底层执行。与将空间量视为自由格式文本的传统视觉-语言模型不同,引入离散坐标 Token 来表示物理位置。所有空间实体(包括边界框 B、点 P 和轨迹路点 T)均被归一化至 [0, 1000] 范围,并编码为整数 Token。这种离散化处理将连续的空间预测转化为分类问题,使模型能够利用与语言生成相同的自回归机制,生成精确且具有物理意义的空间输出。

优化。RynnBrain 采用标准的“预测下一个 Token”目标进行端到端训练。基于在预训练数据的一个代表性子集上进行的初步实验,对不同模型规模下的优化超参数进行调整。

2 预训练数据

通用MLLM数据

为了保持广泛的多模态理解能力,构建一个涵盖多领域图像和视频的通用MLLM预训练语料库。该语料库整合多个公开数据集,包括LLaVA-OV-SI [52]、LLaVA-Video [118]、ShareGPT-4o-video [15]、VideoGPT-plus [61]、FineVideo [29]、CinePile [79]、ActivityNet [10]、YouCook2 [123]、LLaVA-SFT [58]和VideoLLaMA 3 [114]。这些数据集共同支持开放词汇对象识别、对话式视频理解、长时序推理以及图文监督学习。该语料库总计包含480万个样本。

多维认知数据

对象理解。对象理解数据集旨在增强细粒度对象识别和以对象为中心的推理能力。每个样本聚焦于单帧中由边框标注的特定对象,格式为 <object> <frame n>: (coordinates) </object>,相关问题均基于该指定对象提出。该数据集涵盖了对象的类别、颜色、形状、功能、空间位置及相关属性等信息。

将公开数据集 [110, 64, 112, 55, 113] 与自采集的第一人称视角(egocentric)数据相结合,共获得超过110万个样本。针对第一人称视角子集,构建一条基于室内视频的“以对象为中心”的问答(QA)生成流水线。首先利用Qwen2.5-VL [7]识别对象,使用Grounding DINO 1.5 [81]在关键帧中检测对象,并利用SAM2 [78]进行分割与追踪。为减少冗余,限制每个视频中每种对象类别最多包含两个实例。随后,利用Qwen2.5-VL生成以对象为中心的问答对,并经过人工质量筛选,最终得到71.2万个高质量问答样本。

空间理解。空间推理对于导航和物体操控等具身任务至关重要,但这仍是许多现有视觉语言模型(VLM)的短板。为解决这一局限,构建超过250万个空间指令样本,涵盖两大类别:通用空间理解与细粒度、以物体为中心的空间推理。

通用空间理解数据源自公开数据集,包括Sensenova-SI-800K [12]、VLM-3R [27]和VSI-590K [106]。针对细粒度空间标注,利用MASt3R-SLAM [69]处理自采集的室内图像与视频,该方法能从RGB视频中重建三维点云并估计相机外参。将实例级分割结果投影至重建的三维空间中,并利用RANSAC [31]算法对点云进行重对齐,以检测地面并建立与重力方向一致的世界坐标系。

基于这些经过校准的三维场景,生成需要对度量距离、相对位置、高度及其他三维关系进行推理的空间问答(QA)对。QA生成采用模板化方案,其中缺失的属性值直接根据底层几何信息计算得出。该过程共生成85.5万个基于视频和27.2万个基于图像的空间QA样本。

计数。计数数据集旨在提升模型在复杂视觉场景中对物体数量进行稳健估算的能力。将公开数据与第一人称视角(egocentric)室内视频相结合。公开数据部分包含Molmo2计数子集 [20],该子集由22.2万个场景多样且标注可靠的样本组成。为引入具身视角,进一步从自采集的第一人称视角视频中构建4.2万个计数QA对。所有标注均经过人工核查,以确保准确性与一致性。

OCR。OCR数据集赋予模型场景文本识别与定位(grounding)的能力,这对于文本丰富的具身环境至关重要。利用源自Ego4D [34]、Charades-Ego [88]和EPIC-KITCHENS [23]的第一人称视角视频,构建约100万个OCR QA样本。利用 GoMatching [38, 39] 检测场景文本,并根据文本出现模式将视频分割为 3 到 15 秒的片段,从而得到 85,324 个包含文本的片段。

针对每个片段,人工标注员标注文本首次出现的帧、最清晰的帧、文本内容以及包围多边形。问答(QA)对的生成采用了两种互补策略:(i) 利用 GPT-5.2 [71] 生成基于实际文本理解、面向目标且采用第一人称视角的问题,共生成 25.6 万个上下文相关的 QA 样本;(ii) 采用基于模板的生成方式,构建涵盖文本读取、时间定位、验证及多项选择识别等任务的结构化问题,共生成 72.2 万个样本。所有由 GPT 生成的问题均经过筛选,以确保回答问题需要依赖视觉感知能力。

该 OCR 数据集提供两种格式:常规视频问答(89.3 万个样本,模型根据视频输入预测文本答案)和区域预测问答(8.5 万个样本,模型输出帧索引及归一化后的边界坐标)。

以自我为中心的任务理解:为了支持广泛的以自我为中心的任务理解,构建一个包含 277 万个视频-文本对的数据集。该数据集整合多种公开资源,包括 Env-QA [1]、EgoTaskQA [44]、RoboVQA [85]、EgoRe-5M [73]、QAEgo4D [72]、Robo2VLM [13] 和 ShareRobot [43]。剔除时长不足 3 秒的视频,以确保具备足够的时序上下文信息来进行任务级推理。

时空定位数据

物体定位。物体定位使模型能够解读语言指令,并在图像和视频中识别目标物体。每个样本表示为 (V, Q, B, t),其中 V = {I_t} 表示包含 T 帧的序列(对于静态图像,T = 1),Q 是描述目标物体的文本查询,B = {(x_0, y_0, x_1, y_1)} 是目标物体的边框(坐标归一化至 [0, 1000] 范围),t 表示能最清晰观察到该物体的关键帧。

从公开的定位(grounding)数据集中汇总 90 万个样本,这些数据集包括 ADE20K [121]、COCO [56]、Mapillary [70]、PACO-LVIS [76]、PASCAL-Part [16]、VG [48] 和 RoboAfford++ [36]。为了增强以自我为中心的定位能力,利用与物体理解任务相同的分割流程,进一步构建 30 万个以自我为中心的样本。用 Qwen3 [104] 生成指代性描述(referring expressions),其中包括基于类别或位置的简单描述,以及需要任务级推理的情境化描述。所有样本均经过人工质量筛选。

区域定位。区域定位使模型能够识别图像和视频中的非物体区域,例如表面、空旷空间或功能区域。每个样本表示为 (V, Q, P, t),其中 P = {(x_i, y_i)} 表示一组归一化坐标点,用于指示目标区域,t 为关键帧索引。

该数据集由多个来源构建而成。用大语言模型(LLM)生成的指令和人工选定的点标注,对 6,000 个以自我中心视角(egocentric)拍摄的房屋导览视频片段进行标注。为了增强时间维度的覆盖范围,纳入来自 Molmo2-VideoPoint [20] 的 222,000 个视频样本。针对静态场景,采用类似的流程,从室内图像中构建 448,000 个“图像-区域”样本。此外,为了增加领域多样性,还引入来自 RoboAfford++ [36] 和 RefSpatial [122] 的 220 万个基于图像的样本。

Affordance定位。Affordance定位侧重于识别物体或表面上可进行操作的点,例如把手、按钮或交互热点。每个样本表示为 (V, Q, p, t),其中 p = (x, y) 为归一化的affordance点坐标,t 表示该affordance最相关的关键帧索引。

遵循与区域定位类似的构建流程。对于时空数据,利用 LLM 生成的指令和人工标注的affordance点,对 6,000 个视频片段进行标注。对于静态图像,从 500,000 张室内图像中提取 476,000 个affordance样本。为了提高泛化能力,进一步纳入来自 RoboAfford++ [36] 的 260,000 个affordance样本,重点关注可操作的交互行为。

轨迹定位(Trajectory Location)。轨迹定位旨在训练模型,使其能够针对物体交互任务预测合理的二维操作轨迹。每个样本表示为 (V, Q, T, t_s),其中 T = {(x_i, y_i)} 是包含最多 10 个归一化轨迹点的有序集合,t_s 表示起始帧。

利用 LLM 生成的指令和人工标注的轨迹构建 6,000 个时空样本,重点强调跨帧推理能力。对于静态图像,从室内场景中生成 507,000 个“图像-轨迹”样本。为了进一步丰富操作场景的多样性,纳入来自 FSD [111] 的 13,000 个轨迹样本。

抓取姿态定位(Grasp Pose Location)。抓取姿态定位数据集赋予模型针对目标物体预测精确机器人抓取姿态的能力。每个样本表示为 (I, Q, G),其中 I 代表单张 RGB 图像,Q 是指定目标物体及抓取任务的文本查询,G = {(x, y)} 代表定义带方向抓取矩形的四个有序角点。
基于 Grasp-Anything [96] 构建该数据集;该数据集针对桌面场景中的日常物品提供抓取标注,采用由中心坐标 (c_x, c_y)、尺寸 (w, h) 和旋转角度 θ 参数化的带方向矩形来表示抓取。处理约 99.5 万张分辨率为 416×416 的图像,每张图像包含一个或多个已标注的抓取候选方案。对于每个物体,选取​​评分最高的抓取方案,并通过旋转操作将其参数化表示转换为四个角点坐标。这种表示方式明确捕捉抓取方向与夹爪对齐状态,从而支持空间精确的操作规划。

为了提升语言的多样性,采用加权模板策略生成指令提示:40% 为以物体为中心的提示,30% 为包含场景描述的场景感知型提示,另外 30% 为强调操作意图的任务导向型提示。抓取姿态的输出采用多种简洁的响应模板来表达,以增强模型对不同语言表达方式的鲁棒性。

基于这一流程,构建一个包含 130 万个训练样本的静态图像抓取姿态数据集,这些样本源自 94.5 万张图像,平均每张图像对应 1.44 个样本。该数据集使 RynnBrain 能够学习具备方向感知能力和空间定位能力的抓取姿态预测,这是机器人操作任务中的一项关键能力。

物理-觉察规划数据

为了支持精确的操作规划,设计一种结构化的规划数据模式。参考 Hi Robot [87] 的做法,将原子动作作为规划的最小单元。利用内部模型将长程任务分解为按时间顺序排列的子任务,并由人工标注员进行验证。

为了实现细粒度的空间定位,每个子任务都采用统一的定位模式进行标注,其中包括目标物体的边框、放置区域点以及affordance点。形式上,每个训练样本表示为 (V, Q, M),其中 V = {I_t} 表示当前步骤之前的视觉上下文,Q 是高层任务指令(例如“请帮我整理水槽”),M 表示当前的子任务规划,表现为文本token和定位标注(边框 B、区域点 P 和affordance点 p)的混合序列。

整合包括 AgibotWorld Alpha [22] 和 Open X-Embodiment [21] 在内的公开数据集,并将它们格式化为单轮规划对话。为了增强物理定位能力,进一步对这些数据中随机采样的帧添加空间标注。这种设计使 RynnBrain 能够将物体、区域和affordance信息直接整合到规划输出中,从而为下游的操作策略提供精确且符合物理特性的指导。


大多数现有的多模态推理模型 [30, 59, 51] 依赖于纯文本推理范式。尽管一些方法 [60, 120, 33, 108] 引入诸如区域放大(region zooming)等辅助工具来缓解视觉识别难题,但其推理过程在很大程度上仍脱离物理空间结构,从而限制模型在特定任务之外的泛化能力。另一些探索推理过程中视觉想象的方法 [35, 103, 26] 则面临视觉内容“幻觉”的问题,进而损害物理一致性。

对于在现实世界环境中运行的具身智体而言,推理必须建立在可观测的物理证据之上。为此,在 RynnBrain 中引入“点链”(Chain-of-Point,简称 CoP)推理机制。这是一种交错式推理范式,将显式的空间定位(spatial grounding)与基于自我中心(egocentric)视频流的文本推理相结合。通过将中间推理步骤锚定在具体的空间参照物上,CoP 弥合基于语言的认知与物理感知之间的鸿沟,从而实现了与底层环境保持一致的推理过程。

1 冷启动监督微调

训练方案

CoP 推理模型(即 RynnBrain-CoP)的训练始于预训练的 RynnBrain 模型,该模型已在通用具身理解方面奠定了坚实基础。用 AdamW 优化器配合余弦学习率调度策略,进行全参数监督微调。将语言模型和投影器(projector)的峰值学习率设为 1 × 10⁻⁵,视觉编码器(vision encoder)的峰值学习率设为 2 × 10⁻⁶,并设置 3% 的预热(warmup)期。模型训练 1 个 epoch,全局批次大小(global batch size)为 128。为了有效处理长时程(long-horizo​​n)的自我中心视频,以 2 FPS 的频率采样帧(最多 2048 帧),并将最大上下文长度设为 16,384 个 token。训练过程中,用 DeepSpeed ZeRO-1 技术来优化内存效率。

数据

为了培养模型的 CoP 推理能力,构建一个专用数据集,其中显式地将文本推理与视觉定位过程交织在一起。该过程基于核心的时空位置数据集(涵盖区域、affordance及轨迹位置)。每个样本都包含一个“思维”(Thinking)字段,用于连接高层任务理解与底层空间定位。

数据生成遵循结构化的流程:首先,利用原始任务指令和视频帧,通过 Qwen3-VL-235B 预生成分步文本推理链。该推理链包含关键推理步骤,并使用方括号(例如 [白色花纹壁纸])明确标记潜在实体(如物体或区域),这些实体即为视觉定位的候选对象。随后,利用内部模型根据文本上下文将每个标记实体分类为“区域”或“物体”。最后,由人工标注员审核推理链及实体分类结果。针对每个确定的实体,标注员从视频序列中选取最相关且清晰的帧进行精确标注:

对于归类为“区域”的实体,标注一组代表性点位;对于归类为“物体”的实体,则标注二维边框。随后,将定位结果以 <object/area> : …; (coordinates) </object/area> 的结构化格式嵌入推理文本中,从而实现文本推理与空间定位的无缝交织。

该流程构建一个CoT-风格的数据集,其中模型的内部思维过程不再仅仅是抽象的,而是持续锚定于物理空间中的具体视觉证据。从形式上看,样本将基础元组扩展为 (V, Q, P_final, t_s, R),其中 R 代表这种交织的推理链。该数据集是训练 RynnBrain-CoP 的基础,使 RynnBrain 能够进行透明、具备定位依据且抗幻觉的推理,这对于具身智能场景中的可靠运行至关重要。

2 强化学习

训练方案

采用“组相对策略优化”(Group Relative Policy Optimization, GRPO)[86] 方法,使模型与基于物理常识的推理任务相适配。与需要价值函数(Critic)来估计优势(advantage)的标准 PPO [84] 不同,GRPO 通过对同一提示(prompt)生成的多个采样输出的组内得分进行计算来估算基线。这种方法显著降低内存占用和训练复杂度。

具体而言,对于每个查询 q,从旧策略 π_old 中采样一组输出 {o_1, o_2, …, o_G}。优化目标定义为 J_GRPO(θ),其中每个输出的优势 A_i 是通过对组内奖励进行归一化计算得出的。

训练过程基于冷启动阶段的 SFT 模型进行初始化。利用 SGLang [119] 推理引擎高效生成采样输出(rollout),组大小 G 设定为 5。训练共进行 10 个 epoch,批次大小(batch size)为 128。采用余弦学习率调度策略优化策略模型,初始学习率为 2 × 10⁻⁶,并包含 3% 的预热(warmup)阶段。为确保训练稳定性,将裁剪范围 ε 设定为 [0.2, 0.28],KL 散度系数 β 设定为 0.02。最大序列长度设定为 16,384 个 token,以支持长上下文的自我中心(egocentric)视频推理任务。

奖励设计

设计针对特定任务且基于规则的奖励函数,旨在将模型的推理过程严格锚定于物理世界。在计算奖励之前,所有空间坐标均被归一化至单位区间 [0, 1]。

轨迹。轨迹奖励用于评估预测路径的形状及其序列对齐情况。首先,将预测序列 P = (p_1, . . . , p_M ) 和真值序列 G = (g_1, . . . , g_N ) 进行重采样,使其包含相同数量的点,且各点沿弧长均匀分布。随后,计算离散弗雷歇距离(Discrete Fréchet Distance, DFD),该距离通过递归方式定义。

Affordance。利用双向平均欧氏距离(Bidirectional Mean Euclidean Distance,一种倒角距离的变体)来衡量预测交互点集 P 与真值点集 G 之间的集合相似度。该指标综合考量精度(通过惩罚无效预测)与召回率(通过衡量对所有标注affordance区域的覆盖程度)。

区域。对于区域识别,将该任务视为有效多边形内的点检索问题。令 S_G 表示由真值(ground truth)多边形定义的几何区域。奖励即为生成的点集 P 的严格准确率。

强化学习数据

为了支持高效且高质量的策略探索,构建一个精选的强化学习数据集。该数据集基于预训练阶段使用的时空定位数据,涵盖了区域定位、affordance识别及轨迹规划任务。这些任务为视觉证据定位和基于物理-觉察的推理提供了必要的监督信号。

采用一种难度-觉察过滤策略,剔除那些无需基于现实场景进行推理的简单样本,以及噪声过大或存在歧义的样本。每个候选样本均由预训练的 SFT(有监督微调)模型根据定义的评估指标进行评分,仅保留难度适中(评分在 40 到 80 之间)的样本。为了进一步提升时间定位能力,还纳入了一部分 SFT 模型错误选择关键帧的失败案例。

经过这一精炼过程,获得一个包含 3 万个训练样本的高质量数据集。通过将探索过程限制在一个结构化且符合物理规律的框架内,该数据集减少模型产生“幻觉”的现象,并促进了强化学习过程中更可靠的推理。


1视觉语言导航

RynnBrain 基础模型经过预训练,旨在增强其通用理解能力。为了验证这种预训练对视觉语言导航(VLN)任务的益处,随后在 VLN 数据集上对模型进行微调。微调后的 RynnBrain 模型(命名为 RynnBrain-Nav)被部署为智体,用于执行导航任务。

问题定义。在 VLN 任务中,具身智体需要解读自然语言指令 Q。在时刻 t,智体需根据视觉观测序列 O = {o_0, o_1, . . . , o_t} 和语言指令 Q,生成相应的动作 a_t,以遵循指令并抵达目标位置。每个观测值 o_i 均为智体当前视角下的 RGB 图像。离散动作空间定义为 A = {↑, ←, →, STOP},分别对应向前移动 30 厘米、向左或向右旋转 15 度以及终止当前任务回合等底层动作。

数据形式。采用多轮对话形式,这种形式在训练和推理阶段均具有高效性。遵循 StreamVLN [100] 的方法,训练数据被组织为一系列观测-动作对 d_i = (o_i, a_i)。训练目标是根据当前的视觉观测 o_i 和之前的对话历史来预测下一个动作 a_i。

数据收集。利用 Habitat 仿真器 [83] 构建一个大规模、专用于导航任务的训练数据集,并使用“真值动作”(ground truth actions)生成图文交错的 VLN(视觉语言导航)数据集。该数据集的主体包含 45 万个视频片段,这些片段源自 R2R [3]、R2R-EnvDrop [91] 和 RxR [49] 数据集中的轨迹,涵盖 60 个 Matterport3D (MP3D) [75] 环境。为了增强场景多样性并提升泛化能力,利用 ScaleVLN [99] 数据集的子集,额外增加 30 万个样本进行数据扩充。此外,还采用多轮 DAgger [82] 策略来进一步收集数据,从而提升模型性能。

微调设置。使用 AdamW 优化器配合余弦学习率调度策略,进行全参数监督微调。将语言模型和投影层(projector)的峰值学习率设为 2 × 10⁻⁵,视觉编码器(vision encoder)的峰值学习率设为 2 × 10⁻⁶,并设置3% 的预热(warmup)阶段。模型训练进行 1 个 epoch,全局批次大小(global batch size)设为 256。为了有效处理长时程(long-horizo​​n)的自我中心视角视频,以 2 FPS 的频率采样帧(最多 2048 帧),并将最大上下文长度设为 16,384 个 token。训练过程中,利用 DeepSpeed ZeRO-1 技术来优化显存效率。

2 操作规划

由于预训练语料库中包含以规划为核心的数据,该基础模型已具备内在的规划能力。然而,要将这种能力应用于复杂且长时程的操作任务,模型需要保持有效的记忆。为了解决这一问题,使用一个小规模的自建数据集,其格式为多轮对话;在这种形式下,交互历史充当了显式记忆缓冲区,用于保存过往的推理结果。这种结构使模型能够将各个独立的规划步骤串联起来,形成连贯的长时程策略。关键在于,为了适配这种序列推理过程,仅在每轮对话的最后一帧上标注“落地”(grounding annotations),从而确保当前的决策既基于即时观测,又基于累积的记忆信息。实验结果表明,该方法具有极高的数据效率:仅需数百个样本进行微调,即可赋予模型强大的长程规划与泛化能力。

3 VLA

模型架构。为弥合规划与物理执行之间的鸿沟,提出了 RynnBrain-VLA,旨在将细粒度规划转化为可执行的机器人动作。在 RynnBrain-2B 的基础上构建 RynnBrain-VLA,从而利用其在大规模细粒度物体指代和精确空间定位方面的预训练优势,同时保持较低的推理延迟。

整体模型架构如图3所示。总体而言,采用流匹配(flow matching)框架,在每一步预测一个动作片段(action chunk)[8]。VLM 主干网络采用单流扩散 Transformer(DiT)架构,接收包含条件信息和带噪动作的单一打包序列作为输入。为使 VLM 适配该框架,引入三个线性投影层,将输入噪声、输入时间戳嵌入(timestamp embeddings)及输出动作的维度对齐至 VLM 的隐藏层维度。为保留 VLM 固有的指令遵循能力,沿用其原生的对话格式来组织输入序列。与规划模型一致,指点信息(pointing information)以文本格式传入,并将任务的初始帧置于输入序列的最前端:
请添加图片描述
请添加图片描述

参考 π0 [8] 的做法,将动作置于序列末尾,以便在推理过程中启用 KV 缓存(KV cache)。

微调。为赋予模型机器人控制能力,构建一个包含六种“抓取-放置”任务的数据集,涉及三种不同物体,并通过 Franka Emika 机械臂的人工遥操作进行数据采集。数据采集完成后,为每个片段(episode)标注目标物体或放置位置,并使其与规划模型的输出格式保持一致。随后,在该数据集上对 RynnBrain-2B 模型进行 60,000 步的微调,学习率设为 2e-5,批次大小(batch size)设为 32。所有图像均按比例缩放,使短边尺寸达到 384 像素。实验结果表明,通过利用 RynnBrain 的具身理解与精确定位能力,这种简单的适配方案实现对基于点的指令的准确解读以及可靠的抓取。


1 RynnBrain-Bench

对于在物理现实中运作的具身智体(具身大脑)而言,针对整个情景记忆(episodic memory)的细粒度时空理解对于执行复杂的具身任务至关重要。现有的基准测试主要侧重于基于文本指代对象的静态场景理解 [62, 25] 或基于单帧输入的空间指向任务 [43],难以充分评估模型在这一领域的能力。推出 RynnBrain-Bench,这是一个高维评估套件,旨在全面评估具身理解模型在复杂家居环境中的认知与定位能力。与现有基准测试相比,RynnBrain-Bench 的独特之处在于强调情景视频序列中的细粒度理解与精确的时空定位。

概览

在图 4 中展示 RynnBrain-Bench 的总体框架,突出其核心维度和典型任务。RynnBrain-Bench 从四个基础维度系统地衡量时空具身理解能力:物体认知(Object Cognition)、空间认知(Spatial Cognition)、落地(Grounding)和指向(Pointing)。该基准测试涵盖 21 种专门的子能力,范围从详细的物体属性(如颜色、形状)到affordance点预测;它包含 3,616 个视频片段(共 577,998 帧)以及 12,000 个精心设计的开放式问题,以进行全面评估。数据构建始于自采集的室内第一人称视角(egocentric)视频和利用基础模型先验生成的物体相关问答对,随后采用严格“人在回路”(human-in-the-loop)标注流程进行处理。标注数据经过多轮人工交叉验证,以确保其准确性和高质量。在每个基础维度的子能力之间进行内部数据平衡,以确保评估的公平性和客观性。为了确保高保真度,与物体相关的问题还根据现实世界中的物体分布进行了平衡,从而增强了真实感。
请添加图片描述

评估维度

RynnBrain-Bench 定义一种新的时空评估范式,要求模型执行基于指令的认知与定位任务,且这些任务必须锚定在精确的空间和时间坐标上。

物体认知维度要求模型在动态图像序列中进行细粒度的物体感知,并对区域级目标进行计数。评估九项核心物体属性(即类别、颜色、材质、形状、状态、位置、功能、表面细节和尺寸),以及一项独特的物体计数能力。模型需要根据包含精确时空位置信息(即帧索引和空间坐标)的问题给出回答。评估指标:在评估过程中,GPT-4o 会对回答进行评分(范围为 0 到 1),评分采用二元制或以 0.2 分为增量的多级评分系统。

空间认知要求模型从以自我为中心(egocentric)的视频流中获取三维空间感知能力,涵盖两个主要视角:以自我为中心和以世界为中心(world-centric)。以自我为中心的认知考察具身智体与环境之间随时间变化的关系(如旋转、方向);而以世界为中心的认知则评估模型对客观三维布局及物理属性(如尺寸比例、距离和位置)的理解。评估指标:对于数值型问题,参照 RynnEC [24] 的方法,采用平均相对准确率(MRA)和旋转准确率(RoA)进行评分。对于文本型问题,则使用前述 GPT-4o 提供的二元或细粒度评分。

“定位”(Grounding)评估的是精确的时空定位能力,这是将理解与现实世界建立联系的关键环节。该任务要求模型:(1) 准确定位关键时间帧;(2) 预测该帧内物体的空间坐标。其区分两种定位方式:一是“直接定位”(Direct Grounding),即根据明确描述定位物体;二是“情境定位”(Situational Grounding),即需要在复杂场景中通过情境感知推理来识别并定位目标。评估指标:采用 Acc@0.5 指标进行评分 [45]。具体而言,仅当模型选定的帧 t 包含有效的真值(G_t ≠ ∅),且预测框 B 与真值 G_t 之间的交并比(IoU)超过 0.5 时,该预测才被视为正确。

“指点”(Pointing)任务旨在预测整个情景记忆中的目标区域、时空轨迹或 affordance 点,是机器人与物理世界交互的关键桥梁。与以往的基准测试不同,将评估范围扩展到时空域;在此设定下,模型必须展现出双重能力:既要定位关键帧,又要预测相应的任务相关点序列。评估指标如下:对于指点任务,若模型预测的帧不包含有效的真值(即真值集 Gt 为空集 ∅),则得分为零。否则:(1) 对于轨迹预测,计算预测点序列 P = (p_1, . . . , p_M) 与真值序列 G = (g_1, . . . , g_N) 之间的离散弗雷歇距离(DFD)[43]。将两条序列重采样为沿弧长均匀分布的 15 个点,并计算 DFD。(2) 对于区域预测,计算落入真值多边形 SG 内部预测点 P 的比例。(3) 对于affordance预测,通过计算从每个预测点 p ∈ P 到真值集 G 中最近邻点的欧氏距离的指数衰减,来评估空间邻近度。

2 具身认知能力

为了评估 RynnBrain 的具身认知能力,在多种基准测试集上对其进行评估,包括 VSI-Bench [105]、MMSI [107]、ERQA [94]、RoboSpatial [90]、EgoTaskQA [44]、EgoTextVQA [124]、Open-X VQA [13]、MindCube [109] 以及 RynnBrain-Object 和 RynnBrain-Spatial。如表 3 所示,RynnBrain-8B 在 11 项具身认知任务中的 9 项上均优于基座模型 Qwen3-VL-8B。

3 具身定位能力

评估 RynnBrain 在五项关键定位任务中的空间接地能力:物体定位、区域定位、可供性(affordance)定位、轨迹定位以及抓取姿态定位。将模型与 RefSpatial-Bench [122]、ShareRobot-Affordance [43]、ShareRobot-Trajectory [43]、Cornell-Grasp [19] 和 VMRD-Grasp [115] 等公开基准测试中的最先进方法进行对比。

4 通用视觉理解

进一步评估 RynnBrain 的通用视觉理解能力,以考察其整体通用性和泛化能力。为了涵盖静态图像和动态视频,在多项通用视觉问答(VQA)数据集上对 RynnBrain 进行基准测试,包括基于图像的 AI2D [46]、ChartQA [65]、DocVQA [66]、RealWorldQA [102] 和 InfoVQA [67],以及基于视频的 MVBench [53]、EgoSchema [63] 和 VideoMME [32]。

5 物理基础推理

为了严格评估模型的物理基础推理能力,对 RynnBrain-CoP-8B 与多种当前最优的多模态基线模型进行对比分析。比较对象涵盖 InternVL3.5-8B [97]、MiMo-Embodied-7B [37] 和 Qwen3-VL [6](8B 和 30B 版本)等领先的开源模型,以及 GPT-5.2 和 Gemini-3-Pro 等强大的闭源模型。评估侧重于三项核心具身任务——affordance预测、区域预测(area prediction)和轨迹预测(trajectory prediction),这些任务要求模型将复杂的空间意图映射为精确的坐标。

6 视觉-语言导航

基准与指标。在两个公开的 VLN-CE 基准 [47]——R2R-CE [4] 和 RxR-CE [50]——上评估微调后的模型;这些基准利用 Habitat 仿真器,在逼真的 Matterport3D 场景中模拟连续导航过程。为了评估模型对新环境的泛化能力,所有实验均在“未见环境”(unseen)的验证集划分上进行。遵循标准评估规范,报告以下指标的性能:任务完成情况(成功率,SR)、路径效率(路径长度加权成功率,SPL)以及路径保真度(归一化动态时间规整,nDTW)。其中,nDTW 指标利用真实轨迹(ground-truth trajectories)来评估智体的路径与参考指令的吻合程度。此外,还纳入导航误差(NE)和 Oracle 成功率(OS)指标,以便进行全面分析。

7 规划与操作

构建一个三阶段评估体系,以严格评估基于 RynnBrain 的分层操作系统。在第一种设置中,单独评估规划逻辑:模型充当高层规划器,而配备通用操作接口(UMI)[18] 的人类操作员则作为完全可靠的底层控制器。在第二种设置中,设计针对复杂多目标场景的真实机器人实验,以验证 RynnBrain-VLA 的精确操作能力。在第三种设置中,将集成系统部署在 Franka 机器人上,以评估其端到端自主性。在整个系统中,RynnBrain-Plan 负责理解场景和高层任务,并生成包含精确坐标的子任务;RynnBrain-VLA 接收子任务并控制机械臂执行相应的底层任务。

RynnBrain 与 UMI 分层评估

实验设置。设计四项长程规划任务:物体分类、桌面整理、餐具分发和餐桌清理。其中,前三项属于分布内(in-distribution)任务,而最后一项属于分布外(out-of-distribution)任务。为了评估不同复杂度下的性能,所有任务被划分为三个难度等级:简单、中等和困难。随着难度等级的提升,场景复杂度和指令复杂度也相应增加。在微调阶段,针对每项分布内任务收集 100 个专家演示样本。将该方法(RynnBrain-Plan)与两种最先进的基线模型进行对比:Gemini-3 Pro 和 Qwen3-VL 30B。为降低随机性影响,每项“任务-模型”组合的评估均重复进行五次,并报告平均结果。遵循 [87] 中确立的协议,采用“任务进度”(定义为回合结束时成功完成的子任务百分比)作为主要评估指标。为确保评估的可靠性与一致性,所有评估工作均由经过培训的人工标注员完成。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐