RynnBrain 1.1:迈向能力更强、泛化性更好的具身基础模型
26年7月来自阿里达摩院和湖畔实验室的论文“RynnBrain 1.1: Towards More Capable and Generalizable Embodied Foundation Model”。
RynnBrain 1.1,是一系列涵盖 2B、9B 及 122B-A10B 规模的具身基础模型。RynnBrain 1.1 采用统一的时空与物理基础(physically grounded)框架进行训练,支持具身感知、空间推理、定位及规划功能。与 RynnBrain 1.0 相比,该系列模型引入接触点预测功能,且 2B 和 9B 版本具备原生 3D 基础能力,从而生成了与机器人操作任务更直接对齐的表征与输出。此外,还开发 RynnBrain-VLA,采用统一的跨具身动作空间及针对特定具身的掩码(masking)机制,并将其部署于 Unitree G1、Astribot-S1 及 Tianji-Wuji 等机器人平台上。RynnBrain 1.1 在具身认知、定位及 3D 基础能力方面表现卓越;其中,122B-A10B 模型在 VSI-Bench、MMSI 和 RefSpatial-Bench 评测中的表现优于所有参与对比的专有模型及开源模型。真实机器人实验表明,基于 RynnBrain 初始化的策略优于基于 Qwen 的模型及其他代表性通用 VLA 模型;同时,联合多任务与多具身训练在过程评分和任务成功率方面,均优于针对单一任务的训练方式。
如图 1 所示:RynnBrain 1.1 是一个包含 2B、9B 和 122B-A10B 三种变体以及经过后训练的 RynnBrain-VLA 的模型系列。RynnBrain 1.1 在一系列广泛的基准测试中展现出领先性能,尤其是在认知、定位、3D 基础定位(3D grounding)和接触点预测方面。RynnBrain-VLA 展现出巨大潜力,能够在一个统一的动作空间内实现跨多种具身形态(embodiments)的动作预测。

1 模型架构
RynnBrain 架构的概述如图 2 所示。

RynnBrain 1.1 采用遵循 Qwen3.5 [53] 设计原则的仅解码器视觉语言架构。它由视觉编码器、视觉语言投影器和从 Qwen3.5 变体初始化的大语言模型 (LLM) 主干组成。此版构建三个模型规模,即 RynnBrain 1.1-2B、RynnBrain 1.1-9B 和 RynnBrain 1.1-122B-A10B。所有模型共享相同的整体架构和训练公式,从而能够对跨模型大小的体现缩放进行系统研究。还采用 DeepStack [45] 和 Interleaved MRoPE [30] 来更好地集成多模态信息并支持图像、视频和具体观察的长上下文时空建模。
2 训练基础设施
如 RynnBrain [20] 中所述,训练管道是为具有高度异构序列长度的大规模体现多模态数据而设计的。遵循相同的基础设施设计,包括在线序列长度感知负载平衡、每个样本损失减少、使用 ZeRO 和梯度检查点进行内存高效训练,以及通过专家并行性和高效令牌调度优化 MoE 执行。这些组件能够对混合图像、视频、文本和空间基础数据进行训练,同时减轻长尾序列长度分布引起的落后效应。
对于 RynnBrain 1.1,将此基础架构扩展到基于 Qwen3.5 的新模型系列,涵盖 2B、9B 和 122B 比例。跨模型大小使用相同的训练管道,以确保下游性能的差异主要反映模型扩展和数据更新,而不是基础设施的变化。对于 122B-A10B 模型,采用稀疏 MoE 训练,具有专家并行性和通信高效的token调度,遵循 RynnBrain [20] 中建立的基础设施原则。
与 RynnBrain [20] 类似,具身预训练框架建立在两个关键原则之上:(1) 时空记忆,以及 (2) 物理世界接地(grounding)。时空记忆使模型能够整合来自过去视觉观测的信息,包括物体、位置、事件和运动动态。物理世界接地则促使模型通过显式的空间输出(如物体、区域、可供性/affordances 和轨迹)来表达其部分理解,而不是仅仅依赖不受约束的语言生成。RynnBrain 1.1 在两个方面对该框架进行改进。首先,将相同的时空具身预训练范式应用于三种模型规模(2B、9B 和 122B/10B),从而能够考察具身感知、推理、定位和规划能力如何随模型容量的变化而演变。其次,作为迈向原生 3D 接地的初步尝试,在 RynnBrain 1.1-2B 和 RynnBrain 1.1-9B 的预训练数据混合中加入大规模 3D 接地数据,能够研究显式 3D 监督对不同模型规模下物理空间理解的贡献。
1 训练方案
预训练方案将时序视觉建模与显式空间预测统一在一个自回归框架内。多模态观测首先被编码为统一的 token 序列,而语言响应和接地空间目标则通过同一个预测接口生成。这种设计赋予 RynnBrain 时空记忆和物理接地表征能力,且无需引入针对特定任务的独立解码器。
统一的时空表征。视觉观测被表示为一个有序的帧序列 V = {I_t}。静态图像对应 T=1 的特殊情况,而视频则包含 T>1 的多个时序帧。对于视频输入,在时间维度上均匀采样帧,并将每一帧编码为视觉 token。随后,时间位置信息被附加到生成的 token 上,使模型能够区分帧的顺序并关联跨时间的观测。通过将图像和视频转化为相同的序列形式,RynnBrain 1.1 能够利用共享架构对物体持久性、运动演变以及长程视觉依赖关系进行建模。物理具身(Physically Grounded)输出空间。物理具身特性被直接整合进模型的生成词表中。除了自然语言token外,输出序列还可包含边框 B、点 P 和轨迹航点 T 的离散化表示。连续图像坐标首先被映射为 [0, 1000] 范围内的整数,随后像文本token一样进行自回归预测。因此,语义推理与空间定位是联合学习的,而非由独立的预测头分别处理。在主要的模型规模扩展(scaling)实验中,2B、9B 和 122B-A10B 模型均采用这一共享的输出规范;它们之间的差异主要源于模型容量及各自对应的训练数据组合。
此外,在 RynnBrain 1.1-2B 和 RynnBrain 1.1-9B 的预训练中引入显式 3D 建模任务,以探索原生 3D 具身能力。这些模型沿用 RynnBrain 1.1 系列其他成员的指令遵循与自回归训练范式,同时将监督信号从图像平面层面的具身定位扩展到了物理空间层面的理解。
具体而言,模型接收自然语言指令和相机内参作为输入,并经训练直接预测在相机坐标系下参数化的 3D 边框——包括中心位置 (cx, cy, cz)、框体尺寸 (w, l, h) 以及朝向 (pitch, yaw, roll),所有数值均采用物理单位(米和弧度)。这种 9 维输出格式沿袭 Seed-VL [58] 和 Qwen3-VL [4] 等先前工作的设计,这些工作同样采用紧凑的数值参数集来实现空间具身预测。为了保持统一的自回归框架,将所有连续 3D 量离散化为固定范围内的整数token,这与对 2D 空间信息的token化处理方式类似。这种设计使模型能够基于单张图像进行物理具身推理:它不仅能推断像素平面上的物体类别与位置,还能推断物体在现实 3D 空间中的具体位置与朝向,从而直接架起了视觉感知与下游机器人或导航任务之间的桥梁。
优化。所有 RynnBrain 1.1 变体均采用因果自回归目标进行端到端优化,该目标应用于包含语言和空间 Token 的序列。给定视觉输入 V 和目标序列 y = {y_i},模型通过最小化负对数似然(negative log-likelihood)来进行优化。
2 预训练数据
RynnBrain 1.1 沿用 RynnBrain [20] 中以能力为导向的数据组织方式。将预训练混合数据组织为以下几类:通用多模态数据、认知数据、时空定位数据、3D 基础(grounded)数据、面向机器人的感知数据以及规划数据。对于 RynnBrain 1.0 中已有的数据类型,继续采用相同的指令遵循格式和数据处理协议。具体而言,视觉输入以图像或视频形式呈现,模型输出则转换为文本与空间tokens的混合序列,这些tokens涵盖了边框、点、轨迹以及与抓取相关的标注。
通用 MLLM 数据。为了保持广泛的多模态理解能力,继续使用涵盖图像理解、视频理解、视觉问答、时序推理及指令遵循等任务的通用图像-视频-文本语料库。该混合数据包含多种常用的 MLLM 数据集,例如 LLaVA-OV-SI [37]、LLaVA-Video [78]、ShareGPT-4o-video [13]、VideoGPT-plus [43]、FineVideo [24]、CinePile [56]、ActivityNet [8]、YouCook2 [81] 和 LLaVA-SFT [40]。在 RynnBrain 1.1 中,进一步纳入自建的 RynnBrain-Thinking 数据。RynnBrain-Thinking 数据被包含在通用混合数据中,旨在使模型更好地与 Qwen3.5-Thinking 的风格对齐。所有数据在进行预训练混合之前,均被转换为统一的指令遵循格式。
多维认知数据。针对具身认知,RynnBrain 1.1 沿用 RynnBrain [20] 的任务分类体系,涵盖物体理解、空间理解、计数、OCR(光学字符识别)以及以自我为中心的任务理解。物体理解数据包括 RynnBrain-Object、RefCOCO [72]、Google Refexp [44]、Osprey-724K [74]、DAM [39] 和 VideoRefer-700K [75],这些数据为细粒度识别与推理提供以物体为中心的监督信号。空间理解数据包括 SenseNova-SI-800K [10]、VSI-590K [69]、VLM-3R [22] 和 RynnBrain-Spatial,支持对空间关系、视角及场景结构的推理。在计数与 OCR 方面,使用 RynnBrain-Counting、Molmo2 [15]、RynnBrain-OCR 以及新加入的 Llama-Nemotron-VLM OCR 数据。针对以自我为中心的任务理解,使用 EgoRe-5M [52]、EgoTaskQA [33]、Env-QA [25]、QAEgo4D [26]、RoboVQA [59]、Robo2VLM [12] 和 ShareRobot [32]。这些数据集均按照 RynnBrain 指令格式进行了转换,从而为物体中心、空间、文本及第一人称视角的任务理解提供广泛的监督信号。
时空定位数据。RynnBrain 1.1 继承 RynnBrain 1.0 的定位表述方式,即利用归一化坐标 Token 来表示空间输出。该定位数据组合涵盖物体定位、区域定位、可供性(affordance)定位、轨迹预测以及抓取/接触相关预测。物体定位方面使用 ADE20K [79]、COCOStuff [9]、Mapillary [46]、PACO-LVIS [54]、PASCAL-Part [14]、VG [35]、RoboAfford-Object [27] 和 RynnBrain-Grounding。区域定位方面则使用 RefSpatial [80]、RoboAfford-Area [27]、Molmo2 [15]、RynnBrain-Area 以及新加入的 RoboRefer。可供性定位(Affordance localization)采用 RynnBrain-Affordance 和 RoboAfford-Affordance [27]。轨迹预测采用 RynnBrain-Trajectory、FSD [73] 以及新增的 MolmoAct。针对这些数据源,遵循 RynnBrain 的处理流程,将各类标注转换为包含边界框、点和轨迹的统一输出空间。
3D定位数据。为了探索原生3D定位能力,在2B和9B模型规模下,通过将显式3D标注混合到预训练数据中,开展了3D定位预训练。给定图像、自然语言指令和相机内参,模型需预测相机坐标系下的3D边界框。该边框由中心位置 (cx, cy, cz)、尺寸 (w, l, h) 和朝向 (pitch, yaw, roll) 参数化表示,并使用米和弧度等物理单位进行度量。
为支持大规模训练,构建一个融合大规模自动提升(lifted)标注与高保真合成数据的多源语料库。为实现广泛的类别与场景覆盖,采用WildDet3D-Data [31]——这是一个近期提出的开放词汇3D检测数据集,它通过多模型候选生成与筛选流程,将COCO、LVIS、Objects365和V3Det中的2D标注提升为3D标注。使用该数据集经额外筛选后的两个子集:Essential(包含102,979张图像、374K条经人工核实的标注——剔除了几何上不合理的候选框及小物体,涵盖12,064个类别)和Synthetic(包含896,004张图像、888K条自动筛选的标注,涵盖11,896个类别——筛选过程利用微调后的Molmo2模型,基于六项感知标准进行评分,保留阈值设为>10)。这些数据提供了前所未有的类别多样性,但也继承了单目提升过程中产生的残留噪声。
针对每一条3D标注,利用Qwen-VL模型,基于相应的2D边框和类别标签生成开放式指代查询(referring query);该查询融合空间描述(如“左”、“右”、“前”、“后”等相对位置)与属性修饰语(如颜色、尺寸或材质特征),旨在使指代表达更具区分度与精确度,从而更好地支持定位任务。为了辅以物理上精确的监督,额外引入FoundationPose [67]。这是一个基于 Google Scanned Objects 子集、在受控相机轨迹下生成的合成数据集,包含 184.9 万张图像及无噪声 3D 边框(直接根据物体到相机的真实变换矩阵计算得出);此外,每个物体资产都通过 Qwen-VL 赋予自然语言类别标签,从而与现实世界的语义建立联系。尽管其类别覆盖范围仅限于 928 个实例,但其具备的度量级尺度精度和无深度歧义的几何特性,为深度与朝向预测提供强有力的正则化约束;当与多样化但噪声较大的 WildDet3D 标注混合使用时,它能引导模型学习正确的相机到世界坐标系投影归纳偏置。
接触点数据。RynnBrain 1.0 使用带朝向矩形的四个顶点来表示平面抓取。这种类似检测器(detector-style)的表示方式与通用具身模型中的动作落地(action grounding)并不契合。目标物体通常对应一组功能上有效的抓取方式,而非唯一的矩形。此外,与物体边框不同,抓取矩形在图像空间中没有标准的尺寸定义:其宽、高、长宽比及边界位置均取决于夹爪的几何形状和特定数据集的标注惯例。因此,基于单一参考矩形计算 IoU 可能会惩罚功能上等效的抓取方式,且该指标未必与执行成功率相关。这种四顶点表示法还在自回归生成过程中引入了冗余的尺寸变量和几何一致性约束。鉴于此,RynnBrain 1.1 采用一种紧凑的、以接触点为中心的表示方式(a = (p, θ)),其中 p = (x, y) 表示标注抓取配置的中心点,θ 表示连接夹爪手指的连线在平面内的角度。坐标被归一化至 [0, 1000] 范围,每个目标被序列化为 <grasp pose> (x, y), θ </grasp pose> 的形式。这种表示方式剔除了依赖于标注习惯和具体具身形态的矩形尺寸参数,同时保留了与动作相关的空间锚点和朝向信息。
源数据中很大一部分由仿真环境原生的多维抓取标注构成,而非可直接使用的图文对。因此,开发一套基于视角的渲染与投影流水线,将这些标注转换为可靠的 2D 监督信号。针对每种“物体-抓取”配置,选择满足多项可观测性约束的相机位姿:目标物体必须完全位于图像范围内,占据适宜的图像尺度,且避免严重的截断或遮挡;同时,投影后的抓取中心与方向均须可见且在空间上可区分。若视角导致物体过近、过远、被截断或视觉上存在歧义,或者抓取配置不可观测,则该视角会被剔除。保留的视角被渲染为 RGB 图像,随后将多维抓取标注投影至统一的 ((p,θ)) 表示形式。这一步骤至关重要,因为不受约束的相机采样可能会生成几何上有效、但无法仅凭渲染图像推断出的标注信息。
经过渲染、投影和筛选后,所得数据集包含来自 Grasp-Anything [66]、Jacquard V2 [38]、GraspFactory [61]、GraspNet-1B [23] 和 GraspClutter6D [3] 的 260 万个训练样本。将 ((p,θ)) 视为一种动作落地(action-grounding)接口,而非完整的、可直接执行的抓取位姿;深度、接近方向、夹爪开度、碰撞约束以及机器人运动学参数均由下游的操作策略(manipulation policy)进行解析与确定。
物理-觉察规划数据。在操作规划方面,RynnBrain 1.1 沿用 RynnBrain [20] 的结构化规划格式,即将高层任务指令与涉及物体、区域及affordances的落地子任务描述进行配对。该规划数据集合涵盖 AgibotWorld [18]、Open X-Embodiment [16]、RynnBrain-Planning 以及新增的 Galaxea-G0。对于现有的落地规划数据,采用与 RynnBrain 1.0 相同的标注格式和转换协议。针对 Galaxea-G0,其原始标注仅包含子任务层级的标签,而缺乏明确的高层任务指令;因此,利用 Gemini 3.1 Pro,结合标注 ID 与子任务序列,构建相应的全局任务描述。随后,这些数据被转换为与其他规划数据集合一致的落地规划格式。
1 模型架构
如图3所示,RynnBrain-1.1 中 RynnBrain-VLA 的模型架构在很大程度上沿用RynnBrain-1.0 [20] 的设计:VLM 主干网络本身充当单流扩散 Transformer(single-stream diffusion transformer),在每一层中处理视觉、语言与动作之间的密集交互。该模型采用流匹配(flow matching)框架,在每一步预测一个动作块(action chunk)[5]。为了保留 VLM 固有的指令遵循能力,利用其原生的对话格式来组织输入:

参考 π0 [5] 的做法,将动作置于序列末尾,以便在推理阶段启用 KV 缓存。
2 统一的跨具身(Cross-Embodiment)动作空间
如上图 3 所示,RynnBrain-VLA 在一个共享的高维动作空间内表示异构机器人具身(embodiments)的动作。在训练前,受 [41] 启发,将统一动作向量划分为语义对齐的组,分别对应不同的身体部位和控制模式,包括左右臂、平行夹爪、灵巧手、躯干及头部控制。每个具身仅激活该机器人物理上具备的动作组,而其余维度则通过针对该具身的掩码(mask)进行屏蔽。
动作损失仅在激活的维度上计算。对于 Unitree G1 人形机器人,该策略在统一动作空间内激活“手部(Hand)”组中的 14 个维度(总计 40 维)。这 14 个维度对应 G1 的三指灵巧手,每只手占 7 维。此外,该策略还预测一组独立的 64 维 SONIC [42] 潜在运动 Token(latent motion tokens),这些 Token 不属于统一动作空间。14 维的手部预测结果与 64 维的 SONIC Token 拼接成 78 维的表征,随后输入 SONIC 全身控制器,以计算 Unitree G1 的目标关节位置。对于 Tianji-Wuji,该策略激活“臂关节(Arm-Joint)”组(14 维,每臂 7 维)和“手部(Hand)”组(40 维,每手 20 维),共计 54 个激活的动作维度。Astribot 激活“臂关节”(14 维,双臂)、“夹爪”(2 维)、“头部”(3 维)和“躯干”(4 维),同时屏蔽灵巧手关节。
这种设计使得来自不同机器人的轨迹可以在同一个训练批次中混合,并由单一 VLA 策略进行优化。共享的动作组件(如左右臂关节运动)接收来自多个具身的监督信号,而特定于具身的组件则仅由相应的数据进行更新。因此,与具体机器人形态无关的操作特征——包括面向目标的机械臂运动、抓取、双臂协同以及任务级交互模式——可以在不同形态的机器人之间共享,而无需显式对齐它们异构的底层动作空间。这种统一的动作空间不仅充当了通用的输出接口,还在保留针对特定形态的控制能力的同时,提供了一种跨形态知识共享的机制。
3 跨形态与跨驱动程序(cross-driver)部署
在现实世界中进行部署时,需要一个单一的策略接口来驱动配置和底层控制器迥异的机器人。为此,设计一个跨形态、跨驱动程序的框架,将 VLA 策略与特定形态的执行过程解耦,从而使同一 RynnBrain-VLA 方案能够适配异构机器人。该框架包含三个组件:
• 模型层(Model layer)。运行 VLA 策略,在标准动作空间内生成包含 32 个步骤的动作块(action chunk)。
• 控制层(Control layer)。包含两个独立循环:低频循环(30 Hz)负责协调推理时序、用户界面及动作源切换;高频循环(200 Hz)负责将模型的动作块插值到目标控制频率,并向机器人发送指令。这两个循环通过共享内存进行通信。
• 形态层(Embodiment layer)。将标准格式的动作(涉及左/右臂、夹爪、手部、躯干)分发给相应的机器人执行器,并将机器人的当前状态格式化后反馈给模型层。来自多个摄像头的图像被打包成一个字典,其键名与训练期间使用的命名规范相匹配。
这种设计允许通过仅实现形态层来添加新的机器人形态,而无需修改模型层或控制层。在三种异构形态上实例化该框架——Unitree G1 人形机器人、Astribot-S1 双臂操作机器人以及天机-无极(Tianji-Wuji)灵巧手系统——涵盖不同的动作空间、自由度和末端执行器。
4 实时分块(RTC)
采用实时分块(RTC)技术 [7]。该模型预测一个包含32个步骤的动作片段(action chunk),但并不等待整个片段执行完毕:在当前片段仍在运行的同时,每隔5个步骤就会触发一次新的推理。随后,利用前一个片段中尚未执行的部分来指导新片段的去噪过程,具体遵循 Black [7] 提出的动作引导公式,并设定引导强度β = 10.0。前一个片段中的每个步骤都被赋予一个引导权重,该权重反映了该步骤是否会在新片段就绪前被执行:(i) 初始的5个步骤以及推理期间消耗的步骤(估算为过去十次推理耗时的滑动平均值)权重设为1,因为它们肯定会在新片段就绪前执行;(ii) 一个权重从1平滑降至0的过渡区域;以及 (iii) 片段的尾部,其权重设为0,且不强制执行一致性约束。
5 微调设置
针对上述三种目标具身形态(embodiments)收集遥操作演示数据,涵盖涉及不同物体及交互需求的各类“抓取-放置”与操作任务。每条演示数据均包含同步的视觉观测、机器人状态和动作轨迹,以及指定目标物体或放置位置的任务指令。
为了对基于 Qwen 的 VLA 与 RynnBrain-VLA 进行对照实验,采用相同的演示数据、VLA 后训练流程及优化设置。两种策略均进行 60,000 步微调,学习率设为 2 × 10⁻⁵,批次大小(batch size)为 32。所有输入图像均按比例缩放,使短边长度达到 384 像素。这种设置旨在减少由下游训练环节引入的差异,从而能够考察基础模型的选择如何影响最终的真实机器人策略。微调后的策略进行定量评估。
将评估工作分为若干部分。首先,在三种模型规模下,针对具身认知和定位基准对基础模型进行评估。在 2B 规模下,将 RynnBrain 1.1 与 RynnBrain 1.0、Cosmos 3-Edge [49]、SenseNova-SI-1.1-InternVL3-2B [11]、Cosmos-Reason2-2B [2] 以及 Qwen3.5-2B [53] 进行比较。在 4B–9B 规模下,将与 RynnBrain 1.0、Cosmos 3-Nano [49]、RoboBrain-2.5-4B [62]、Thinker-4B [51]、Molmo2-ER-5B [15]、Pelican-VL-7B [77]、MiMo-Embodied-7B [28]、Cosmos-Reason2-8B [2]、SenseNova-SI1.5-8B [11] 和 Qwen3.5 [53] 进行对比。在最大规模下,将与 Cosmos 3-Super、RoboBrain 2.0-32B、Cosmos-Reason2-32B、Pelican-VL-72B [77]、Qwen3.5-122B-A10B [53]、Gemini 3 Pro [63]、GPT 5.4 [50]、Claude Sonnet 4.6 [1]、Gemini Robotics-ER 1.5 [64] 以及 HY-Embodied 0.5 [65] 进行比较。随后,分析其相对于相应 Qwen3.5 模型的扩展性能,评估原生 3D 接地(grounding)与接触点预测能力,最后通过针对三种不同具身形态的受控真实机器人评估,对 RynnBrain-VLA 进行考察。
1 具身认知能力
在涵盖视频空间智能、多视角推理、具身问答、面向机器人的空间理解以及以物体为中心的认知等多种具身认知基准上,对 RynnBrain 1.1 进行评估。评估涵盖 VSI-Bench [68]、MMSI [70]、ERQA [64]、RoboSpatial-VQA [60]、MindCube [71]、EmbSpatial [21]、RynnBrain-Object 以及 RynnBrain-Spatial。
2 具身定位能力
在六项空间定位(spatial grounding)任务上评估具身定位能力:RefSpatial-Bench [80]、RoboSpatial-Pointing [60]、RynnBrain-Grounding、RynnBrain-Area、RynnBrain-Affordance 和 RynnBrain-Trajectory。这些基准测试涵盖语言引导的空间指代、物体与区域定位、affordance定位以及轨迹预测。
3 规模化分析
RynnBrain 1.1 的一项核心贡献在于研究在统一的训练方案下,具身能力如何随模型规模的扩大而演变。将 RynnBrain 1.1(包含 2B、9B 和 122B-A10B 版本)与模型规模相当的原始 Qwen3.5 基线模型进行对比,并将各项基准测试归纳为三大类:通用具身认知(视觉识别、空间理解及以物体为中心的推理)、高强度推理认知(多视角空间推理及基于视频的时间推断)以及具身定位(语言引导的空间定位及轨迹预测)。
4 3D定位(3D Grounding)
在 2B 和 9B 两种规模下评估 RynnBrain 1.1 的原生 3D 定位能力。
5 接触点预测
评估接触点预测极具挑战性,因为目前尚无标准指标能可靠地反映预测接触点的功能有效性。若仅计算到单一标注点的像素级距离,可能会导致对同样适用于操作的其他有效接触点产生误判(即给予不当惩罚);而传统的抓取框(grasp-box)指标也不适用于这种以接触点为中心的表征方式。
6 真实机器人评估
在真实机器人上对RynnBrain-VLA进行评估,旨在回答以下三个问题:(i) RynnBrain-VLA能否在现实世界操作任务中实现稳定的性能?(ii) 更强大的具身基础模型是否能带来更优的VLA策略?以及 (iii) 针对异构机器人形态的数据进行联合训练,能否实现不同形态间的互惠?
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)