26年7月来自香港大学 AI MMLab、加州大学伯克利分校、清华大学、北京大学、斯坦福大学、麻省理工学院和上海交通大学等的论文“RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies”。

针对通用机器人操纵策略(Generalist Robot Manipulation Policies)在评估上存在“能力维度单一”、“仿真与真实世界评估割裂”以及“真机复现性极差”三大瓶颈,RoboDojo 提出首个仿真与真机统一(Sim-and-Real Unified)的综合评估基准。


如图 1 所示RoboDojo 概述。RoboDojo 将高效的仿真评估和可复现的真实世界测试统一起来,用于通用机器人操作,涵盖 42 个仿真任务、18 个真实世界任务、异构并行仿真、RoboDojo-RealEval、XPolicyLab 以及持续更新的排行榜。
请添加图片描述

基准规模:包含 42 个仿真任务(涵盖 5 大核心能力维度)及 18 个真实世界任务(横跨 3 种异构双臂机器人)。

技术基础设施:
基于 Isaac Sim 实现异构并行仿真(Heterogeneous Parallel Simulation),大幅提升评估吞吐量。
打造 RoboDojo-RealEval 部署平台,标准化硬件/光照/位姿复位流程,支持远程云端真机评测。
开放 XPolicyLab 统一框架,集成 30+ 种主流 Embodied AI 策略(如 π0.5​, Spatial Forcing, GR00T, OpenVLA 等),实现“一次集成,两端评测”。

榜单机制:由非营利学术组织 AI MMLab Club 及全球学术机构共管,引入隐藏场景验算与双盲评分,保障评测公信力。

核心诊断结论:当前顶尖策略在仿真端平均成功率仅 8.80%(人类专家 76.03%),在真机端仅 12.8%(人类专家 100%),揭示了机器人学在泛化、精确控制、长程规划及开放语义理解上的严峻挑战。

如图 2所示RoboDojo 任务概览。RoboDojo 包含 42 个仿真任务和 18 个真实世界任务,用于评估通用机器人操作策略。仿真任务分为五个能力维度:泛化能力、记忆能力、长时域能力、精确性和开放性,从而实现高效的面向能力的诊断。真实世界任务评估策略在具有挑战性且可重复的物理部署条件下的行为。这些任务共同涵盖了仿真和真实世界中各种不同的操作技能、空间配置和双手协调模式。

请添加图片描述

一、 核心研究背景与动机 (Motivation)

近年来,视觉-语言-动作模型(VLA)与具身大模型发展迅速,但现存评估体系存在严重缺陷:
任务简单与模式单一:多限于短时序、狭窄技能,变体仅依赖物体/背景轻微替换,缺乏对高阶能力的深度诊断。
仿真与实物割裂:仿真虽高效但无法反映真实世界的接触力学、感知噪声与执行偏差;真机评估直接但成本高昂、缺乏统一标准且极难复现。

策略工程适配繁琐:不同政策的模型结构、动作空间与接口参差不齐,难以在同一标准下公平对比。

二、 RoboDojo 基准设计 (Benchmark Design)

  1. 仿真基准 (Simulation Benchmark)

采用 ARX X5 异构双臂构型(基座间距 0.6m),涵盖 5 大互补能力维度:
请添加图片描述
能力维度任务数评估核心目标代表性任务示例泛化性 (Generalization)12强杂乱(超 25 个干扰物)、光照、背景与未见物体的抗干扰能力。stack_blocks, make_toast记忆力 (Memory)6针对非马尔可夫决策,依赖历史观测与长上下文推断。match_and_pick_from_conveyor, imitate_sorting_sequence精密度 (Precision)8毫米级空间对准、轨迹平滑度与接触稳定性。insert_tubes, insert_key长时序 (Long-Horizon)8多步骤逻辑依赖、双手协作递交(Handover)与错误恢复。classify_objects, organize_table开放性 (Open-Vocab)8测试未在训练集中直接出现的技能重组与开放语义接地。general_pickup, solve_equation

训练集支持:提供 35 个目录、3,500 条高质量双臂轨迹(20.66小时),并辅以 DLC 域随机化数据,防过拟合。
2. 真实世界基准 (Real-World Benchmark)

跨 3 种主流协作双臂机器人构型,各包含 6 个高难度物理任务(共 18 个任务),累计 1,800 条遥操作轨迹(17.91小时):
ARX X5 构型:cover_blocks, make_bread, make_food, pack_and_pour_fruit, store_in_safe, insert_tubes。
Piper 构型:stack_and_cover_blocks, fill_pen_holder, put_objects_into_basket, insert_charger, stack_bowls, stand_up_bottles。
Piper X 构型:classify_objects, disassemble_LEGO, hang_mugs, pack_objects_into_backpack, sweep_blocks, cap_pen。

三、平台技术实现 (Technical Implementation)

请添加图片描述

1. 异构并行仿真 (Heterogeneous Parallelism)

传统仿真并行多为同构复制,RoboDojo 支持在单个 GPU 向量化接口下同时运行不同任务场景、资产类别及杂乱布局。
性能表现:在 8× RTX 4090 上,异构并行无动作仿真可达 77.4 step/s(比非异构提升 1.94 倍);挂载 π0.5​ 策略推理时达 64.0 step/s。

2. RoboDojo-RealEval 标准化真机平台

解决实物评测无法复现的根本痛点:
固定物理构型:标准化铝型材框架、触控屏、固定相机(1× Head, 2× Wrist)与无影 LED 线性光照。
布局复位 (Layout Replay):通过透明叠层半透明图像指导操作员精准还原初始物理场景。
远程云端评测:用户仅需通过网络传输动作与观测信号,即可完成云端部署与自动化/人工 double-blind 双盲独立打分。

3. XPolicyLab 统一生态

开放了标准化的中间件,屏蔽各模型在底层数据格式、推理脚本与动作表达上的差异。一键连接仿真环境与真机客户端,30 余种策略无需深度改造即可实现高效对比。

如图 4 所示RoboDojo-RealEval 系统概述。RoboDojo-RealEval 提供一个标准化的物理​​平台,用于可重复的真实世界机器人操作评估,具有可控的工作空间几何形状、固定的机器人和相机安装座、稳定的照明、触摸屏评估界面,并支持三种协作式双手动机器人形态。
请添加图片描述

如图 10所示RoboDojo-RealEval 的硬件组件。该平台由以下部分组成:(a) 两台 Gemini 305 腕部摄像头;(b) 一台 Gemini 335L 头部摄像头;© 可更换的协作式双臂机器人,包括 ARX X5、Piper 和 Piper X;(d) 带有触摸屏界面的机器人和摄像头支撑结构;(e) 带有 LED 照明和遮光帘的外部框架;(f) 集成工作站;以及 (g) 组装好的评估平台。这些组件实现了传感、机器人放置、照明和工作空间布局的标准化,从而确保了可重复的真实环境评估。
请添加图片描述

四、排行榜与实验诊断分析 (Key Findings)

1. 仿真排行榜 (Simulation Leaderboard Highlights)

以下摘录排行榜中代表性策略的表现(分数/成功率 %,完整数据见原论文 Table 1):

请添加图片描述

2. 核心诊断分析与发现 (Diagnostic Insights)

发现 1:能力发展严重失衡,整体差距悬殊
当前最强策略(Hy-Embodied-0.5-VLA)仿真平均成功率仅为 8.80%,较人类(76.03%)存在巨大的断层差距。同时模型呈现出“偏科”现象,如 X-VLA 擅长精密度,Spatial Forcing 擅长泛化,但无一能实现均衡表现。

发现 2:场景随机化引发性能崩溃
在 Generalization 维度中,引入杂乱与环境随机化后,大部分策略发生性能断崖式下跌(如 Hy-Embodied 性能骤降 92.9%)。Spatial Forcing 凭 3D 空间表征对齐展现出相对较好的抗干扰能力,但绝对成功率仍低于 10%。

发现 3:长时序具备初步雏形,但复合容错差
长时序任务得分高于精密度与开放语义,说明模型具备一定的阶段目标识别能力。但由于缺乏中间错误恢复(Error Recovery)机制,步骤间微小的误差积累往往直接导致最终失败。

发现 4:精密度瓶颈源自缺乏离轨修正(Off-trajectory Correction)
例如在 insert_key 任务中,策略在未对准钥匙孔时仍强行继续执行后续插入动作,表明现有策略多为开环时序动作序列,缺乏基于状态反馈的即时修正。

发现 5:开放语义(Open-Vocab)几乎全军覆没
所有模型在未见任务重组与开放指令(Open Dimension)下的成功率普遍低于 2%,暴露了从 VLM 语义高层理解到 Low-level 具身动作地接上的严重断层。

发现 6:实物部署暴露动作抖动与安全风险
真机评测中(π0.5​ 达最高的 12.8% 成功率),部分在仿真中表现尚可的模型在真机上出现了动作震荡(Jitter)、反复无效尝试乃至危险碰撞,这凸显了真机评测在动作平滑度与安全性评估上的不可替代性。

五、结论与未来展望 (Conclusion & Value)

RoboDojo 不仅是一个扩展了任务数量的 Benchmark,更建立了一套“仿真快速诊断 → XPolicyLab 统一迭代 → RoboDojo-RealEval 严谨复现”的完整研发闭环。

学术贡献:首次厘清了通用机器人策略在 5 大维度的具体短板,为下一代 VLA 模型(强调 3D 空间表征、显式记忆架构、闭环纠错与开放语义接地)指明了演进路径。

工程价值:高质量开放了 42+18 任务体系、异构仿真加速框架以及标准化真机搭建方案,极大降低了实验室搭建具身智能评估体系的门槛。
治理机制:依托非营利性 AI MMLab Club 联合全球顶级高校共管,采用隐藏场景校验,保障了 Leaderboard 的公正性与持久生命力。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐