Embodied‑BenchForge:面向具身智能评测基准构建的闭环智能体工作流

原文网页:https://arxiv.org/html/2609.13082v1

摘要
智能体系统为自动化构建具身评测基准提供了可行路径,但现有方案大多只能覆盖局部流程,且高度依赖预定义环境与任务集合。更关键的是,多步骤构建流程会产生存在依赖关系的中间制品;中间缺陷会不经校验直接向下游传递,污染最终基准。本文提出Embodied‑BenchForge,一套智能体框架,可以将用户指定的评测意图,完整转化为可执行的具身评测基准制品。本文将基准构建形式化为闭环基准合成(Closed‑Loop Benchmark Synthesis),融合正向制品合成与反向校验修复两大流程。

  • 技能编排式制品合成:将类型化、可复用的技能组合成可执行工作流,同时维护制品依赖图,记录中间输出与相互依赖;
  • 需求引导的校验与修复:为每一类制品绑定专属需求契约;校验失败时,依托溯源信息触发局部重执行或者上游回滚。

Embodied‑BenchForge产出两套评测赛道:离线问答赛道OE‑Track包含6套异构具身基准;交互式具身赛道IE‑Track包含220个完整可执行任务。对主流多模态大模型、具身智能体开展评测,证明该基准可以有效区分观测理解能力与闭环交互执行能力。质量评估、多组消融实验验证了基准质量以及校验‑修复模块的有效性;技能复用与修复案例分析证明框架具备局部恢复、跨基准复用能力。

关键词
具身AI;评测基准自动化构建;智能体工作流;闭环校验修复;技能编排

目录

  1. 引言
  2. 相关工作
  3. Embodied‑BenchForge框架
  4. 产出基准套件
  5. 实验
  6. 结论
  7. 参考文献
  8. 附录A OE/IE双赛道闭环质量控制
  9. 附录B 资源覆盖度与跨资源适配
  10. 附录C 技能分类体系与复用统计
  11. 附录D 构建开销与效率分析
  12. 附录E 实验细节与扩展结果

1 引言

多模态大模型、视觉‑语言‑动作模型推动具身智能从单纯感知,拓展到空间推理、任务规划、闭环交互。对应的具身评测基准覆盖问答、导航、家庭机器人操作等场景。可靠评测是定位模型能力边界的关键,但基准构建工作高度依赖人工。

现有自动化基准构建方案存在两大核心痛点:

  1. 强绑定特定环境:大多只能工作在预定义模拟器、固定任务家族;具身任务会用到图像、视频、轨迹、模拟器接口,输出包含问题、参考答案、任务指令、可执行验证器。把一份评测意图转化为整套异构制品,仍需要大量人工配置。
  2. 中间缺陷向下传播:基准构建包含源数据处理、证据抽取、状态结构化、任务合成、答案推导、验证器编写等一系列存在依赖关系的操作。缺少针对每一类制品的校验,中间环节错误会流入下游;仅在最终阶段做检查会浪费大量计算资源,全部重新生成又会丢弃已经校验通过的制品。

核心方案:闭环基准合成 Closed‑Loop Benchmark Synthesis。将正向的制品合成流程,和反向的校验、定位、局部修复结合。

  • 正向:技能编排式制品合成,把构建操作封装为类型化可复用技能,依据评测意图组合成可执行工作流;维护制品依赖图,记录全部中间输出与依赖关系。
  • 反向:需求引导的校验修复,为每类制品绑定结构、语义、执行类需求契约;校验失败时依托溯源信息,执行局部修复/上游回滚,仅重建受影响下游制品,保留其余已经校验通过的制品

本文产出两套评测赛道:

  1. OE‑Track(Offline EQA 离线具身问答赛道):6套基准,覆盖家庭机器人、移动机器人、自动驾驶、机械臂、无人机、四足机器人;
  2. IE‑Track(Interactive Embodied交互式具身赛道):220个可执行交互任务,具备可恢复初始环境状态、动作接口、目标条件、终端验证器,同时保留交互轨迹,可支持轨迹问答。

评测11套开源/闭源模型,实验证明:该基准可以有效区分模型的观测理解能力闭环执行完成任务能力

本文贡献

  1. 提出Embodied‑BenchForge智能体框架,支持将用户评测意图,端到端生成异构的具身评测基准制品。
  2. 提出闭环基准合成范式:类型化技能编排合成 + 制品级需求契约 + 溯源引导局部修复/回滚。
  3. 构建OE‑Track、IE‑Track两套完整基准套件;大量实验验证制品质量、构建效率、技能复用性,揭示具身理解与闭环交互之间显著的模型能力鸿沟。
方法端到端合成可复用模块异构资源支持可执行制品流程级校验修复
AutoBencher
BenchAgents
Code2Bench
RoboGen
A2Eval
Embodied‑BenchForge

✅完整支持;△部分支持;‑不支持。△代表仅有校验,不支持选择性局部重建。

2 相关工作

在这里插入图片描述

2.1 具身基准与任务生成

经典具身基准:ALFRED、LIBERO、EmbodiedScan、EmbodiedBench、OpenEQA,覆盖场景理解、导航、机器人操作。这些基准质量高,但构建绑定特定模拟器、资源与schema。
自动化生成方向:ProcTHOR、RoboCasa生成场景;MimicGen生成机器人演示;Eureka/RoboGen用大模型生成任务与奖励函数。这类方案局限于固定模拟器内部,无法从用户高层评测意图出发,端到端产出完整基准包。

2.2 自动化基准构建与校验

Dynabench、BenchBuilder、AutoBencher依靠人机交互、声明式需求生成NLP评测数据;BenchAgents分阶段智能体工作流;BenchBench引入心理测量学IRT分析;Code2Bench面向软件任务做依赖与覆盖率校验。
具身领域A2Eval是从已有基准做子集筛选,不生成全新可执行任务
具身基准构建额外要求:观测、环境状态、证据、可行动作、目标、可执行验证器之间保持严格一致性。Embodied‑BenchForge通过可复用构建技能、制品专属需求契约、溯源引导修复解决该问题。

3 Embodied‑BenchForge框架

在这里插入图片描述

3.1 总览

整体分为两大子系统:

  1. 技能编排式制品合成(正向构建通路):接收用户评测意图与具身资源,经过意图蓝图、数据采集、证据‑状态结构化、基准合成、评测报告;
  2. 需求引导校验修复(反向闭环):制品送入校验流水线,执行需求契约检查、质量关卡;失败则故障诊断,执行局部修复/上游回滚,仅重建受影响制品;校验通过进入最终基准包。

制品通用形式化定义:
a i = ⟨ τ i , x i , m i , p i ⟩ a_{i}=\left\langle\tau_{i},x_{i},m_{i},p_{i}\right\rangle ai=τi,xi,mi,pi
τ i \tau_i τi:制品类型; x i x_i xi:内容; m i m_i mi:元数据与校验状态; p i p_i pi:构建溯源记录。
制品类型包含:意图蓝图、源记录、证据/环境状态、基准样例、评分/验证制品、评测报告。

3.2 技能编排式制品合成

技能(Skill)形式化:
s k = ⟨ I k , O k , P k , F k ⟩ s_{k}=\left\langle I_{k},O_{k},P_{k},F_{k}\right\rangle sk=Ik,Ok,Pk,Fk
I k I_k Ik输入制品类型, O k O_k Ok输出制品类型, P k P_k Pk执行前置条件, F k F_k Fk后端执行体(可以是大模型、确定程序、模拟器接口、评分编译器)。
复杂技能可以分层拆解为子技能,形成层级技能分解树。

正向构建流程步骤:

  1. 意图蓝图 Intent Blueprinting:将用户评测意图转化为能力目标、资源需求、任务规约、输出schema;
  2. 数据采集 Data Collection:三种模式:获取原始资源、适配已有基准、模拟器内采集;统一接口屏蔽底层资源差异;交互式模拟器暴露场景初始化、状态恢复、动作约束接口;
  3. 证据与状态结构化 Evidence & State Structuring
    • OE离线赛道:产出带空间、时间、来源元信息的证据记录;
    • IE交互式赛道:额外产出可恢复环境状态集合、合法动作空间、任务前置条件、目标变量
  4. 基准合成 Benchmark Synthesis:模板设计 → 代码生成(问题、指令、答案、验证器) → 度量生成(自动评分协议);
  5. 评测报告 Evaluation Reporting:汇总基准构成、模型结果、诊断统计,输出基准包。

3.3 需求引导的校验与修复

为每一类制品定义需求契约集合:
κ τ = { ϕ τ , 1 , … , ϕ τ , n } \kappa_{\tau}=\left\{\phi_{\tau,1},\dots,\phi_{\tau,n}\right\} κτ={ϕτ,1,,ϕτ,n}
ϕ τ , j \phi_{\tau,j} ϕτ,j代表一条校验谓词,分为确定性校验、执行式校验、模型辅助校验。

重要约束:模型辅助校验结果,不能覆盖确定性校验、执行校验的失败结果

完整校验‑修复流程:

  1. 输入蓝图与采集证据,生成校验过的证据池;
  2. 专家模板库做模板‑证据绑定,生成候选基准样例;
  3. 执行制品需求契约校验;
  4. 进入赛道专属质量关卡:
    • OE‑Track离线赛道:A灰批次合成 → B1无效样例过滤 → C1图像依赖盲评估;
    • IE‑Track交互式赛道:A灰批次合成 → B2任务合法性校验 → C2任务完成度测试 → D2初始状态可恢复校验;
  5. 通过关卡后,执行E典型模型评测、F IRT项目反应理论诊断;
  6. 失败分支:故障诊断定位违背的契约与溯源依赖;执行局部修复/模板重绑定/候选重合成/上游回滚;仅重建下游受影响制品,保留其余已经校验通过制品;修复完成重新走全部校验关卡。

可用修复算子集合(附录A完整定义)

  1. 局部字段修复 Local field repair
  2. 模板重新绑定 Template re‑binding
  3. 候选重生成 Candidate re‑synthesis
  4. 技能重执行 Skill re‑execution
  5. 上游回滚 Upstream rollback

4 产出基准套件

基准名称具身载体/场景数据源统计信息
OE‑Track 离线问答赛道
SHT 空间家庭任务家庭机器人ALFRED模拟器能力维度8 /问题类型6 /模板22
SHN 空间导航移动机器人Habitat模拟器能力维度7 /问题类型4 /模板13
SD 空间驾驶自动驾驶CARLA模拟器能力维度8 /问题类型6 /模板80
SA 空间机械臂机械臂LIBERO模拟器能力维度9 /问题类型8 /模板203
SU 空间无人机无人机真实航拍图像能力维度9 /问题类型7 /模板260
SQ 空间四足四足机器人TartanGround能力维度8 /问题类型8 /模板192
IE‑Track 交互式赛道
IE‑Track4类家庭场景AI2‑THOR模拟器220任务 /28场景 /2难度等级
  • OE‑Track:每一条样例包含观测证据、问题、参考答案、可执行评分协议;
  • IE‑Track:220条交互任务,具备可恢复初始状态、指令、动作空间、目标条件、终端验证器,同时保存交互轨迹,支持后续离线问答。

5 实验

5.1 实验设置

  • 构建工作流调度基座:Qwen3.6‑27B;
  • 制品合成与模型辅助校验:GPT‑5.5‑Pro;
  • 评测对象:11个API/本地大模型;
  • OE分数归一到0‑100;IE‑Track任务成功由可执行终端验证器判定;全部模型使用220个公共交互任务做严格对比。

5.2 评估指标(制品质量,LLM‑as‑Judge + 人工标注)

8个评估维度:

  1. UIA 用户意图对齐;2. FSQ格式可用性;3. QAC问答一致性;4. EGC证据接地正确性;
  2. SGC空间几何一致性;6. AFC动作‑可及性一致性;7. TSD目标信号依赖度(衡量是否依赖捷径,必须依赖视觉/空间证据);8. SSC技能挑战度。
    人工标注提供参考,Judge‑Human计算一致性;Overall为综合质量得分。

5.3 效率指标

token开销、墙钟时间、单有效样例token消耗、吞吐;OE‑Track开销归一化到10000样例规模。

5.4 构建质量与构建效率

5.4.1 制品质量(OE‑Track六个基准Judge综合得分)
基准UIAFSQQACEGCSGCAFCTSDSSCOverall
SHT90.2593.0089.5091.7586.2588.5086.0083.2588.56
SHN89.7587.2589.0091.5089.2590.7587.7587.5089.09
SD87.2588.7586.5091.7589.2589.0091.5087.7588.97
SQ88.5094.0085.7591.0086.5088.5087.0085.5088.34
SU85.5092.2586.5090.5086.7589.0088.0091.2588.72
SA92.0090.0091.2589.5094.2588.0091.0090.0090.75

全部基准Overall得分88.34‑90.75,跨异构载体质量稳定;TSD、SSC自动控制难度相对较弱,是后续优化点。

5.4.2 构建效率
  • OE‑Track构建一万样例耗时38‑160分钟,平均86分钟;
  • 20个IE交互式任务构建校验耗时1.5h;
  • OE编排平均11.45M token,单有效样例1145 token,吞吐116.3样例/分钟;
  • 真实航拍图像的SU基准证据处理开销最高;模拟器类SD吞吐最优。

5.5 基准评测效用

5.5.1 离线问答OE‑Track模型性能
模型SHTSHNSDSQSUSA均值
GPT‑5.553.8860.5744.5251.3863.7871.8957.67
Claude Opus 4.752.2557.5744.4053.0063.6768.7856.61
Gemini‑3‑Flash50.5045.4346.9651.3849.8967.6751.97
Qwen3.6‑35B52.7546.0042.4050.0054.0054.0049.86
GPT‑5.4‑Mini48.2540.0046.8542.5045.7860.0047.23
GPT‑5.4‑Nano41.0039.2943.5035.6345.6752.6742.96
Claude Sonnet 4.649.8840.8636.2139.5042.3346.4442.54
Qwen3.5‑4B37.8831.1440.0827.3832.1147.2235.97
Claude 4.5 Haiku50.2532.5725.8328.7534.6736.3334.73
Qwen3.5‑2B36.0027.8633.9622.3835.3336.8932.07
Qwen3.5‑0.8B39.8829.5732.7923.1329.2227.4430.34
人类84.9887.8082.2683.7788.9187.6385.89

人类均值85.89;最强模型GPT‑5.5仅57.67,存在巨大能力鸿沟。

5.5.2 交互式IE‑Track(220任务)

指标说明:

  • SR:任务完成成功率;
  • EQA Acc:基于轨迹的问答准确率;
  • SRL:同时完成任务+轨迹问答正确占比;
  • Avg.Steps:平均执行步数。
模型SR(%)EQA Acc.(%)SRL(%)Avg.Steps
GPT‑5.583.1873.6461.3640.13
Claude Opus 4.777.7370.0055.0039.65
Gemini‑3‑Flash72.2759.5542.7342.74
Qwen3.6‑35B46.3650.9125.4530.69
GPT‑5.4‑Nano20.4553.6412.7377.22
GPT‑5.4‑Mini16.8246.828.1885.30
Claude Sonnet 4.616.8242.277.7381.46
Claude 4.5 Haiku5.0055.911.3699.76
Qwen3.5‑4B0.0055.910.00105.54
Qwen3.5‑2B0.0046.820.0035.76
Qwen3.5‑0.8B0.0022.730.00132.59
人类97.7374.0971.8244.00

关键现象:很多小模型轨迹问答EQA还有一定准确率,但是完全无法闭环完成交互任务;证明:具身观测理解 ≠ 可执行闭环交互能力

5.6 构建机制消融实验

5.6.1 技能复用
设置使用总技能数复用技能数专属技能数复用率
模拟器OE基准平均(SHT/SHN/SD/SA)40.339.31.097.5%
SU无人机(真实图像)4134782.9%
SQ四足4136587.8%
IE‑Track交互赛道4436881.8%
全部整体统计41.037.63.491.6%

整体复用率91.6%;模拟器类基准复用率高达97.5%;仅需要少量适配专属技能,框架依靠一套公共技能主干支持异构基准构建。

5.6.2 系统级消融(六个OE基准平均)
配置LLM评判得分人工得分斯皮尔曼ρ一致性有效率 Δ H \Delta_H ΔH人工得分变化
完整系统89.0791.280.8793.7%
去掉设计技能82.1083.760.8486.2%‑7.52
去掉源接地模块74.4872.120.8173.6%‑19.16
去掉证据构建技能76.7674.080.8280.8%‑17.20
去掉校验‑修复整套模块70.5968.030.7862.4%‑23.25

结论:校验修复模块对质量影响最大,去掉后人工得分下降23.25,有效率暴跌至62.4%;源接地、证据构建同样是核心不可省略组件。

5.6.3 流程质量控制消融(SpatialUAV基准,生成1000样例)
变体Quality↑ValidRate↑TSD↑高区分度占比↑Token开销
仅最终阶段检查68.3210.4%76.814.6%1.53M
移除需求契约78.7462.2%82.540.8%2.19M
移除盲评估80.8973.5%81.637.2%1.65M
移除灰盒评估82.2175.7%88.432.6%1.57M
移除IRT诊断88.4781.1%89.036.7%2.58M
移除溯源引导修复88.7491.8%89.348.1%3.93M
完整全流程质控89.2193.7%91.249.4%2.62M

只做最终检查的方案有效率仅仅10.4%;溯源修复模块在保障高质量前提下,相比关闭修复节省大量token。

5.6.4 跨赛道能力诊断
  • OE离线赛道主要失败模式:结构化答案绑定错误、多视图不一致、时序推理错误;
  • IE交互式赛道主要失败:空间导航、重复执行、状态恢复、动作顺序错误;

OE衡量模型能不能构建出一致的具身内部表征;IE衡量这套表征能不能支撑持续、可恢复的闭环交互行为。

6 结论

本文提出Closed‑Loop Benchmark Synthesis闭环基准合成范式,并实现Embodied‑BenchForge。

  1. 框架使用类型化可复用技能编排正向构建,依托需求契约、溯源追踪,实现目标导向的局部修复与上游回滚;
  2. 产出OE‑Track(6套离线具身问答)、IE‑Track(220个可执行交互任务);
  3. 实验证明制品质量高、技能复用性强;揭示模型在具身理解能力与闭环交互执行能力之间存在明显鸿沟

未来工作:拓展更多具身场景;进一步优化自动诊断算子;拓展大规模分布式基准构建流水线。

7 参考文献

完整参考文献见原文网页 https://arxiv.org/html/2609.13082v1

附录A‑E(精简说明)

附录A:闭环质量控制完整协议,全部需求契约、质量关卡定义、IRT项目反应理论公式、5类修复算子完整逻辑、OE/IE赛道真实修复样例;
附录B:异构模拟器、真实航拍图像、轨迹资源适配细节;
附录C:完整技能分类体系、技能复用统计协议;
附录D:Token、墙钟时间分阶段开销统计;
附录E:完整复现配置、Judge提示词、人工评估协议、IRT诊断、各模型细分性能。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐