摘要

本文解读 arXiv 2025 论文《LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization》。该论文提出LIBERO-PRO 即插即用评测基准,通过融合物体属性、初始状态、指令、环境四维正交扰动任务级组合扰动,系统检验 VLA 模型是否真正理解任务,其特别之处在于扰动任务保持逻辑自洽且物理可执行。实验表明标准 LIBERO 上成功率超过 90% 的 OpenVLA / Pi0 / Pi0.5,在位置与任务扰动下崩塌到 0.0%,证明高分主要源于训练布局记忆而非真实理解,为具身智能 VLA 评测提供了更公平、可复现的标准。

视频讲解点击观看 B 站视频

论文基本信息

项目 内容
标题(英文) LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization
标题(中文) 超越记忆化的鲁棒公平 VLA 评测基准
作者 Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun
机构 华中科技大学 · 清华大学 · 武汉理工大学 · 里海大学
会议 arXiv 2025
arXiv arXiv:2510.03827
项目网站 GitHub: Zxy-MLlab/LIBERO-PRO(扰动数据集见 Hugging Face: zhouxueyang/LIBERO-Pro

背景与动机

LIBERO(NeurIPS 2023)已经成为 VLA 评测的事实标准——几乎所有近期 VLA 论文(OpenVLA、Pi0、Pi0.5、UniVLA 等)都在其上报告成绩,而 RLBench、CALVIN、RoboCasa、BridgeData 等机器人操作基准共同构成了这一领域的基础设施。但 LIBERO-PRO 的作者发现,LIBERO 评测协议存在一个根本缺陷:测试任务与训练任务几乎完全相同,只差肉眼不可见的微小扰动——评测只能反映模型在训练邻域内的插值能力,无法衡量分布外泛化,这让"记忆"冒充了"理解"。

从形式化角度看,LIBERO 的测试任务 $\mathcal{T}'$ 与训练任务 $\mathcal{T}$ 仅差初始物体位姿的微小扰动($R_0' \approx R_0$),而指令、环境、物体与成功判据全部相同($l'=l,\ \mathcal{W}'=\mathcal{W},\ \mathcal{O}'=\mathcal{O},\ G'=G$)。模型学的到底是 $\pi:(o,l)\to a$ 的真理解,还是固定场景的轨迹记忆?作者给出四类实证观察:视觉幻觉——目标物体被替换或移除,模型仍"抓空气"或抓错物体;指令失效——指令换成乱码 "fdsgfdsgsd",模型执行同样的轨迹;位置脆弱——物体位移超过 0.2 单位,抓取成功率归零;缺乏组合——两个子任务各自成功,合成长指令必失败。

在相关工作层面,已有研究开始质疑 LIBERO 高分背后的泛化能力:Exploring Limits of VLA、Intention-Execution Probing、Task Reconstruction 等指出 LIBERO 成绩不可迁移;Safe-MultiTask、Adversarial VLA 等应激测试提出了更强评测,但缺少系统化的多维扰动框架。LIBERO-PRO 的差异化定位是:首个沿四正交维度加组合扰动系统化扩展 LIBERO 的即插即用基准,且扰动任务保持逻辑自洽与物理可执行。

从历史视角看(附录 D),VLA 评测走过了 2020–2022 年 RLBench / CALVIN 语言条件操作基准、2023 年 LIBERO 终身学习知识迁移基准、2024–2025 年 OpenVLA / Pi0 / Pi0.5 模型爆发(报告 LIBERO 成绩 $>$90\%),到 2025 年 LIBERO-PRO 四维扰动评测戳破记忆化泡沫的完整脉络。评测即基础设施:LIBERO-PRO 的即插即用扩展让后续 VLA 论文可直接报告其成绩;扰动评测暴露的失败模式可指导数据增广与鲁棒训练;规范效应推动社区放弃可被记忆刷分的评测协议。

五类动作解码范式的 VLA 模型在标准 LIBERO 与 LIBERO-PRO 扰动评测上的成功率对比 图 1:五类动作解码范式的 VLA 模型:LIBERO 上 >70%,LIBERO-PRO 上大幅下滑

研究主线:从问题到结论

LIBERO-PRO 研究主线流程图:从问题到结论的六阶段脉络 图 10:LIBERO-PRO 研究主线:问题 → 动机 → 设计 → 方法 → 实验 → 结论(Mermaid 流程图)

基准/方法设计

任务形式化:将任务建模为三元组 $\mathcal{T}=(l,e,G)$,其中环境 $e=(\mathcal{W},\mathcal{O},R_0)$ 由场景、物体集合与初始位姿构成;扰动算子 $\phi_k$ 生成变体 $\mathcal{T}^{(k)}=\phi_k(\mathcal{T})$。LIBERO-PRO 定义五类扰动:

  • 物体属性扰动($k=O$):改变颜色 / 纹理 / 尺寸,保持语义等价;
  • 初始配置扰动($k=R$):改变绝对 / 相对位置,保持物理可放置;
  • 指令扰动($k=L$):语义改写保留意图,任务级改写换目标;
  • 环境扰动($k=E$):改变背景 / 光照 / 纹理,不影响任务可行性;
  • 任务扰动($k=T$):换目标物体 / 动作,仍属训练分布内。

组合规则:任务级扰动不参与组合(避免产生不可行任务);其余扰动类型可自由组合,构造多样化的联合分布偏移。

LIBERO-PRO 评测基准整体框架:五类扰动与组合规则 图 2:LIBERO-PRO 概览:五类扰动(物体 / 配置 / 指令 / 任务 / 环境)与组合规则

分类全景

LIBERO-PRO 五类扰动分类结构树:物体属性、初始配置、指令、任务与环境 图 11:LIBERO-PRO 扰动分类全景:五类扰动算子及其变体(Mermaid 结构树)

方法细节

两类约束保证扰动有效性:一是维度内邻域界——$x^{(k)}\in\mathcal{N}k(x)$ 且 $\mathrm{dist}_k(x,x^{(k)})\le\delta_k$,扰动幅度受限,任务保持逻辑自洽;二是任务级分离——$d{TV}(\mathcal{T},\mathcal{T}^{(k)})>\epsilon$,用全变差距离确保扰动真的改变行为,而非换汤不换药。强度扫描通过调节 $\delta_k$ 生成多个扰动档位,刻画策略对扰动强度的敏感性曲线

评测基准构建:物体变化包括颜色 / 纹理 / 尺度;配置变化是保持物理有效的重摆;指令变化是改写描述;任务变化引入新物体集与新目标;环境变化改变背景与光照。一句话概括:"扰动要够得着(改变行为)但不越界(保持可执行)"——两个不等式把评测从玄学变成工程。

实验设计与结果

评测协议(附录 E):沿用 LIBERO 的每任务 50 episodes 协议,保证结果可比;模型为 OpenVLA(4 个官方 checkpoint,每个套件单独训练)、Pi0Pi0.5(各 1 个官方 checkpoint)。公平性方面,仅使用官方权重,不做任何重新训练或微调;扰动生成器公开,支持单维与多维随机组合,所有扰动任务均保证逻辑自洽(语义上仍是指令所指的任务)与物理可执行(不产生不可达的初始状态),代码、数据与项目主页全部开源。

主表:四套件(libero-goal / libero-spatial / libero-10 / libero-object)平均成功率

模型 Ori(原始) Pos(位置) Sem(语义指令) Task(任务级) Env(环境)
OpenVLA 0.97 0.00 0.97 0.00 0.68
Pi0 0.92 0.00 0.91 0.00 0.39
Pi0.5 0.97 0.21 0.96 0.01 0.53
结论 ≈满分 崩塌 稳健 崩塌 分化

原始设定平均 $>$90\%(最高 0.99),位置扰动归零、任务扰动归零——模型根本没学会"目标在哪"和"任务是什么"。

LIBERO-PRO 主结果:四套件乘以五类扰动的成功率热力图 图 3:LIBERO-PRO 主结果:四套件 × 五类扰动的成功率(黑底图)

结果分析:位置敏感性方面,位移超过 0.2 单位后 OpenVLA 与 Pi0 成功率断崖归零,Pi0.5 依赖更大模型与数据,勉强撑到 0.4 单位后同样归零;环境扰动呈现分化——OpenVLA 平均 0.68 相对稳健(但 object 套件仅 0.00),Pi0 仅 0.39,"健壮"也是选择性的;物体属性与语义指令扰动几乎不掉分(0.9+),但位置 / 任务一换就崩,这是典型的 illusory robustness(虚假鲁棒性):外观不变就背轨迹,与四类失败模式一一对应。

位置扰动敏感性曲线:物体位移超过 0.2 单位后成功率归零 图 4:位置扰动敏感性曲线:位移超过 0.2 单位后成功率归零

逐任务结果(附录 B,libero-goal 摘要,Ori / Pos / Task / Env 四列):

任务 模型 Ori Pos Task Env
Open(cabinet, drawer) OpenVLA 0.98 0.00 0.00 0.96
Open(cabinet, drawer) Pi0 0.92 0.00 0.00 0.00
Open(cabinet, drawer) Pi0.5 0.96 0.00 0.04 0.92
TurnOn(stove) OpenVLA 1.00 0.00 0.00 1.00
TurnOn(stove) Pi0 1.00 0.00 0.00 0.00
TurnOn(stove) Pi0.5 1.00 0.00 0.00 0.00

单任务满分(Ori 0.92~1.00),位置 / 任务扰动全零——每一行都是"记忆"的直接证据。

定性失败案例(附录 A / A' / F):四类系统性失败模式在量化结果之外给出了直观证据。视觉感知幻觉:目标物体被换成无关物体(沙拉酱 → 字母汤)时,模型仍按指令抓取错误物体;目标物体被移除时,模型对着原位抓空气,不做在线视觉验证。

视觉幻觉案例:训练分布内的目标物体(沙拉酱) 图 5:视觉幻觉 (a):训练集内的"沙拉酱"(训练分布内物体)

视觉幻觉案例:物体被替换后模型仍执行抓取动作 图 6:视觉幻觉 (b):物体不在训练集 / 被替换时,模型仍执行抓取动作

组合性失败:子任务 1"把碗放到炉子上"成功、子任务 2"打开炉子"成功,但组合指令"把碗放到炉子上,然后打开炉子"持续失败——模型重放训练分布中的残缺轨迹,无法组装子技能。原子技能的成功不等于组合推理能力

任务扰动案例:两个独立指令各自成功,组合指令失败 图 7:任务扰动:两个独立指令各自成功,组合指令失败

指令理解失效:指令替换为乱码 "fdsgfdsgsd" 时,模型照常执行原轨迹——语言输入几乎不参与决策,动作由视觉场景回忆驱动。共同根源是策略依赖场景捷径(典型布局、物体惯常位置、重复轨迹),而非观测-指令对到动作的真实映射。

指令理解案例:原始指令下的抓取轨迹 图 8:指令理解:原始任务 "Pick up the salad dressing and place it in the basket"

指令理解案例:乱码指令下模型仍执行几乎相同的轨迹 图 9:指令理解:换成乱码 "fdsgfdsgsd",模型仍执行几乎相同的抓取轨迹

结果对比总结

LIBERO-PRO 结果对比总结:不同扰动维度下模型成功率变化 图 12:LIBERO-PRO 结果对比:标准评测 >90% 的成绩在位置 / 任务扰动下崩塌(Mermaid 流程图)

关键发现

  • 标准 LIBERO 大幅高估模型能力:原始设定平均成功率 $>$90\%(最高 0.99),但位置扰动与任务扰动下 OpenVLA / Pi0 全面崩塌至 0.0%,Pi0.5 也仅剩 0.21 与 0.01。
  • 0.2 单位位移阈值:物体位置偏移超过 0.2 单位,OpenVLA 与 Pi0 成功率断崖归零;Pi0.5 撑到 0.4 单位后同样归零——位置敏感性曲线定量刻画了泛化极限。
  • 虚假鲁棒性:物体属性与语义指令扰动几乎不掉分(0.9+),环境扰动 OpenVLA 平均 0.68、Pi0 仅 0.39(object 套件低至 0.00)——"健壮"是选择性的,外观不变就背轨迹。
  • 四类失败模式与量化结果一一对应:视觉幻觉、指令失效、位置脆弱、缺乏组合性共同指向同一根源——策略依赖场景捷径而非任务理解。
  • 混淆隔离设计(附录 C 的 Oral 信号分析):四维正交扰动每次只隔离一个混淆变量,配合 $>$90\% 到 0.0\% 的反直觉崩塌证据与乱码指令照常执行的反例,让"记忆 vs 理解"的贡献被干净地量化,审稿人无法质疑"你到底证明了什么"。

局限性

  • 资产范围受限:扰动构建于 LIBERO 的物体与场景资产之上,视觉外观多样性(真实材质 / 光照)仍有限。
  • 存量模型评测:仅评测现有官方 checkpoint,未训练"抗扰动"模型来验证基准的可学习性与上限。
  • 约束参数选择:$\delta_k$ 与 $\epsilon$ 的取值依赖人工设定,缺乏自动化校准流程。
  • 作者展望:呼吁社区放弃可被记忆刷分的评测协议,采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准,并发展真正分布外泛化的模型。

常见问题(FAQ)

LIBERO-PRO 和原始 LIBERO 有什么不同?

原始 LIBERO 的测试任务与训练任务几乎相同(仅初始物体位姿有微小扰动),模型可以靠记忆训练布局刷分;LIBERO-PRO 沿物体属性、初始状态、指令、环境四维施加系统扰动,并支持任务级扰动与组合扰动,评测的是真实泛化能力而非记忆。

为什么位置扰动会让模型成功率从 90% 以上跌到 0?

模型学到的是固定场景的轨迹记忆而非任务理解。物体位移超过 0.2 单位后,训练分布内的"抓取模式"失效,OpenVLA 与 Pi0 直接归零,Pi0.5 也只能撑到 0.4 单位。

物体属性和语义指令扰动为什么几乎不掉分?

这些扰动不改变物体的惯常位置与整体场景布局,模型依然可以靠视觉场景回忆(典型布局、惯常位置、重复轨迹)完成任务——这正是"表面稳健实为记忆"(illusory robustness)的证据。

LIBERO-PRO 如何保证扰动后的任务仍然可执行?

通过两类形式化约束:维度内邻域界 $\mathrm{dist}k(x,x^{(k)})\le\delta_k$ 保证扰动幅度受限、逻辑自洽;任务级分离 $d{TV}(\mathcal{T},\mathcal{T}^{(k)})>\epsilon$ 保证扰动真的改变行为。所有扰动任务均保持语义自洽与物理可执行。

新模型可以直接在 LIBERO-PRO 上报告成绩吗?

可以。LIBERO-PRO 是即插即用的扩展基准,评测协议沿用 LIBERO 的每任务 50 episodes 标准,扰动生成器与数据集全部开源,任何新 VLA 模型都能即刻对照报数,结果与原始 LIBERO 直接可比。

作者希望社区怎么做?

放弃可被记忆刷分的评测协议,采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准,并把扰动评测暴露的失败模式转化为数据增广与鲁棒训练的信号,发展真正分布外泛化的模型。

参考链接


给大家推荐一款自用写文献综述、无虚构文献的 AI:

🌟 复旦大学 FudanNLP 团队自研 切问学术

官网:qiewenpaper.com

覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述

还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作


🍀后记🍀

博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。

🌸讨论QQ群白拾的小屋 (750365700)

⭐B站账号白拾的物理AI组会(活跃于知识区和动画区)

✨GitHub主页YhbCode000(工程文件)

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐