【arXiv 2025】LIBERO-PRO:超越记忆化的鲁棒公平 VLA 评测基准|从VLA鲁棒评测视角
摘要
本文解读 arXiv 2025 论文《LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization》。该论文提出LIBERO-PRO 即插即用评测基准,通过融合物体属性、初始状态、指令、环境四维正交扰动与任务级组合扰动,系统检验 VLA 模型是否真正理解任务,其特别之处在于扰动任务保持逻辑自洽且物理可执行。实验表明标准 LIBERO 上成功率超过 90% 的 OpenVLA / Pi0 / Pi0.5,在位置与任务扰动下崩塌到 0.0%,证明高分主要源于训练布局记忆而非真实理解,为具身智能 VLA 评测提供了更公平、可复现的标准。
视频讲解:点击观看 B 站视频
论文基本信息
| 项目 | 内容 |
|---|---|
| 标题(英文) | LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization |
| 标题(中文) | 超越记忆化的鲁棒公平 VLA 评测基准 |
| 作者 | Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun |
| 机构 | 华中科技大学 · 清华大学 · 武汉理工大学 · 里海大学 |
| 会议 | arXiv 2025 |
| arXiv | arXiv:2510.03827 |
| 项目网站 | GitHub: Zxy-MLlab/LIBERO-PRO(扰动数据集见 Hugging Face: zhouxueyang/LIBERO-Pro) |
背景与动机
LIBERO(NeurIPS 2023)已经成为 VLA 评测的事实标准——几乎所有近期 VLA 论文(OpenVLA、Pi0、Pi0.5、UniVLA 等)都在其上报告成绩,而 RLBench、CALVIN、RoboCasa、BridgeData 等机器人操作基准共同构成了这一领域的基础设施。但 LIBERO-PRO 的作者发现,LIBERO 评测协议存在一个根本缺陷:测试任务与训练任务几乎完全相同,只差肉眼不可见的微小扰动——评测只能反映模型在训练邻域内的插值能力,无法衡量分布外泛化,这让"记忆"冒充了"理解"。
从形式化角度看,LIBERO 的测试任务 $\mathcal{T}'$ 与训练任务 $\mathcal{T}$ 仅差初始物体位姿的微小扰动($R_0' \approx R_0$),而指令、环境、物体与成功判据全部相同($l'=l,\ \mathcal{W}'=\mathcal{W},\ \mathcal{O}'=\mathcal{O},\ G'=G$)。模型学的到底是 $\pi:(o,l)\to a$ 的真理解,还是固定场景的轨迹记忆?作者给出四类实证观察:视觉幻觉——目标物体被替换或移除,模型仍"抓空气"或抓错物体;指令失效——指令换成乱码 "fdsgfdsgsd",模型执行同样的轨迹;位置脆弱——物体位移超过 0.2 单位,抓取成功率归零;缺乏组合——两个子任务各自成功,合成长指令必失败。
在相关工作层面,已有研究开始质疑 LIBERO 高分背后的泛化能力:Exploring Limits of VLA、Intention-Execution Probing、Task Reconstruction 等指出 LIBERO 成绩不可迁移;Safe-MultiTask、Adversarial VLA 等应激测试提出了更强评测,但缺少系统化的多维扰动框架。LIBERO-PRO 的差异化定位是:首个沿四正交维度加组合扰动系统化扩展 LIBERO 的即插即用基准,且扰动任务保持逻辑自洽与物理可执行。
从历史视角看(附录 D),VLA 评测走过了 2020–2022 年 RLBench / CALVIN 语言条件操作基准、2023 年 LIBERO 终身学习知识迁移基准、2024–2025 年 OpenVLA / Pi0 / Pi0.5 模型爆发(报告 LIBERO 成绩 $>$90\%),到 2025 年 LIBERO-PRO 四维扰动评测戳破记忆化泡沫的完整脉络。评测即基础设施:LIBERO-PRO 的即插即用扩展让后续 VLA 论文可直接报告其成绩;扰动评测暴露的失败模式可指导数据增广与鲁棒训练;规范效应推动社区放弃可被记忆刷分的评测协议。
图 1:五类动作解码范式的 VLA 模型:LIBERO 上 >70%,LIBERO-PRO 上大幅下滑
研究主线:从问题到结论
图 10:LIBERO-PRO 研究主线:问题 → 动机 → 设计 → 方法 → 实验 → 结论(Mermaid 流程图)
基准/方法设计
任务形式化:将任务建模为三元组 $\mathcal{T}=(l,e,G)$,其中环境 $e=(\mathcal{W},\mathcal{O},R_0)$ 由场景、物体集合与初始位姿构成;扰动算子 $\phi_k$ 生成变体 $\mathcal{T}^{(k)}=\phi_k(\mathcal{T})$。LIBERO-PRO 定义五类扰动:
- 物体属性扰动($k=O$):改变颜色 / 纹理 / 尺寸,保持语义等价;
- 初始配置扰动($k=R$):改变绝对 / 相对位置,保持物理可放置;
- 指令扰动($k=L$):语义改写保留意图,任务级改写换目标;
- 环境扰动($k=E$):改变背景 / 光照 / 纹理,不影响任务可行性;
- 任务扰动($k=T$):换目标物体 / 动作,仍属训练分布内。
组合规则:任务级扰动不参与组合(避免产生不可行任务);其余扰动类型可自由组合,构造多样化的联合分布偏移。
图 2:LIBERO-PRO 概览:五类扰动(物体 / 配置 / 指令 / 任务 / 环境)与组合规则
分类全景
图 11:LIBERO-PRO 扰动分类全景:五类扰动算子及其变体(Mermaid 结构树)
方法细节
两类约束保证扰动有效性:一是维度内邻域界——$x^{(k)}\in\mathcal{N}k(x)$ 且 $\mathrm{dist}_k(x,x^{(k)})\le\delta_k$,扰动幅度受限,任务保持逻辑自洽;二是任务级分离——$d{TV}(\mathcal{T},\mathcal{T}^{(k)})>\epsilon$,用全变差距离确保扰动真的改变行为,而非换汤不换药。强度扫描通过调节 $\delta_k$ 生成多个扰动档位,刻画策略对扰动强度的敏感性曲线。
评测基准构建:物体变化包括颜色 / 纹理 / 尺度;配置变化是保持物理有效的重摆;指令变化是改写描述;任务变化引入新物体集与新目标;环境变化改变背景与光照。一句话概括:"扰动要够得着(改变行为)但不越界(保持可执行)"——两个不等式把评测从玄学变成工程。
实验设计与结果
评测协议(附录 E):沿用 LIBERO 的每任务 50 episodes 协议,保证结果可比;模型为 OpenVLA(4 个官方 checkpoint,每个套件单独训练)、Pi0 与 Pi0.5(各 1 个官方 checkpoint)。公平性方面,仅使用官方权重,不做任何重新训练或微调;扰动生成器公开,支持单维与多维随机组合,所有扰动任务均保证逻辑自洽(语义上仍是指令所指的任务)与物理可执行(不产生不可达的初始状态),代码、数据与项目主页全部开源。
主表:四套件(libero-goal / libero-spatial / libero-10 / libero-object)平均成功率:
| 模型 | Ori(原始) | Pos(位置) | Sem(语义指令) | Task(任务级) | Env(环境) |
|---|---|---|---|---|---|
| OpenVLA | 0.97 | 0.00 | 0.97 | 0.00 | 0.68 |
| Pi0 | 0.92 | 0.00 | 0.91 | 0.00 | 0.39 |
| Pi0.5 | 0.97 | 0.21 | 0.96 | 0.01 | 0.53 |
| 结论 | ≈满分 | 崩塌 | 稳健 | 崩塌 | 分化 |
原始设定平均 $>$90\%(最高 0.99),位置扰动归零、任务扰动归零——模型根本没学会"目标在哪"和"任务是什么"。
图 3:LIBERO-PRO 主结果:四套件 × 五类扰动的成功率(黑底图)
结果分析:位置敏感性方面,位移超过 0.2 单位后 OpenVLA 与 Pi0 成功率断崖归零,Pi0.5 依赖更大模型与数据,勉强撑到 0.4 单位后同样归零;环境扰动呈现分化——OpenVLA 平均 0.68 相对稳健(但 object 套件仅 0.00),Pi0 仅 0.39,"健壮"也是选择性的;物体属性与语义指令扰动几乎不掉分(0.9+),但位置 / 任务一换就崩,这是典型的 illusory robustness(虚假鲁棒性):外观不变就背轨迹,与四类失败模式一一对应。
图 4:位置扰动敏感性曲线:位移超过 0.2 单位后成功率归零
逐任务结果(附录 B,libero-goal 摘要,Ori / Pos / Task / Env 四列):
| 任务 | 模型 | Ori | Pos | Task | Env |
|---|---|---|---|---|---|
| Open(cabinet, drawer) | OpenVLA | 0.98 | 0.00 | 0.00 | 0.96 |
| Open(cabinet, drawer) | Pi0 | 0.92 | 0.00 | 0.00 | 0.00 |
| Open(cabinet, drawer) | Pi0.5 | 0.96 | 0.00 | 0.04 | 0.92 |
| TurnOn(stove) | OpenVLA | 1.00 | 0.00 | 0.00 | 1.00 |
| TurnOn(stove) | Pi0 | 1.00 | 0.00 | 0.00 | 0.00 |
| TurnOn(stove) | Pi0.5 | 1.00 | 0.00 | 0.00 | 0.00 |
单任务满分(Ori 0.92~1.00),位置 / 任务扰动全零——每一行都是"记忆"的直接证据。
定性失败案例(附录 A / A' / F):四类系统性失败模式在量化结果之外给出了直观证据。视觉感知幻觉:目标物体被换成无关物体(沙拉酱 → 字母汤)时,模型仍按指令抓取错误物体;目标物体被移除时,模型对着原位抓空气,不做在线视觉验证。
图 5:视觉幻觉 (a):训练集内的"沙拉酱"(训练分布内物体)
图 6:视觉幻觉 (b):物体不在训练集 / 被替换时,模型仍执行抓取动作
组合性失败:子任务 1"把碗放到炉子上"成功、子任务 2"打开炉子"成功,但组合指令"把碗放到炉子上,然后打开炉子"持续失败——模型重放训练分布中的残缺轨迹,无法组装子技能。原子技能的成功不等于组合推理能力。
图 7:任务扰动:两个独立指令各自成功,组合指令失败
指令理解失效:指令替换为乱码 "fdsgfdsgsd" 时,模型照常执行原轨迹——语言输入几乎不参与决策,动作由视觉场景回忆驱动。共同根源是策略依赖场景捷径(典型布局、物体惯常位置、重复轨迹),而非观测-指令对到动作的真实映射。
图 8:指令理解:原始任务 "Pick up the salad dressing and place it in the basket"
图 9:指令理解:换成乱码 "fdsgfdsgsd",模型仍执行几乎相同的抓取轨迹
结果对比总结
图 12:LIBERO-PRO 结果对比:标准评测 >90% 的成绩在位置 / 任务扰动下崩塌(Mermaid 流程图)
关键发现
- 标准 LIBERO 大幅高估模型能力:原始设定平均成功率 $>$90\%(最高 0.99),但位置扰动与任务扰动下 OpenVLA / Pi0 全面崩塌至 0.0%,Pi0.5 也仅剩 0.21 与 0.01。
- 0.2 单位位移阈值:物体位置偏移超过 0.2 单位,OpenVLA 与 Pi0 成功率断崖归零;Pi0.5 撑到 0.4 单位后同样归零——位置敏感性曲线定量刻画了泛化极限。
- 虚假鲁棒性:物体属性与语义指令扰动几乎不掉分(0.9+),环境扰动 OpenVLA 平均 0.68、Pi0 仅 0.39(object 套件低至 0.00)——"健壮"是选择性的,外观不变就背轨迹。
- 四类失败模式与量化结果一一对应:视觉幻觉、指令失效、位置脆弱、缺乏组合性共同指向同一根源——策略依赖场景捷径而非任务理解。
- 混淆隔离设计(附录 C 的 Oral 信号分析):四维正交扰动每次只隔离一个混淆变量,配合 $>$90\% 到 0.0\% 的反直觉崩塌证据与乱码指令照常执行的反例,让"记忆 vs 理解"的贡献被干净地量化,审稿人无法质疑"你到底证明了什么"。
局限性
- 资产范围受限:扰动构建于 LIBERO 的物体与场景资产之上,视觉外观多样性(真实材质 / 光照)仍有限。
- 存量模型评测:仅评测现有官方 checkpoint,未训练"抗扰动"模型来验证基准的可学习性与上限。
- 约束参数选择:$\delta_k$ 与 $\epsilon$ 的取值依赖人工设定,缺乏自动化校准流程。
- 作者展望:呼吁社区放弃可被记忆刷分的评测协议,采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准,并发展真正分布外泛化的模型。
常见问题(FAQ)
LIBERO-PRO 和原始 LIBERO 有什么不同?
原始 LIBERO 的测试任务与训练任务几乎相同(仅初始物体位姿有微小扰动),模型可以靠记忆训练布局刷分;LIBERO-PRO 沿物体属性、初始状态、指令、环境四维施加系统扰动,并支持任务级扰动与组合扰动,评测的是真实泛化能力而非记忆。
为什么位置扰动会让模型成功率从 90% 以上跌到 0?
模型学到的是固定场景的轨迹记忆而非任务理解。物体位移超过 0.2 单位后,训练分布内的"抓取模式"失效,OpenVLA 与 Pi0 直接归零,Pi0.5 也只能撑到 0.4 单位。
物体属性和语义指令扰动为什么几乎不掉分?
这些扰动不改变物体的惯常位置与整体场景布局,模型依然可以靠视觉场景回忆(典型布局、惯常位置、重复轨迹)完成任务——这正是"表面稳健实为记忆"(illusory robustness)的证据。
LIBERO-PRO 如何保证扰动后的任务仍然可执行?
通过两类形式化约束:维度内邻域界 $\mathrm{dist}k(x,x^{(k)})\le\delta_k$ 保证扰动幅度受限、逻辑自洽;任务级分离 $d{TV}(\mathcal{T},\mathcal{T}^{(k)})>\epsilon$ 保证扰动真的改变行为。所有扰动任务均保持语义自洽与物理可执行。
新模型可以直接在 LIBERO-PRO 上报告成绩吗?
可以。LIBERO-PRO 是即插即用的扩展基准,评测协议沿用 LIBERO 的每任务 50 episodes 标准,扰动生成器与数据集全部开源,任何新 VLA 模型都能即刻对照报数,结果与原始 LIBERO 直接可比。
作者希望社区怎么做?
放弃可被记忆刷分的评测协议,采纳 LIBERO-PRO 作为更公平、可复现的 VLA 评测标准,并把扰动评测暴露的失败模式转化为数据增广与鲁棒训练的信号,发展真正分布外泛化的模型。
参考链接
- arXiv:2510.03827 — LIBERO-PRO 论文原文
- GitHub 项目主页(Zxy-MLlab/LIBERO-PRO,代码与扰动生成器)
- Hugging Face 扰动数据集(zhouxueyang/LIBERO-Pro)
- LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning(NeurIPS 2023)
- OpenVLA: An Open-Source Vision-Language-Action Model(CoRL 2024)
- Pi0: A Vision-Language-Action Flow Model for General Robot Control(arXiv 2410.24164)
- CALVIN: A Benchmark for Language-Conditioned Policy Learning(arXiv 2112.03227)
- World Model for Robot Learning survey(arXiv 2605.00080)
给大家推荐一款自用写文献综述、无虚构文献的 AI:
🌟 复旦大学 FudanNLP 团队自研 切问学术
覆盖 3.6 亿篇可溯源真实中英文文献,能自动整合文献观点生成规范综述
还能挖掘研究创新点、复现实验,配合视频教学,新手快速上手文献综述写作
🍀后记🍀
博客的关键词集中在编程、算法、机器人、人工智能、数学等等,持续高质量输出中。
🌸讨论QQ群:白拾的小屋 (750365700)
⭐B站账号:白拾的物理AI组会(活跃于知识区和动画区)
✨GitHub主页:YhbCode000(工程文件)
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)