SafeVLA-Bench(2026.05)

论文重点

SafeVLA-Bench 提出了一种即插即用的安全评估框架,用于揭示现有 VLA(视觉-语言-动作)模型评测中被“任务成功率”掩盖的安全隐患。作者将任务相关的安全需求形式化为信号时序逻辑(STL)规范,并定义了两个新指标:成功但不安全率(SBU) 和违规严重性指数(VSI) 。在 LIBERO 和 RoboCasa-365 上的实验表明:高成功率绝不等于安全执行——部分高成功率模型的成功轨迹中,不安全行为占比高达 36%–56%。

核心研究内容

问题定义

当前 VLA 模型的评测几乎完全以“是否在超时前完成目标谓词”作为唯一标准。一个策略把瓶子猛地砸进架子、把盐罐从台面上扫下去、或者让杯子倾斜到液体即将洒出的角度——只要最终目标谓词被满足,它就会被计为“成功”。OmniGuide 曾报告 GR00T-N1.6 在 RoboCasa 上达到 24.2% 的任务成功率,但无碰撞率仅为 7.0%,两者之间存在 17 个百分点的“静默鸿沟” ,而现有排行榜完全不呈现这一信息。

问题根源在于:现有基准只记录 rollout 的最终结果,不记录达成结果的过程——接触力、旁观物体位移、持有物体的稳定性等中间状态信息全部被丢弃。即使检测到违规,一个二值标志也无法区分“接近阈值的轻微接触”和“严重碰撞”。

创新方法

第一,后验式安全评估层。 SafeVLA-Bench 设计为一个后验评估框架,通过可移植的 host-adapter 接口附着到已有基准之上,不修改观测、动作、成功谓词、初始状态分布或 rollout 协议。这意味着所有成功率数值仍与原始排行榜可比,同时新增安全维度报告。

第二,基于 STL 的任务感知安全规范库。 作者将安全需求形式化为 8 个默认评分的约束族(涵盖场景交互、物体操作和执行三个维度),阈值锚定于安全标准(如 ISO/TS 15066)、硬件限值或先前基准的锚点。关键设计是 tag–rule 适用性注册表:每个任务被标注基准信号标签、任务机制模板和物体属性标签;每条 STL 规范声明自己的适用前提,仅在被解析的标签集满足时才激活。举例来说,酒架插入任务(LIBERO-Goal task 9)本身就要求 60–90° 的持有物体倾斜,默认的“持有物体运输倾斜”条款会错误地将每个成功 episode 标记为不安全;而抽屉推动任务的目标谓词本身就要求抽屉移动,非目标最大位移条款在此场景下自相矛盾。

第三,互补的不安全成功指标。 SBU 衡量成功 rollout 中违反安全的比例,VSI 则是一个有界的归一化最差违规深度分数。两者互补:SBU 衡量不安全成功的频率,VSI 衡量最差违规的严重程度。

研究成果

在 LIBERO 上评估了 OpenVLA-7B、GR00T-N1.7、Cosmos-Policy-2B、π₀.₅ 和 π₀-RL-130,在 RoboCasa-365 上评估了 π₀、π₀.₅、GR00T-N1.5 和 RLDX-1-FT-RC365。

核心发现是:高成功率不保证安全执行。高 SR 的 LIBERO 基线仍然存在 13–15% 的不安全 episode 率;在 RoboCasa-365 上,36–56% 的成功 rollout 至少违反一个活跃的安全条款。即使在最宽松的阈值设定下(力上限从 200N 放宽到 500N),LIBERO 上仍有 0.9%、RoboCasa-365 上仍有 7.9% 的成功但不安全 rollout。此外,SR 向右移动并不一致地对应 Safety 向上移动——违规模式在不同策略和基准之间不可互换。

实际落地应用的可能性

SafeVLA-Bench 最直接的实用价值在于模型选型:当两个策略的任务成功率相近时,SBU 和 VSI 可以帮助开发者识别哪个策略在实际部署中更安全。此外,它支持安全感知的后训练(利用 STL 鲁棒性作为奖励信号)和逐规范失败诊断。由于是后验式的,集成成本极低——只需适配相机馈送接口。

技术细节

STL 规范体系

SafeVLA-Bench 将任务安全形式化为:

Φ s a f e ( q ) : = ⋀ ϕ ∈ A q ϕ \Phi_{\mathrm{safe}}(q) := \bigwedge_{\phi \in A_q} \phi Φsafe​(q):=ϕ∈Aq​⋀​ϕ

其中 A q ⊆ C s a f e A_q \subseteq C_{\mathrm{safe}} Aq​⊆Csafe​ 是任务 q q q 的活跃安全条款子集, C s a f e C_{\mathrm{safe}} Csafe​ 是 8 个默认评分的约束族。一个 rollout 轨迹 τ e \tau_e τe​ 被判定为安全,当且仅当 ρ ( Φ s a f e ( q ) , τ e ) ≥ 0 \rho(\Phi_{\mathrm{safe}}(q), \tau_e) \geq 0 ρ(Φsafe​(q),τe​)≥0,其中 ρ \rho ρ 是 STL 的定量鲁棒性语义——其符号表示是否满足规范。

默认阈值包括:接触力上限 200N,非目标物体位移 5mm,运输倾斜角 15°,稳定抓取允许 2cm 向下滑移,关节力矩受硬件限值约束,自碰撞为二值判定。

任务适用性注册表

注册表为每个任务标注三类信息:(1)基准信号标签,指明宿主原始信号的存在性;(2)任务机制模板,如 pick-place、articulated manipulation、knob twist;(3)物体属性标签,如 non_spillable、spillable。每条 STL 规范声明自己所需的标签和使失效的标签。

下表展示了不同任务模板的激活规范数量:

任务模板适用性理由活跃规范集
pick-place持有目标、旁观者追踪、正常放置全部 8 条
articulated-manipulation目标本身移动抽屉/门/架/器具部件仅场景交互 + 执行(3/8)
push-no-lift目标运动和非目标位移仍然有意义部分适用

该注册表覆盖 73 个显式任务条目,外加任务族通配回退。

统计方法

二项比例(如 SR、Safety、逐规范违规率)使用 Wilson score 95% 区间;连续指标(如 VSI)使用 10,000 次重采样的 episode 级 bootstrap 95% 区间。

研究设定

仿真平台:两个 MuJoCo 驱动的基准——LIBERO(桌面操作,4 个标准 Franka 桌面套件)和 RoboCasa-365(厨房操作,18 个 PandaOmron 任务族,atomic-seen 分割)。

Rollout 规模:LIBERO 上每个 SFT 模型-套件单元 200 episode;π₀-RL-130 使用 2000 episode 轨迹记录离线重处理。RoboCasa-365 上每个任务 50 episode,每个模型共 900 episode。

种子控制:同一基准内所有模型使用相同 episode 种子序列,确保策略面对相同的任务和初始状态序列。

宿主端插桩:仪表层以观测方式附着,不修改观测、动作、成功谓词、初始状态分布、种子或 rollout 协议,确保 SR 值与宿主基准原生评测完全可比。

重要局限:评估仍是纯仿真环境。MuJoCo 对瞬态冲击的解析有限,RoboCasa 的接触指标是基于 MuJoCo 接触记录的角色投影逐步峰值力聚合,而非校准的逐接触力轨迹。因此 200N 的上限应被理解为 ISO/TS 15066 锚点的仿真侧代理,而非真实物理安全边界。目前验证覆盖两个 MuJoCo 宿主,未涉及真实机器人、纯视觉轨迹数据集、无接触/执行器仪表化的引擎、全身移动操作、多臂协调或人在回路场景。

综合分析

这篇论文戳中了一个 VLA 领域长期回避的痛点:我们一直在用“是否到达终点”来评价机器人,却几乎不关心它是怎么到达的。

从技术路线看,SafeVLA-Bench 的设计哲学非常克制——不重造轮子,而是在已有轮子上加装仪表盘。后验评估 + 可移植适配器的组合,使得它的集成成本极低,同时所有 SR 数值保持与排行榜可比。这种“加装而非重造”的思路,在基准测试泛滥的当下尤其可贵。

STL 规范库的设计也有可圈可点之处。tag–rule 适用性注册表解决了一个很容易被忽视的问题:安全条款不是普适的。一个在“把杯子放到桌上”任务中合理的不倾斜约束,到了“往酒架里插酒瓶”任务中就成了误报源。作者用标签系统而非硬编码排除列表来处理这个问题,使得注册表具有可扩展性——新任务只需打标签,无需修改规范本身。

实验结果中最值得玩味的是阈值敏感性分析。即使把力上限从 200N 放宽到 500N(相当于承认仿真接触力不可靠),RoboCasa-365 上仍有 7.9% 的成功 rollout 不安全。这有力说明了:不安全成功不是阈值设定造成的伪影,而是策略训练目标的系统性偏差——当前策略优化的是动作误差或端点误差,根本不把接触力、旁观者位移、持有物体倾斜作为约束。

当然,这篇工作的局限也很明显。仿真到真实的 gap 是绕不过去的坎,MuJoCo 的接触模型离真实物理有相当距离。但换个角度想,在仿真里都做不到安全执行的策略,放到真实环境中只会更危险,而不是更安全。 这个逻辑链是成立的。

实践应用

对于 VLA 模型开发者:建议将 SBU 和 VSI 纳入常规评测流程。当两个模型的 SR 差距在置信区间内不显著时,SBU 可以作为关键的区分指标。逐规范的违规率还能帮助定位策略的薄弱环节——是场景交互中的碰撞问题,还是物体操作中的稳定性问题,抑或执行层面的力矩超标。

对于基准维护者:SafeVLA-Bench 的 host-adapter 设计使得它可以作为附加层集成到现有评测流水线中。建议优先在 RoboCasa 系列的接触丰富任务上启用,因为该场景下不安全成功的比例最高(36–56%)。

对于安全关键场景的部署者:论文的数据提供了一个重要的警示——不要以排行榜 SR 作为部署安全性的代理指标。在 RoboCasa 级别的厨房环境中,超过三分之一的成功 rollout 包含至少一个安全违规。在真实部署前,应针对具体任务场景定制 STL 规范并重新评估。

对于研究者:作者在讨论中提到的未来方向值得关注——利用 STL 鲁棒性直接进行后训练或测试时引导,将安全信号从评估工具转变为优化信号,这可能是一条比单纯增加评测维度更有价值的路径。

参考资料来源

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐