文献:One Filter to Deploy Them All: Robust Safety for Quadrupedal Navigation in Unknown Environments
作者:Albert Lin, Shuang Peng, Somil Bansal
期刊:IEEE Transactions on Robotics (TRO), Vol. 42, pp. 545–560, 2026
项目主页:https://sia-lab-git.github.io/One_Filter_to_Deploy_Them_All/
官方开源代码:https://github.com/albertklin/observation-conditioned-reachability
关键词:Hamilton-Jacobi Reachability、Safety Filter、Observation-Conditioned Reachability、Quadrupedal Navigation、Adaptive Robust Safety、LiDAR、Conformal Prediction


1. 文献核心结论

这篇工作的核心并不是重新训练一个“更安全的四足机器人运动策略”,而是在任意已有导航/运动控制器外部增加一个控制器无关的安全过滤层。作者提出 Observation-Conditioned Reachability(OCR) 框架:离线利用 Hamilton-Jacobi(HJ)可达性分析生成大量最优安全价值函数,并训练 OCR Value Network(OCR-VN) 学习从“当前相对状态 + LiDAR 观测 + 动力学扰动上界”直接预测安全价值函数及其梯度;在线部署时,再利用最近状态—动作历史估计实际动力学误差,将估计得到的扰动界输入 OCR-VN,最后使用一个最小修改 nominal twist 的二次规划安全滤波器对高层速度指令进行修正。

因此,OCR 实际解决的是两个同时存在的泛化问题:

  1. 环境泛化:未知障碍物的位置与形状在部署前不可知;
  2. 动力学泛化:地面摩擦、负载变化、低层跟踪误差、打滑和外部冲击等会改变实际运动学/动力学行为。

与只针对某一特定强化学习策略学习 safety critic 或 recovery policy 的方法相比,OCR 学习的是由 HJ 可达性分析得到的策略无关最优安全价值函数。只要 nominal controller 最终能够以高层前向速度 v v v 与偏航角速度 w w w 的形式接入,OCR 就可以作为外层安全盾进行复用。


2. 研究背景与关键科学问题

2.1 四足机器人“跑得快”和“保证安全”之间的矛盾

四足机器人目前大致存在两条技术路线:

  • 模型驱动方法:MPC、CBF、HJ Reachability 等能够显式处理约束,理论结构清晰,但对模型精度和在线计算能力要求较高;
  • 学习方法:强化学习在复杂地形、高动态运动以及 Sim2Real 上具有很强的性能,但障碍物碰撞通常只是 reward 中的一项软惩罚,不能等同于严格安全约束。

实际部署还会出现训练阶段无法完全覆盖的情况,例如:

  • 新的障碍物布局;
  • 狭窄走廊或墙角;
  • 地面摩擦系数突变;
  • 负载变化;
  • 低层 locomotion policy 的速度跟踪误差;
  • 外部踢击或推力;
  • 不同高层 planner / 不同低层 controller 的组合。

也就是说,即使某个策略在训练分布内“很安全”,换一个控制器、换一个摩擦系数或换一个场景后,其安全性并不能自动继承。

2.2 论文真正提出的问题

论文把未知环境统一记为 e ∈ E e\in\mathcal E eE。环境不仅影响障碍物和失败区域,也影响系统动力学:

x ˙ = f ( x , u ; e ) \dot x=f(x,u;e) x˙=f(x,u;e)

机器人从环境中得到观测:

o x e = h ( x ; e ) o_x^e=h(x;e) oxe=h(x;e)

碰撞等失败状态构成失败集合:

F e = { x ∈ X : l e ( x ) ≤ 0 } \mathcal F^e=\{x\in\mathcal X:l^e(x)\le 0\} Fe={xX:le(x)0}

作者希望得到一个安全策略 π s a f e \pi_{\mathrm{safe}} πsafe,使机器人始终不进入 F e \mathcal F^e Fe,同时尽可能保留已有 nominal controller 的性能。

困难在于:

  • f ( x , u ; e ) f(x,u;e) f(x,u;e) 在部署前未知;
  • F e \mathcal F^e Fe 在部署前未知;
  • nominal controller 本身也可能未知;
  • 传统 HJ Reachability 对每一种环境重新求解的在线代价过高;
  • 全维四足动力学状态维数太高,经典网格 HJ 方法无法直接求解。

因此,论文的核心科学问题可以概括为:

能否把大量离线 HJ 最优安全解压缩到一个神经网络中,并利用实时 LiDAR 与在线扰动估计,在未知障碍、未知动力学和未知控制器条件下即时恢复一个可用于安全过滤的价值函数?


3. 方法总体框架:Observation-Conditioned Reachability

OCR 分为离线训练阶段在线部署阶段。论文正式稿 Figure 2 给出了完整框架:离线阶段利用随机障碍环境和随机动力学扰动上界生成 HJ Reachability 监督数据,训练 OCR Value Network;在线阶段利用 LiDAR、状态估计和最近状态-动作历史估计当前动力学不确定性,再由 OCR-VN 恢复与当前环境相匹配的安全价值函数,最后构造自适应安全过滤器。

图1 OCR 在多种高层规划器、低层运动控制器、狭窄通道、复杂地形、动态障碍、外部扰动及对抗式人工遥控场景中的总体部署效果。对应论文 Figure 1。

Figure 1 最直接地解释了论文标题“One Filter to Deploy Them All”:作者并不是为每一种 locomotion controller 单独训练安全策略,而是让一个独立的 OCR safety layer 作用于多种层次化控制器。

图2 OCR 的离线训练与在线部署框架。左侧为随机环境生成、HJ Reachability 数据构造与 OCR-VN 训练;右侧为 LiDAR/状态估计、在线扰动估计、OCR-VN 查询与自适应安全过滤。对应论文 Figure 2。

离线训练阶段可以概括为:

( e , d ˉ r e ) → H J   R e a c h a b i l i t y → ( V ( x r ; e ) , ∇ x V ( x r ; e ) ) → V ψ ( x r , d ˉ r e , o e ) . (e,\bar d_r^e) \rightarrow \mathrm{HJ\ Reachability} \rightarrow \bigl(V(x_r;e),\nabla_x V(x_r;e)\bigr) \rightarrow V_\psi(x_r,\bar d_r^e,o^e). (e,dˉre)HJ Reachability(V(xr;e),xV(xr;e))Vψ(xr,dˉre,oe).

在线部署阶段为:

( o e , x r , state-action history ) → d ˉ ^ r e → ( V ψ , ∇ x V ψ ) → S a f e t y   Q P → ω s a f e . (o^e,x_r,\text{state-action history}) \rightarrow \hat{\bar d}_r^e \rightarrow \bigl(V_\psi,\nabla_xV_\psi\bigr) \rightarrow \mathrm{Safety\ QP} \rightarrow \omega_{\mathrm{safe}}. (oe,xr,state-action history)dˉ^re(Vψ,xVψ)Safety QPωsafe.

其中高层控制接口为:

ω = ( v , w ) , \omega=(v,w), ω=(v,w),

v v v 为前向速度, w w w 为偏航角速度。OCR 主要过滤这一高层 twist,而具体关节力矩仍由底层 locomotion policy 生成。

4. 理论基础:Hamilton-Jacobi Reachability

4.1 Backward Reachable Tube

论文先考虑带扰动的通用系统:

x ˙ = f ( x , u , d ) , d ∈ D . \dot x=f(x,u,d),\qquad d\in\mathcal D. x˙=f(x,u,d),dD.

失败集合记为 F \mathcal F F。Backward Reachable Tube(BRT)定义为:从某一初始状态出发,无论控制器采用什么输入,都存在一个允许范围内的扰动,使系统在时间区间 [ 0 , T ] [0,T] [0,T] 内不可避免地进入失败集合。

论文 Equation (1) 为:

B R T = { x ∈ X : ∀   u ( ⋅ ) ,    ∃   d ( ⋅ ) ,    ∃   τ ∈ [ 0 , T ] ,    ξ x , 0 u ( ⋅ ) , d ( ⋅ ) ( τ ) ∈ F } . \mathrm{BRT} =\left\{ x\in\mathcal X: \forall\,\mathbf u(\cdot),\; \exists\,\mathbf d(\cdot),\; \exists\,\tau\in[0,T],\; \xi_{x,0}^{\mathbf u(\cdot),\mathbf d(\cdot)}(\tau)\in\mathcal F \right\}. BRT={xX:u(),d(),τ[0,T],ξx,0u(),d()(τ)F}.

因此:

  • x ∈ B R T x\in\mathrm{BRT} xBRT:在允许的最坏扰动下,无法保证避免失败;
  • x ∉ B R T x\notin\mathrm{BRT} x/BRT:至少存在一种控制策略可以在最坏扰动下保持安全。

4.2 安全价值函数

用 Lipschitz 连续函数 l ( x ) l(x) l(x) 隐式表示失败集合:

F = { x ∈ X : l ( x ) ≤ 0 } . \mathcal F=\{x\in\mathcal X:l(x)\le0\}. F={xX:l(x)0}.

对给定控制信号和扰动信号,论文 Equation (2) 定义轨迹上的最小安全裕度:

J u ( ⋅ ) , d ( ⋅ ) ( x , t ) = min ⁡ τ ∈ [ t , T ] l  ⁣ ( ξ x , t u ( ⋅ ) , d ( ⋅ ) ( τ ) ) . J_{\mathbf u(\cdot),\mathbf d(\cdot)}(x,t) =\min_{\tau\in[t,T]} l\!\left( \xi_{x,t}^{\mathbf u(\cdot),\mathbf d(\cdot)}(\tau) \right). Ju(),d()(x,t)=τ[t,T]minl(ξx,tu(),d()(τ)).

控制器希望最大化最小安全裕度,而扰动作为对手希望最小化它,因此 Equation (3) 为:

V ( x , t ) = max ⁡ u ( ⋅ ) min ⁡ d ( ⋅ ) J u ( ⋅ ) , d ( ⋅ ) ( x , t ) . V(x,t) =\max_{\mathbf u(\cdot)} \min_{\mathbf d(\cdot)} J_{\mathbf u(\cdot),\mathbf d(\cdot)}(x,t). V(x,t)=u()maxd()minJu(),d()(x,t).

于是 BRT 可以直接写为论文 Equation (4):

B R T = { x ∈ X : V ( x , 0 ) ≤ 0 } . \mathrm{BRT} =\{x\in\mathcal X:V(x,0)\le0\}. BRT={xX:V(x,0)0}.

因此 V V V 并不是单纯的“几何距离”,而是综合考虑系统动力学、控制能力、控制约束以及最坏扰动后的动态安全裕度。

4.3 HJI-VI 与最优安全控制

论文 Equation (5) 的 Hamilton-Jacobi-Isaacs Variational Inequality 为:

min ⁡ { D t V ( x , t ) + H  ⁣ ( x , t , ∇ V ( x , t ) ) , l ( x ) − V ( x , t ) } = 0 , V ( x , T ) = l ( x ) . \begin{aligned} \min\Bigl\{ &D_tV(x,t)+H\!\left(x,t,\nabla V(x,t)\right),\\ &l(x)-V(x,t) \Bigr\}&=0,\\ V(x,T)&=l(x). \end{aligned} min{V(x,T)DtV(x,t)+H(x,t,V(x,t)),l(x)V(x,t)}=l(x).=0,

Hamiltonian(Equation (6)):

H  ⁣ ( x , t , ∇ V ( x , t ) ) = max ⁡ u ∈ U min ⁡ d ∈ D ∇ V ( x , t ) ⊤ f ( x , u , d ) . H\!\left(x,t,\nabla V(x,t)\right) =\max_{u\in\mathcal U} \min_{d\in\mathcal D} \nabla V(x,t)^\top f(x,u,d). H(x,t,V(x,t))=uUmaxdDminV(x,t)f(x,u,d).

由此得到最优安全控制(Equation (7)):

u ∗ ( x , t ) = arg max ⁡ u ∈ U min ⁡ d ∈ D ∇ V ( x , t ) ⊤ f ( x , u , d ) . u^*(x,t) =\operatorname*{arg\,max}_{u\in\mathcal U} \min_{d\in\mathcal D} \nabla V(x,t)^\top f(x,u,d). u(x,t)=uUargmaxdDminV(x,t)f(x,u,d).

直观上, ∇ V \nabla V V 给出了安全价值上升最快的局部方向;安全控制要选择能够让系统尽可能沿“更高价值”方向发展的动作,使状态远离失败集合。

5. 从 HJ Value Function 到“最小干预”安全滤波器

作者采用 smooth least-restrictive safety filter,其基本思想不是一直让安全控制器接管系统,而是:

  • 当系统明显处于 BRT 外部时,让 nominal controller 原样工作;
  • 仅在接近 BRT 边界、系统安全性可能受威胁时进行最小必要修正。

论文 Equation (8):

π s a f e ( x , t ) = { π n o m ( x , t ) , V ( x , t ) > 0 , π Q P ( x , t ) , V ( x , t ) = 0. \pi_{\mathrm{safe}}(x,t) =\begin{cases} \pi_{\mathrm{nom}}(x,t), & V(x,t)>0,\\[2mm] \pi_{\mathrm{QP}}(x,t), & V(x,t)=0. \end{cases} πsafe(x,t)= πnom(x,t),πQP(x,t),V(x,t)>0,V(x,t)=0.

其中 π Q P \pi_{\mathrm{QP}} πQP 通过论文 Equation (9) 求解:

π Q P ( x , t ) = arg min ⁡ u ∈ U    ∥ u − π n o m ( x , t ) ∥ 2 2 s.t. D t V ( x , t ) + min ⁡ d ∈ D ∇ V ( x , t ) ⊤ f ( x , u , d ) = 0. \begin{aligned} \pi_{\mathrm{QP}}(x,t) =\operatorname*{arg\,min}_{u\in\mathcal U} &\;\left\|u-\pi_{\mathrm{nom}}(x,t)\right\|_2^2\\ \text{s.t.}\quad &D_tV(x,t) + \min_{d\in\mathcal D} \nabla V(x,t)^\top f(x,u,d) =0. \end{aligned} πQP(x,t)=uUargmins.t.uπnom(x,t)22DtV(x,t)+dDminV(x,t)f(x,u,d)=0.

目标函数要求安全动作与 nominal action 尽可能接近;约束则要求系统在 BRT 边界上不会朝不可恢复的危险方向继续演化。

这一设计体现了论文的基本原则:

Safety filter 不负责替代原有任务控制器,而只在安全边界附近对其进行最小干预。

因此,OCR 与“危险时整体切换到一个独立 backup policy”的方案在结构上并不相同。

6. 为什么需要降阶动力学

6.1 全维四足动力学无法直接做网格 HJ

完整四足机器人状态通常包含基座位置与姿态、线速度与角速度、多个关节角和关节速度、接触模式及接触力等。经典 grid-based HJ Reachability 的计算量随状态维数指数增长,因此无法直接在完整四足状态空间上建立稠密 HJ 网格。

论文的关键处理是把“四足本体 + 底层 locomotion policy”整体视为高层规划器眼中的一个降阶受控系统。

6.2 3D Dubins 降阶模型

作者选用三维平面 Dubins 状态:

x r = ( p x , p y , p θ ) , x_r=(p_x,p_y,p_\theta), xr=(px,py,pθ),

其中 ( p x , p y ) (p_x,p_y) (px,py) 为平面位置, p θ p_\theta pθ 为机体航向。高层命令为:

ω = ( v , w ) . \omega=(v,w). ω=(v,w).

论文正式稿 Equation (10) 为:

p ˙ x = v cos ⁡ p θ + d p x e , p ˙ y = v sin ⁡ p θ + d p y e , p ˙ θ = w + d p θ e . \begin{aligned} \dot p_x &= v\cos p_\theta+d_{p_x}^e,\\ \dot p_y &= v\sin p_\theta+d_{p_y}^e,\\ \dot p_\theta &= w+d_{p_\theta}^e. \end{aligned} p˙xp˙yp˙θ=vcospθ+dpxe,=vsinpθ+dpye,=w+dpθe.

其中扰动项统一吸收“降阶模型”和“真实闭环四足系统”之间的差异。位置扰动满足:

∥ [ d p x e d p y e ] ∥ 2 ≤ d ˉ p x , p y e , \left\| \begin{bmatrix} d_{p_x}^e & d_{p_y}^e \end{bmatrix} \right\|_2 \le \bar d_{p_x,p_y}^e, [dpxedpye] 2dˉpx,pye,

航向扰动满足:

∣ d p θ e ∣ ≤ d ˉ p θ e . |d_{p_\theta}^e| \le \bar d_{p_\theta}^e. dpθedˉpθe.

扰动上界记为:

d ˉ r e = ( d ˉ p x , p y e ,    d ˉ p θ e ) . \bar d_r^e =\left( \bar d_{p_x,p_y}^e,\; \bar d_{p_\theta}^e \right). dˉre=(dˉpx,pye,dˉpθe).

这里的 d r e d_r^e dre 不是单指外部推力,而是一个闭环等效模型误差,可以包含:

  • 地面打滑和摩擦变化;
  • payload 变化;
  • 底层 RL/MPC 对 twist 的跟踪误差;
  • 降阶模型遗漏的高维动力学;
  • 外部踢击或冲击;
  • 一部分短时状态估计误差和执行延迟。

这正是 OCR 能适配不同 locomotion policy 的核心:安全层不需要知道低层控制器内部如何计算 12 个关节的力矩,只需要知道“高层命令 ω \omega ω 发出后,真实闭环运动与理想 Dubins 模型偏差有多大”。

7. OCR-VN 的训练数据如何产生

7.1 环境与扰动随机化

每个训练环境可写为:

e = ( F e , d ˉ r e ) . e=(\mathcal F^e,\bar d_r^e). e=(Fe,dˉre).

正式稿的数据生成参数为:

  • 障碍数量: n ∼ { 1 , … , 10 } n\sim\{1,\ldots,10\} n{1,,10}
  • 圆形障碍半径: r ∈ [ 0.1 , 1 ]   m r\in[0.1,1]\,\mathrm m r[0.1,1]m
  • 障碍位置: [ − 5 , 5 ]   m × [ − 5 , 5 ]   m [-5,5]\,\mathrm m\times[-5,5]\,\mathrm m [5,5]m×[5,5]m
  • 位置扰动上界: d ˉ p x , p y e ∈ [ 0 , 1 ]   m / s \bar d_{p_x,p_y}^e\in[0,1]\,\mathrm{m/s} dˉpx,pye[0,1]m/s
  • 航向扰动上界: d ˉ p θ e ∈ [ 0 , 2 ]   r a d / s \bar d_{p_\theta}^e\in[0,2]\,\mathrm{rad/s} dˉpθe[0,2]rad/s

训练几何体虽然主要是二维圆形障碍,但网络看到的并不是“障碍圆心和半径”,而是 LiDAR 距离观测,因此模型学习的是观测条件化的安全价值函数族

7.2 LiDAR 输入

论文使用 100 条均匀分布于 [ − π , π ] [-\pi,\pi] [π,π] 的 LiDAR beam,并将距离裁剪在:

r i ∈ [ 0.2 , 10 ]   m . r_i\in[0.2,10]\,\mathrm m. ri[0.2,10]m.

因此环境信息以机器人当前局部坐标系下的原始扫描形式进入 OCR-VN,而不是要求部署前给定全局障碍模型。

7.3 HJ Ground Truth

Ground-truth safety value 使用 hj_reachability 工具求解。正式稿配置包括:

  • HJ 网格: 100 × 100 × 60 100\times100\times60 100×100×60
  • 状态范围:
    [ − 5 , 5 ]   m × [ − 5 , 5 ]   m × [ − π , π ] [-5,5]\,\mathrm m\times[-5,5]\,\mathrm m\times[-\pi,\pi] [5,5]m×[5,5]m×[π,π]
  • 控制范围: v ∈ [ 0 , 2 ]   m / s v\in[0,2]\,\mathrm{m/s} v[0,2]m/s ∣ w ∣ ≤ 2   r a d / s |w|\le2\,\mathrm{rad/s} w2rad/s
  • 数值求解时间范围采用 2 s,使 value function 在实验设置下近似收敛;
  • 训练环境 1000 个,validation 环境 100 个;
  • 数据生成约 35 min(NVIDIA 3090Ti)。

每个 training batch:

  1. 采样 10 个训练环境;
  2. 每个环境选取 10 个不同的局部系统原点并生成对应 LiDAR;
  3. 每个原点随机查询 500 个未被障碍物遮挡的状态;
  4. 同时读取 V ( x r ; e ) V(x_r;e) V(xr;e) ∇ x V ( x r ; e ) \nabla_xV(x_r;e) xV(xr;e)

因此:

N = 10 × 10 × 500 = 50   000 N=10\times10\times500=50\,000 N=10×10×500=50000

个监督样本/批次。

8. OCR Value Network:为什么同时学习 Value 与 Gradient

OCR-VN 表示为:

V ψ ( x r , d ˉ r e , o e ) , V_\psi(x_r,\bar d_r^e,o^e), Vψ(xr,dˉre,oe),

其中输入包含:

  1. reduced state x r x_r xr
  2. disturbance bound d ˉ r e \bar d_r^e dˉre
  3. LiDAR observation o e o^e oe

网络采用 MLP:

  • 4 个 hidden layers;
  • 每层 512 neurons;
  • sinusoidal activation。

作者特别关心梯度 ∇ x V ψ \nabla_xV_\psi xVψ,因为在线 QP 的安全约束直接依赖价值函数梯度。如果只把问题做成“安全/危险二分类”,就无法获得如何修改控制量的局部方向信息。

正式稿 Equation (11) 的训练损失为:

L ( ψ ) = 1 N ∑ i = 1 N [ ∥ V ψ i ( x r , d ˉ r e , o e ) − V i ( x r ; e ) ∥ 2 2 + ∥ ∇ x V ψ i ( x r , d ˉ r e , o e ) − ∇ x V i ( x r ; e ) ∥ 2 2 ] . \mathcal L(\psi) =\frac{1}{N} \sum_{i=1}^{N} \left[ \left\| V_\psi^i(x_r,\bar d_r^e,o^e)-V^i(x_r;e) \right\|_2^2 + \left\| \nabla_xV_\psi^i(x_r,\bar d_r^e,o^e) -\nabla_xV^i(x_r;e) \right\|_2^2 \right]. L(ψ)=N1i=1N[ Vψi(xr,dˉre,oe)Vi(xr;e) 22+ xVψi(xr,dˉre,oe)xVi(xr;e) 22].

优化器为 Adam,学习率:

10 − 5 , 10^{-5}, 105,

训练约 8 h(NVIDIA 3090Ti)。

图3 验证环境中的 LiDAR、HJ ground-truth value/gradient 与 OCR-VN 预测结果。该验证环境中 d ˉ p x , p y e = 0.82   m / s \bar d_{p_x,p_y}^e=0.82\,\mathrm{m/s} dˉpx,pye=0.82m/s d ˉ p θ e = 0.56   r a d / s \bar d_{p_\theta}^e=0.56\,\mathrm{rad/s} dˉpθe=0.56rad/s。对应论文 Figure 3。

Figure 3 的重点并非仅仅是 V ψ ≈ V V_\psi\approx V VψV,而是 OCR-VN 同时较好地恢复了:

∇ x V ψ ≈ ∇ x V . \nabla_xV_\psi\approx\nabla_xV. xVψxV.

这直接决定了 safety filter 在危险边界附近应该“向哪里修正” nominal command。

9. Conformal Prediction:给神经价值函数增加统计校准

即使 OCR-VN 在 validation 环境中拟合良好,神经网络仍可能高估安全价值。最危险的误差是:

V ψ ( x r , d ˉ r e , o e ) − V ( x r ; e ) > 0 , V_\psi(x_r,\bar d_r^e,o^e)-V(x_r;e)>0, Vψ(xr,dˉre,oe)V(xr;e)>0,

因为这意味着网络认为系统比真实 HJ 解“更安全”。

作者定义 conformal score:

s i = V ψ i ( x r , d ˉ r e , o e ) − V i ( x r ; e ) . s_i =V_\psi^i(x_r,\bar d_r^e,o^e)-V^i(x_r;e). si=Vψi(xr,dˉre,oe)Vi(xr;e).

给定 violation rate ϵ \epsilon ϵ、confidence parameter β \beta β N N N 个 calibration samples,正式稿 Equation (12) 选择 outlier 数 k k k

k ∗ = arg max ⁡ k { k : ∑ i = 0 k ( N i ) ϵ i ( 1 − ϵ ) N − i ≤ β } . k^* =\operatorname*{arg\,max}_{k} \left\{ k: \sum_{i=0}^{k} \binom{N}{i} \epsilon^i(1-\epsilon)^{N-i} \le\beta \right\}. k=kargmax{k:i=0k(iN)ϵi(1ϵ)Niβ}.

然后把 calibration level δ \delta δ 取为 conformal scores 的 ( N − k ∗ ) / N (N-k^*)/N (Nk)/N 分位数。由正式稿 Equation (13),以至少 1 − β 1-\beta 1β 的置信度:

P Δ [ V ψ ( x r , d ˉ r e , o e ) − V ( x r ; e ) > δ ] ≤ ϵ . \mathbb P_{\Delta} \left[ V_\psi(x_r,\bar d_r^e,o^e)-V(x_r;e)>\delta \right] \le\epsilon. PΔ[Vψ(xr,dˉre,oe)V(xr;e)>δ]ϵ.

正式稿使用:

N = 10 7 , β = 10 − 12 . N=10^7,\qquad \beta=10^{-12}. N=107,β=1012.

论文 Table II OCR-VN Calibration Levels

指标 10 − 1 10^{-1} 101 10 − 2 10^{-2} 102 10 − 3 10^{-3} 103
Violation Rate ϵ \epsilon ϵ 10 − 1 10^{-1} 101 10 − 2 10^{-2} 102 10 − 3 10^{-3} 103
Calibration Level δ \delta δ / m0.220.490.99

论文最终采用:

ϵ = 10 − 2 , δ = 0.49   m . \epsilon=10^{-2},\qquad \delta=0.49\,\mathrm m. ϵ=102,δ=0.49m.

部署时相当于把触发边界从理想的 V = 0 V=0 V=0 提前到:

V ψ ≤ δ . V_\psi\le\delta. Vψδ.

需要特别强调:这不是“固定离障碍物 0.49 m”,而是对学习得到的 HJ value做校准;同时该统计保证依赖 calibration distribution。若实机场景与 validation LiDAR 分布发生显著偏移,不能把该概率结论无条件外推。

10. 在线扰动估计:OCR 如何实时感知“当前动力学有多不可靠”

10.1 从预测状态与真实状态的偏差反推扰动

设离散步长为 η \eta η,使用最近 k k k 步状态和命令。无扰动模型预测的末状态定义为:

x ^ r i = x r i − k + ∑ j = i − k i − 1 η   f r ( x r j , ω j ) . \hat x_r^i =x_r^{i-k} + \sum_{j=i-k}^{i-1} \eta\,f_r(x_r^j,\omega^j). x^ri=xrik+j=iki1ηfr(xrj,ωj).

作者假设短时间窗口内系统性扰动可近似为低频常量 d r τ d_r^\tau drτ,于是正式稿 Equation (14):

d r τ ≈ x r i − x ^ r i η k . d_r^\tau \approx \frac{x_r^i-\hat x_r^i}{\eta k}. drτηkxrix^ri.

论文采用:

η k = 2   s . \eta k=2\,\mathrm s. ηk=2s.

因此可以把 d r τ d_r^\tau drτ 理解为:

最近约 2 s 内,机器人真实运动与“根据历史 twist 由无扰动 Dubins 模型预测的运动”之间的平均速度/角速度偏差。

这让系统不必显式识别“当前摩擦系数是多少”,只需要测出当前闭环执行效果与 nominal reduced model 差了多少。

10.2 滑动窗口构造 disturbance bound

对最近 φ \varphi φ 个扰动估计建立窗口 d r 1 : φ d_r^{1:\varphi} dr1:φ。作者只保留排序后中间比例 c c c,抑制异常值,然后用均值和标准差构造扰动范围。正式稿 Equation (15) 可写为:

d ˉ r e = ∣ μ  ⁣ ( ( d r 1 : φ ) c ) ∣ ± b   σ  ⁣ ( ( d r 1 : φ ) c ) . \bar d_r^e =\left| \mu\!\left((d_r^{1:\varphi})_c\right) \right| \pm b\, \sigma\!\left((d_r^{1:\varphi})_c\right). dˉre= μ((dr1:φ)c) ±bσ((dr1:φ)c).

论文参数:

c = 0.8 , b = 2 , η φ = 2   s . c=0.8,\qquad b=2,\qquad \eta\varphi=2\,\mathrm s. c=0.8,b=2,ηφ=2s.

位置和航向分别维护:

d ˉ p x , p y e , d ˉ p θ e . \bar d_{p_x,p_y}^e,\qquad \bar d_{p_\theta}^e. dˉpx,pye,dˉpθe.

对于二维位置扰动,论文不是直接对 d p x d_{p_x} dpx d p y d_{p_y} dpy 分量分别做界,而是在 disturbance norm 的窗口上应用同样的统计规则。

这一设计的关键点是:OCR-VN 在离线训练时已经学习了不同 d ˉ r e \bar d_r^e dˉre 所对应的不同 value function。因此在线无需重新求一次 HJ PDE,只需要:

( x r , d ˉ ^ r e , o e ) ⟼ V ψ ( x r , d ˉ ^ r e , o e ) , (x_r,\hat{\bar d}_r^e,o^e) \longmapsto V_\psi(x_r,\hat{\bar d}_r^e,o^e), (xr,dˉ^re,oe)Vψ(xr,dˉ^re,oe),

就能随着地面打滑、payload 变化或低层 tracking error 的增大而自动变得更保守。

11. Adaptive Safety Filter:最终在线 QP

部署时的层次化安全策略由正式稿 Equation (16) 给出:

π s a f e ( x , d ˉ r e , o e ) = { π n o m ( x ) , V ψ ( x r , d ˉ r e , o e ) > δ , π n o m l o w ∘ π Q P h i g h ( x r , d ˉ r e , o e ) , V ψ ( x r , d ˉ r e , o e ) ≤ δ . \pi_{\mathrm{safe}}(x,\bar d_r^e,o^e) =\begin{cases} \pi_{\mathrm{nom}}(x), & V_\psi(x_r,\bar d_r^e,o^e)>\delta,\\[2mm] \pi_{\mathrm{nom}}^{\mathrm{low}} \circ \pi_{\mathrm{QP}}^{\mathrm{high}} (x_r,\bar d_r^e,o^e), & V_\psi(x_r,\bar d_r^e,o^e)\le\delta. \end{cases} πsafe(x,dˉre,oe)= πnom(x),πnomlowπQPhigh(xr,dˉre,oe),Vψ(xr,dˉre,oe)>δ,Vψ(xr,dˉre,oe)δ.

也就是说,安全裕度足够时完全不干预;只有当预测值进入校准后的危险区间,才修改 high-level twist。

正式稿 Equation (17) 的在线 QP 为:

min ⁡ ω ∈ Ω ,    s ≥ 0 ∥ ω − π n o m h i g h ( x r ) ∥ 2 2 + λ s 2 s.t. min ⁡ d r ∈ D r e ∇ x V ψ ( x r , d ˉ r e , o e ) ⊤ f r ( x r , ω , d r ) ≥ − s . \begin{aligned} \min_{\omega\in\Omega,\;s\ge0}\quad & \left\| \omega-\pi_{\mathrm{nom}}^{\mathrm{high}}(x_r) \right\|_2^2 + \lambda s^2\\ \text{s.t.}\quad & \min_{d_r\in\mathcal D_r^e} \nabla_xV_\psi(x_r,\bar d_r^e,o^e)^\top f_r(x_r,\omega,d_r) \ge -s. \end{aligned} ωΩ,s0mins.t. ωπnomhigh(xr) 22+λs2drDreminxVψ(xr,dˉre,oe)fr(xr,ω,dr)s.

论文设置:

λ = 10 3 . \lambda=10^3. λ=103.

其中:

  • 第一项要求 ω \omega ω 尽量接近 nominal twist;
  • s s s 为 slack variable,使 QP 在扰动界过于保守时仍具有数值可行解;
  • λ s 2 \lambda s^2 λs2 对违反安全导数条件施加强惩罚;
  • D r e \mathcal D_r^e Dre 是满足当前估计扰动界 d ˉ r e \bar d_r^e dˉre 的扰动集合。

由于 Dubins reduced dynamics 对 ω \omega ω d r d_r dr 都是 affine,且 disturbance optimization 与 control optimization 可分离,因此该在线问题可高效写成 QP,而不需要部署时重新求解 HJ PDE。

11.1 这一 QP 的物理含义

最核心的约束是:

min ⁡ d r ∈ D r e ∇ x V ψ ⊤ f r ≥ − s . \min_{d_r\in\mathcal D_r^e} \nabla_xV_\psi^\top f_r \ge -s. drDreminxVψfrs.

它要求:即使考虑当前允许的最坏动力学扰动,过滤后的 twist 也不能让安全价值快速朝更危险的方向下降。

因此 OCR 的在线闭环逻辑可以浓缩为:

P e r c e p t i o n → U n c e r t a i n t y   E s t i m a t i o n → V a l u e / G r a d i e n t → M i n i m u m   I n t e r v e n t i o n   Q P . \mathrm{Perception} \rightarrow \mathrm{Uncertainty\ Estimation} \rightarrow \mathrm{Value/Gradient} \rightarrow \mathrm{Minimum\ Intervention\ QP}. PerceptionUncertainty EstimationValue/GradientMinimum Intervention QP.

12. OCR 的完整算法逻辑

可以将论文算法压缩为以下技术链:

离线:
随机障碍 + 随机扰动上界
        ↓
3D Dubins Reduced Model
        ↓
HJ Reachability 求解 V 和 ∇V
        ↓
生成 (state, LiDAR, disturbance bound) → value/gradient 数据集
        ↓
训练 OCR-VN
        ↓
Conformal Prediction 校准 δ

在线:
LiDAR + SLAM → 当前相对状态/局部障碍观测
                   ↓
最近状态 + 历史 twist → disturbance bound estimator
                   ↓
(state, LiDAR, disturbance bound)
                   ↓
OCR-VN → Vψ, ∇Vψ
                   ↓
Vψ > δ ?
    ├─ 是 → 原 nominal command 直接通过
    └─ 否 → QP 最小修改 high-level twist
                   ↓
low-level locomotion policy 跟踪安全 twist
                   ↓
关节级控制

真正承担不同功能的模块可以区分为:

模块解决的问题核心机制
HJ Reachability什么状态在最坏扰动下仍然安全BRT + 最优 safety value
OCR-VN在线不能重新求 HJ PDE学习 value-function family
LiDAR conditioning障碍物布局未知观测条件化安全价值函数
Disturbance estimator摩擦/负载/低层跟踪未知最近状态-动作预测残差
Conformal calibration神经网络会高估安全值概率误差上界
Safety QP既安全又不破坏原控制器性能最小修改 nominal twist

13. 仿真实验设计

13.1 仿真平台与机器人

作者在 Isaac Sim 中测试 Unitree Go1 四足机器人。

随机实验环境:

  • 4 个圆形障碍;
  • 位置:
    [ − 2 , 2 ] × [ − 2 , 2 ]   m [-2,2]\times[-2,2]\ \mathrm m [2,2]×[2,2] m
  • 半径:
    [ 0.1 , 1 ]   m [0.1,1]\ \mathrm m [0.1,1] m
  • 起点:
    ( − 5 , 0 )   m (-5,0)\ \mathrm m (5,0) m
  • 终点:
    ( 5 , 0 )   m (5,0)\ \mathrm m (5,0) m

为制造严重 dynamics mismatch,hard setting 使用:

m p a y l o a d ∈ [ − 1 , − 0.5 ] ∪ [ 0.5 , 1 ]   k g m_{\mathrm{payload}} \in [-1,-0.5]\cup[0.5,1]\ \mathrm{kg} mpayload[1,0.5][0.5,1] kg

地面摩擦系数:

μ ∈ [ 0.5 , 0.75 ] ∪ [ 1.25 , 1.5 ] \mu \in [0.5,0.75]\cup[1.25,1.5] μ[0.5,0.75][1.25,1.5]

13.2 高层 Nominal Planner

Predictive Sampling(PS)

一个 sampling-based high-level MPC planner。

它随机采样 1000 组控制序列,对每组 sequence 使用 reduced model rollout,并最小化“到目标的距离 + 碰撞惩罚”。

论文设置:

N = 1000 , σ = 0.5 , T = 4   s , η = 0.2   s N=1000,\quad \sigma=0.5,\quad T=4\ \mathrm s,\quad \eta=0.2\ \mathrm s N=1000,σ=0.5,T=4 s,η=0.2 s

碰撞 penalty:

c = 10 9 c=10^9 c=109

Naive Planner(NVE)

只朝目标点转向和前进,本身没有 obstacle avoidance

它的作用是刻意验证:即使 nominal planner 本身完全不具备避障能力,OCR 是否仍可在外层提供安全修正。

Human Teleoperation(HMN)

由人工直接给出 high-level twist,甚至进行 adversarial collision-seeking teleoperation。

13.3 低层 Locomotion Policy

Walk-These-Ways(WTW)

RL locomotion policy,实验采用约 3 Hz trot。

MPC

模型驱动低层 locomotion controller,根据 twist 产生电机力矩。

ABS-Recovery

来自 ABS 框架的 RL backup policy,用于快速跟踪 recovery twist。

13.4 对比与消融

论文主要比较:

  • No Filter
  • ABS
  • OCR \ DE:去除 Disturbance Estimation
  • OCR \ C:去除 Calibration
  • OCR(完整)

附录进一步加入:

  • Robust CBF-QP;
  • EKF disturbance estimator;
  • high-level MPC;
  • robust high-level MPC。

14. 仿真结果:同一个安全滤波器能否适配不同 controller

图4 OCR 对不同 nominal controller 的安全修正轨迹。绿色/红色分别表示 nominal/filtered 段,白色为未使用安全过滤器时的轨迹。论文 Figure 4,来源:Lin et al., IEEE TRO 2026。

图4展示了三种非常不同的 nominal controller:

  • PS + WTW;
  • NVE + WTW;
  • ABS-Agile。

在低摩擦和 payload 扰动下,它们单独运行都会发生碰撞,而 OCR 都能够通过修改高层速度指令使轨迹进入安全区域。

论文 Table III OCR、消融版本与 ABS 在不同 nominal controller 下的仿真结果(100 trials)

ControllerFilterSuccessCollisionTimeout v ˉ \bar v vˉ (m/s) r ˉ \bar r rˉ q ˉ \bar q qˉ (m)
ABS-AgileNo Filter0.750.250.002.100.000.41
ABS-AgileABS0.800.200.002.030.030.41
ABS-AgileOCR \ DE0.400.350.250.980.620.41
ABS-AgileOCR \ C0.810.190.001.700.280.41
ABS-AgileOCR0.910.090.001.220.590.58
PS + WTWNo Filter0.720.280.001.360.000.43
PS + WTWOCR \ DE0.780.220.000.840.610.42
PS + WTWOCR \ C0.900.090.011.210.180.44
PS + WTWOCR1.000.000.000.970.420.66
NVE + WTWNo Filter0.200.800.001.700.000.31
NVE + WTWOCR \ DE0.210.790.000.930.610.37
NVE + WTWOCR \ C0.450.550.001.320.280.39
NVE + WTWOCR0.910.080.011.040.470.62

最有说明力的是 NVE + WTW:

20 % → 91 % 20\%\rightarrow91\% 20%91%

成功率从 20% 提高到 91%,说明 OCR 并不是只在“本身已经会避障的 planner”上微调轨迹,而是真正承担了安全 shielding。


15. 为什么在线 Disturbance Estimation 很重要

图5 不同 payload 与 friction 条件下 ABS、无扰动估计的 OCR 和完整 OCR 的安全率热力图,共 1000 trials。论文 Figure 5,来源:Lin et al., IEEE TRO 2026。

Figure 5 的核心信息是:

  • ABS 在部分低摩擦区明显退化;
  • OCR 若去掉 disturbance estimator,也会出现明显退化;
  • 完整 OCR 在更广泛动力学变化下保持较高安全率。

因此 OCR 的鲁棒性不是仅靠“LiDAR 看见障碍物”获得的。

LiDAR 只能回答:

障碍物在哪里?

而 disturbance estimator 回答:

当前机器人按照这个控制命令,究竟还有多强的可控性和跟踪能力?

在低摩擦地面上,后一个问题决定“现在是否还来得及转过去”。

图6 OCR 与 ABS 在高动力学扰动以及摩擦突变环境中的行为对比,并展示在线估计的平面位置扰动上界。论文 Figure 6,来源:Lin et al., IEEE TRO 2026。

Figure 6(b) 中,当机器人进入蓝色低摩擦区域时, d ˉ p x , p y e \bar d_{p_x,p_y}^e dˉpx,pye 显著增大。OCR-VN 随之输出一个更保守的 value function,安全过滤器更早降低速度并增加转向;ABS 因没有相同的在线 dynamics adaptation,介入过晚并发生碰撞。


16. Safety–Performance Trade-off

更大的安全裕度通常意味着:

  • 更早启动 filter;
  • 更高 filter activation rate;
  • 更低平均速度;
  • 更大的 obstacle clearance;
  • 更低碰撞概率。

论文 Table IV 不同安全裕度下 OCR 与 ABS 的性能权衡(100 trials)

FilterSuccessCollisionTimeout v ˉ \bar v vˉ (m/s) r ˉ \bar r rˉ q ˉ \bar q qˉ (m)
ABS threshold -0.050.800.200.002.030.030.41
ABS threshold -0.100.780.220.002.000.030.41
ABS threshold -0.200.830.170.001.940.050.41
ABS threshold -0.400.770.170.061.850.080.42
ABS threshold -0.600.670.250.081.470.190.44
OCR \ C0.810.190.001.700.280.41
OCR C = -0.10.790.210.001.720.240.41
OCR C = -0.20.780.220.001.420.320.42
OCR C = -0.30.860.140.001.300.400.43
OCR C = -0.40.900.100.001.140.470.46
OCR C = -0.5 (ours)0.910.090.001.220.590.58

这张表说明 OCR 不是“没有代价地提高安全率”。完整 OCR 的干预率明显增加,速度也会降低。但随着保守程度增加,OCR 的安全收益比 ABS 更稳定。


17. 为什么 OCR 比 policy-conditioned safety critic 更“通用”

图7 OCR 与 ABS 在手工设计障碍环境中的策略无关性与最优安全价值差异。论文 Figure 7,来源:Lin et al., IEEE TRO 2026。

Figure 7(a) 中,场景需要连续两个急转弯。OCR 可以直接与更适合该任务的 PS + WTW 组合;而 ABS 的 safety mechanism 与特定 ABS-Agile policy 强耦合,后者并不适合这个导航形态,最终出现停滞。

Figure 7(b) 是高度拥挤的 dead-end 场景。作者指出,ABS 使用的是policy-conditioned value function,其价值取决于特定 nominal policy 的能力;如果 nominal policy 本身并非最优避险策略,就可能得到偏保守或次优的 safety evaluation。

OCR 则训练:

V ∗ ( x ) V^*(x) V(x)

即 HJ 意义下的最优控制理论价值函数,而不是:

V π n o m ( x ) V^{\pi_{\mathrm{nom}}}(x) Vπnom(x)

因此安全 certificate 本身不依附于某个 nominal policy。

这也是“One Filter”能够跨 controller 复用的理论来源。


18. 实机系统与实验设计

18.1 硬件

论文使用:

  • Unitree Go1;
  • Slamtec RPLiDAR A2;
  • LiDAR-based SLAM;
  • tinySLAM / 开源实现中的 BreezySLAM;
  • 外部计算机运行安全层;
  • low-level WTW 或 MPC 执行过滤后的 twist。

开源仓库给出的实现架构是:

RPLidar
   ↓
SLAM / State Estimation
   ├──────────────→ current state
   ↓
Local map / planner
   ↓ nominal twist
OCR Safety Filter
   ↑
recent state-action history → disturbance estimator
   ↑
LiDAR → OCR-VN
   ↓
safe twist
   ↓
low-level locomotion controller
   ↓
motor commands

开源代码中对应的主要复现入口包括:

scripts/generate_value_network_data.py
scripts/train_value_network.py
scripts/calibrate_value_network.py
scripts/run_sims.py
scripts/analyze_sims.py
hardware/filter.py
hardware/nodes/state_estimators/slam.py
hardware/nodes/planners/mps.py

因此论文并不是只公开了“训练网络的 demo”,而是提供了从 HJ 数据生成、OCR-VN 训练/校准到仿真及实机安全过滤的参考实现。

18.2 实机条件

作者设置两类主要场景:

  1. 正常地面障碍迷宫;
  2. 在第一个障碍物前增加一块浸油 tarp,人为制造极低摩擦区域。

此外还测试:

  • rough outdoor terrain;
  • external kick;
  • adversarial human teleoperation;
  • dynamic obstacles;
  • narrow corridors / cluttered indoor scenes。

19. 实机结果

图8 湿滑区域实机实验。左:ABS 因打滑导致漂移并碰撞;右:OCR 提前减速并转向避免碰撞。论文 Figure 8,来源:Lin et al., IEEE TRO 2026。

论文 Table V 不同 nominal controller 下的实机实验结果(每种条件 10 trials)

ControllerFilterNormal SuccessNormal CollisionNormal TimeoutSlippery SuccessSlippery CollisionSlippery Timeout
ABS-AgileNo Filter910190
ABS-AgileABS910280
ABS-AgileOCR1000811
PS + WTWNo Filter550190
PS + WTWOCR910820
NVE + WTWNo Filter01000100
NVE + WTWOCR901820
PS + MPCNo Filter5500100
PS + MPCOCR1000910
NVE + MPCNo Filter01000100
NVE + MPCOCR901730

其中最明显的是:

  • ABS-Agile + ABS 在 slippery condition 只有 2/10 success;
  • 同一个 ABS-Agile 外挂 OCR 后达到 8/10 success;
  • 完全不避障的 NVE + WTW/MPC 在正常环境中原本 0/10 success,加入 OCR 后都达到 9/10。

这说明 OCR 的作用既不是“优化某一个 RL policy”,也不是“只修复某一个 low-level controller”,而是把collision-avoidance safety提升到了高层通用接口上。


20. 动态障碍、外部扰动与对抗遥控应该怎样理解

论文还展示了几组定性实机实验。

20.1 External disturbance

机器人在湿滑地面上受到踢击后,实际状态与 reduced-model prediction 产生明显偏差,扰动界增大。OCR 随后提高 safety conservatism,使机器人快速远离障碍。

20.2 Adversarial teleoperation

人工故意多次发送向柱子撞击的 twist。OCR 并不会永久夺走控制权,而是在安全风险增大时过滤危险分量,尽量保留操作者其余意图。

20.3 Dynamic obstacle

论文 Figure 1(e,k) 展示了突然被放置到机器人前方的箱子。机器人可由约 2 m/s 减速,以获得足够的转弯半径。

但这里必须区分实验证明的 reactive capability理论假设

论文 Problem Setup 明确假设:

F e \mathcal F^e Fe

为静态 failure set,动态障碍的形式化处理留作未来工作。因此不能把动态障碍 demo 解读成“论文已经对任意运动障碍给出 HJ 理论安全保证”。


21. 附录消融:为什么用 sinusoidal activation

终稿 Appendix B 的 Figure 9 比较:

  • sinusoidal + gradient loss;
  • sinusoidal without gradient loss;
  • ReLU + gradient loss;
  • ReLU without gradient loss。

论文结论是:

  • ReLU 模型在 value 与 gradient prediction 上的 validation loss 约为 sinusoidal 网络的两倍;
  • ReLU 的梯度预测存在明显 mosaic-like artifacts;
  • 去掉 gradient loss 对 sinusoidal 模型的 gradient accuracy 影响相对有限,但安全 QP 明确依赖梯度,因此作者仍保留显式 gradient supervision。

其工程含义是:

对安全 certificate 网络而言,“value 预测准”并不足够;如果后续控制律依赖 ∇ V \nabla V V,网络的可微几何质量本身就是控制性能的一部分。

图9 不同网络/损失配置在与 Figure 3 相同 validation environment 中的 value 与 gradient 预测。对应论文 Figure 9。

正式稿 Figure 9 用于比较 sinusoidal/ReLU activation 以及是否加入 gradient loss 对 value/gradient 预测质量的影响。


22. 附录消融:滑动窗口估计 vs EKF

Appendix C 使用 EKF 替换论文主方法中的 sliding-window disturbance estimator。

EKF 将扰动项也作为状态进行估计,并引入:

  • process covariance Q Q Q
  • measurement covariance R R R
  • state covariance P P P
  • disturbance decay coefficient:
    γ = 0.5 \gamma=0.5 γ=0.5

再根据 covariance 构造约两个标准差的 disturbance bound。

结果表明:

  • EKF 能同样观察到进入低摩擦区域后 disturbance bound 上升;
  • 但整体 safety/performance 没有优于简单 sliding-window estimator;
  • EKF 还需要额外动力学假设与 covariance tuning。

因此作者选择滑动窗口,并不是因为 EKF“做不到”,而是因为它在该任务中没有带来足够收益。

图10 OCR 的滑动窗口扰动估计与 OCR+EKF 在 Figure 6(b) 同一低摩擦突变场景中的对比;底部曲线分别展示两种方法估计的 disturbance bounds。对应论文 Figure 10。


23. 与 Robust CBF-QP 的区别

附录还构造 robust CBF baseline。

CBF-QP 需要一个 barrier function:

h ( x ) h(x) h(x)

作者为了让 baseline 占据信息优势,直接提供 ground-truth obstacle information,并使用 obstacle signed distance function 作为 h ( x ) h(x) h(x)

鲁棒约束类似:

min ⁡ d r ∈ D r e [ h ˙ ( x r , ω , d r ) + γ h ( x r ) + s ] ≥ 0 \min_{d_r\in\mathcal D_r^e} \left[ \dot h(x_r,\omega,d_r) + \gamma h(x_r) +s \right] \ge0 drDremin[h˙(xr,ω,dr)+γh(xr)+s]0

实验中 robust CBF 的 safety rate 约为 0.76,而且平均速度约只有 OCR 的一半。

论文给出的原因有两个:

  1. signed distance 只是几何 certificate,并不是考虑系统控制能力后的最优动态 safety value
  2. 在存在 control bounds 时,CBF-QP 可能出现约束不可行,而 HJ Reachability 从求解阶段就把 control constraints 纳入了可达性计算。

这里不能简单概括成“CBF 一定比 HJ 差”。准确地说,论文说明:在本文的高动态四足导航、所采用的 SDF-CBF 构造与控制约束条件下,HJ-derived value function 提供了更适合该任务的 certificate。


24. 与 High-Level MPC 的区别

图11:与图6中的环境相同的MPC基准。 (b)中地面摩擦突然下降,用蓝色表示。 (a)中,机器人在第二堵墙处卡住并超时。(b)中,由于地面摩擦突然变化,机器人撞上了第一堵墙。

作者还实现了 high-level MPC baseline:

  • 使用同一个 reduced model;
  • horizon:
    4   s 4\ \mathrm s 4 s
  • CasADi direct shooting;
  • IPOPT;
  • 时间离散:
    0.02   s 0.02\ \mathrm s 0.02 s
  • 每次最多 100 个 IPOPT iterations;
  • baseline 甚至可以直接获得 ground-truth obstacle information。

作者比较 nominal HL-MPC 和带动态 safety margin 的 robust HL-MPC。

问题在于:

  • nominal MPC 忽略 low-level tracking mismatch 时容易过度乐观;
  • robust MPC 通过增大 margin 可减少一部分碰撞,但会明显牺牲进度,产生 timeout;
  • 有限时域 MPC 与 HJ viability/BRT 的思想不同,后者直接考虑“从当前状态以后是否还存在安全控制”。

这也说明 OCR 并不是“把 MPC 换成神经网络”,而是:

离线用 HJ 求全局安全结构,在线用网络近似快速查询,再用一个极小的 QP 做安全修正。


25. 主要创新点

25.1 从 policy-conditioned safety 转向 policy-agnostic optimal safety

现有很多 safety critic / recovery policy 都依赖:

π n o m \pi_{\mathrm{nom}} πnom

也就是说换一个 controller 后,安全价值或 recovery policy 可能需要重训。

OCR 学的是:

V ∗ V^* V

即 HJ 最优控制问题对应的 value function family,因此安全层与 nominal policy 解耦。这是论文标题最核心的技术支撑。

25.2 Observation-conditioned reachability

传统 HJ safety certificate 通常针对已知 failure set 离线计算。

OCR 将:

o e o^e oe

直接作为 value network condition,使网络可以根据新的 LiDAR scan 在线构造对应的 value landscape。

因此它把:

“每个障碍场景求一个 HJ value” \text{“每个障碍场景求一个 HJ value”} 每个障碍场景求一个 HJ value”

变成:

“训练一个从 observation 到 HJ value 的函数” \text{“训练一个从 observation 到 HJ value 的函数”} 训练一个从 observation  HJ value 的函数

25.3 将不同 locomotion policy 的模型差异统一为 disturbance

作者没有为每一种 RL/MPC low-level controller 建模,而是通过:

d r d_r dr

吸收 reduced-order model 与实际机器人之间的 mismatch,并在线更新:

d ˉ r e \bar d_r^e dˉre

这使安全层能在更换 low-level controller 或地面摩擦变化时自动调整保守程度。

25.4 Value 与 gradient 联合蒸馏

安全过滤器并不是只需要“危险/安全分类”,而需要:

∇ V \nabla V V

来决定怎样修改控制量。

因此 OCR-VN 训练目标保留 HJ value field 的微分结构,并采用 sinusoidal activation。

25.5 用 Conformal Prediction 处理神经安全证书的近似误差

OCR 没有把网络输出直接包装成“形式化绝对保证”,而是利用 calibration dataset 对网络高估 safety value 的概率进行量化,并通过 δ \delta δ 将 filter 提前触发。

这使 learning approximation 与 control-theoretic safety 之间的关系更加明确。

25.6 一个独立于任务性能层的最小干预安全 QP

OCR 不负责决定“去哪里”,而只负责决定“当前这个指令是否仍在安全可控区域内”。

因此可将:

Task Planning \text{Task Planning} Task Planning

与:

Safety Shielding \text{Safety Shielding} Safety Shielding

分离,避免为了加入安全机制而重新训练整个任务策略。


26. 学术贡献

从学术角度看,论文最有价值的地方不是单独提出某一个新网络结构,而是把四个长期相对分离的研究方向连接起来:

HJ Reachability + Observation-conditioned Learning + Online Uncertainty Estimation + Safety Filtering \boxed{ \text{HJ Reachability} + \text{Observation-conditioned Learning} + \text{Online Uncertainty Estimation} + \text{Safety Filtering} } HJ Reachability+Observation-conditioned Learning+Online Uncertainty Estimation+Safety Filtering

其贡献可归纳为:

  1. 可达性安全的场景泛化
    将传统针对固定环境的 HJ value function 扩展为 observation-conditioned value-function family。

  2. 可达性安全的控制器泛化
    通过最优 HJ safety value 而非 policy-conditioned critic,使同一 safety layer 可包裹多个 nominal controller。

  3. 模型不确定性的在线适配
    将 reduced-order model gap 视为 adversarial disturbance,并从真实系统历史中实时估计其 bound。

  4. 学习证书与概率校准结合
    用 conformal prediction 对 neural value approximation 的安全高估误差进行定量控制。

  5. 完整的仿真—实机验证
    覆盖 RL、MPC、采样式 planner、naive planner、人类遥控、正常/低摩擦/粗糙地形/外部扰动等条件。


27. 论文最值得深入理解的三个思想

27.1 安全距离不是固定距离,而是“动态可恢复性”

普通 collision checker 可能只判断:

d o b s > d min ⁡ d_{\mathrm{obs}}>d_{\min} dobs>dmin

OCR 则判断的是:

V ( x ) > 0 ? V(x)>0? V(x)>0?

即从当前速度、朝向、控制约束和扰动条件出发,是否仍存在一种控制动作可以阻止未来进入碰撞集合

因此同样离障碍物 0.5 m:

  • 低速且高摩擦时可能安全;
  • 2 m/s 高速且低摩擦时可能已经位于 BRT 内。

27.2 在线 disturbance bound 实际上是在测“当前控制权有多强”

摩擦下降时不是直接把“摩擦系数”输入 OCR-VN。

作者并不需要识别:

μ = 0.43 \mu=0.43 μ=0.43

而是直接估计:

∥ x ˙ a c t u a l − x ˙ m o d e l ∥ \|\dot x_{\mathrm{actual}}-\dot x_{\mathrm{model}}\| x˙actualx˙model

这比显式识别每一个物理参数更通用,因为不同原因产生的控制误差最终都会反映到状态转移 mismatch 中。

27.3 One Filter 并不意味着任何控制器都完全无条件兼容

论文的强结论有明确前提。

主要实验依赖 hierarchical interface:

π n o m h i g h → ( v , w ) → π n o m l o w \pi_{\mathrm{nom}}^{\mathrm{high}} \rightarrow(v,w) \rightarrow \pi_{\mathrm{nom}}^{\mathrm{low}} πnomhigh(v,w)πnomlow

如果 nominal controller 是完全端到端、内部没有可修改的 high-level twist,那么在安全风险出现时,OCR 仍需要提供:

  • 一个可用于 QP 修正的 high-level planner;
  • 一个能够执行 filtered twist 的 low-level policy。

论文对 ABS-Agile 的处理就是:安全时直接运行 ABS-Agile;风险出现后,由 PS 产生高层命令,经 OCR QP 修正,再由 ABS-Recovery 执行。

所以“One Filter to Deploy Them All”应理解为:

在共享的 reduced-order high-level interface 下,一个统一 safety certificate/filter 可以跨多种 nominal controller 复用。

而不是“不管输入输出形式如何,任意黑盒控制器都能直接套用”。


28. 局限性与值得警惕的结论边界

28.1 实验并非零碰撞

论文实机和仿真中仍存在 nonzero collision rate。

主要原因包括:

  • 真实扰动可能瞬间超过当前估计的 d ˉ r e \bar d_r^e dˉre
  • disturbance estimator 需要历史窗口,因此环境突变后存在适应延迟;
  • OCR-VN 本身存在 approximation error;
  • SLAM/state estimation latency 也会表现为模型 mismatch。

所以不能把 OCR 描述成“实机绝对安全”。

28.2 Conformal calibration 是 distribution-dependent

校准只对 calibration distribution 具有统计意义。

如果训练时 LiDAR 大多看到稀疏圆形障碍,而部署时机器人被墙体完全包围,则:

P d e p l o y ≠ P c a l i b r a t i o n P_{\mathrm{deploy}}\neq P_{\mathrm{calibration}} Pdeploy=Pcalibration

原有 ϵ , β , δ \epsilon,\beta,\delta ϵ,β,δ 不能无条件维持原解释。

论文在高度 cluttered indoor scenes 中甚至需要:

  • 只保留前方 π / 2 \pi/2 π/2 视场内的 LiDAR;
  • 使用 uncalibrated OCR-VN。

这说明感知分布偏移仍然是该方法的重要问题。

28.3 Reduced-order model 不描述完整四足接触动力学

论文具体实现只有:

( p x , p y , p θ ) (p_x,p_y,p_\theta) (px,py,pθ)

没有显式描述:

  • roll/pitch;
  • 足端接触状态;
  • 关节极限;
  • body collision;
  • 足端滑移模式;
  • 跌倒;
  • 台阶高度;
  • 3D terrain geometry。

因此本文解决的是agile planar collision-free navigation,并不是对四足机器人所有 physical failure mode 的统一证明。

28.4 Worst-case disturbance 带来保守性

HJ 使用 adversarial disturbance:

min ⁡ d ∈ D \min_{d\in\mathcal D} dDmin

这对 safety 有利,但在障碍密集且估计 disturbance bound 较大时,BRT 会明显扩张,可能出现 stall。

安全与可通行性的矛盾仍然存在。

28.5 动态障碍的理论保证尚不完整

论文能够对突然出现的箱子做实时 reaction,但其理论问题设定明确假设 failure set 为静态。因此动态障碍实验应理解为 empirical demonstration,而不是已完整证明的 moving-obstacle reachability guarantee。


29. 对机器人导航/运动控制研究的启示

29.1 可以把 locomotion controller 当作“未知执行器”

对于导航安全层,不一定要对每个 RL policy 建一个精确动力学模型。

可以采用:

统一降阶模型 + 在线 model-error bound \text{统一降阶模型} + \text{在线 model-error bound} 统一降阶模型+在线 model-error bound

把低层 policy 的复杂性封装起来。

这对模块化四足机器人系统尤其有价值。

29.2 RL 与 formal safety 不必二选一

OCR 体现的是典型的 layered architecture:

RL / MPC / Human + Formal Safety Filter \text{RL / MPC / Human} \quad+\quad \text{Formal Safety Filter} RL / MPC / Human+Formal Safety Filter

RL 负责性能和地形适应,reachability 负责安全边界。

这通常比把所有约束都塞进 RL reward 更容易解释,也更容易替换已有策略。

29.3 学习 value-function family 比学习某一条安全轨迹更具有复用性

OCR 学习的不是一个固定 policy,也不是特定场景的 trajectory,而是:

( e , x ) ↦ V e ( x ) (e,x)\mapsto V^e(x) (e,x)Ve(x)

即一族 safety solutions。

这个思路可以扩展到:

  • 不同车辆参数;
  • 不同机械臂障碍配置;
  • 不同无人机风扰;
  • 不同移动机器人摩擦条件。

30. 开源复现路径

官方仓库:

https://github.com/albertklin/observation-conditioned-reachability

按照仓库 README,核心复现顺序为:

30.1 生成 HJ 数据

python scripts/generate_value_network_data.py

30.2 训练 OCR-VN

python scripts/train_value_network.py

30.3 可视化 Value Network

python scripts/visualize_value_network_single_lidar.py
python scripts/visualize_value_network_multi_lidar.py

30.4 Conformal Calibration

python scripts/calibrate_value_network.py

30.5 仿真验证

python scripts/generate_sims.py
python scripts/run_sims.py
python scripts/analyze_sims.py

30.6 实机

核心模块位于:

hardware/
├── filter.py
├── nodes/
│   ├── lidars/
│   ├── state_estimators/
│   ├── planners/
│   └── robots/
├── interfaces/
├── sim/
└── lcm_types/

其中 filter.py 承担的核心计算就是:

state/LiDAR/nominal command → V ψ , ∇ V ψ , d ˉ r → Q P → safe command \text{state/LiDAR/nominal command} \rightarrow V_\psi,\nabla V_\psi,\bar d_r \rightarrow QP \rightarrow \text{safe command} state/LiDAR/nominal commandVψ,Vψ,dˉrQPsafe command


31. 论文的整体技术评价

这篇论文的重要性在于,它没有把“安全”继续绑定到某一个具体 RL policy 上,而是尝试形成一个真正独立的deployment-time safety layer

它的技术闭环非常完整:

理论安全最优解 → 神经网络函数族近似 → 概率校准 → 在线动力学不确定性估计 → 实时最小干预控制 \text{理论安全最优解} \rightarrow \text{神经网络函数族近似} \rightarrow \text{概率校准} \rightarrow \text{在线动力学不确定性估计} \rightarrow \text{实时最小干预控制} 理论安全最优解神经网络函数族近似概率校准在线动力学不确定性估计实时最小干预控制

其中最关键的思想并不是“用神经网络预测 HJ value”本身,而是把环境变化和动力学变化都变成 value function 的条件变量

V ψ = V ψ ( x r , o e , d ˉ r e ) V_\psi = V_\psi( x_r, o^e, \bar d_r^e ) Vψ=Vψ(xr,oe,dˉre)

于是在线 safety adaptation 不再需要重新求解高代价 HJ PDE,而变成一次 OCR-VN 查询和一个小规模 QP。

从机器人运动控制和自主导航的角度,这种“性能控制器可替换、安全层独立存在”的架构具有很强的工程价值;从形式化安全角度,它又保留了 HJ Reachability 对最坏情况扰动和 control authority 的显式推理。

但论文的安全性仍然受到降阶模型、扰动界估计延迟、神经近似误差、校准分布偏移和静态 failure-set 假设的限制。因此最准确的评价不是“OCR 已经解决了四足机器人的绝对安全”,而是:

OCR 提供了一种把 HJ reachability 的最优安全结构压缩成可实时查询、可随感知与模型误差自适应、并能够跨多种四足导航控制器复用的通用安全过滤框架。


32. 参考链接

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐