前言

如原论文Robo-ValueRL所说,离线到在线的RL在实现具有良好泛化能力的机器人操作方面前景广阔,但其端到端系统的高度复杂性使复现与诊断变得困难。在这类系统中,价值估计在对异质数据进行优先级排序以提升策略时起着核心作用

尽管价值估计十分关键,但一个核心问题仍然缺乏深入研究:在离线到在线的强化学习中,价值函数的可靠性是如何塑造策略优化过程的

为回答这一问题,作者提出 Robo-ValueRL,一个统一框架,用于实现可靠的价值估计,并系统性地追踪其对策略预训练与在线提升的下游影响

  1. 具体而言,Robo-ValueRL 学习一个历史条件的价值估计器,并通过全局进展(global-progress)和局部偏好(local-preference)指标来评估其可靠性
    由此产生的价值估计会被传播到质量条件的一致性策略预训练中,以及在线rollouts 上的一个残差自适应模块中,从而提供一个统一的测试平台,用于分析价值可靠性如何塑造下游策略性能
  2. 在覆盖 240 小时离线示教数据和超过 3,000 条在线 rollout 轨迹的广泛实验中,作者发现,下游性能与价值可靠性之间存在强关联
    可靠的价值函数能够提供更优的动作质量估计,使得价值引导的离线强化学习相比于质量无关的行为克隆具有更好的扩展性,并且通过优先使用高质量 rollout 数据来稳定在线提升

第一部分 Robo-ValueRL: Reliable Value Estimation forOffline-to-Online Reinforcement Learning

1.1 引言、相关工作

1.1.1 引言

如原论文所述,离线到在线强化学习(offline-to-online reinforcement learning)已成为实现具有良好泛化能力的机器人操作的一种颇具前景的范式 [1–3],它将离线策略预训练 [4–11] 与通过真实世界交互进行的在线性能提升 [12–17] 有机衔接

然而,与传统基准任务不同,这一范式构成了一个端到端的具身学习系统,其性能由多个紧密耦合的组件共同决定,包括数据整理、价值估计、离线预训练以及在线探索 [18–20]。这些相互依赖关系使得性能难以复现,并且在真实部署条件下,一旦失败往往难以及时定位和诊断

  1. 在这些因素之中,价值估计在离线到在线的机器人强化学习中处于核心地位 [21,22]。其作用在于评估异质性的经验数据——从次优示范到在线 rollout——并决定这些数据将如何促进策略的改进[23–25]

    可靠的价值估计可以优先利用信息量更高的经验并抑制低质量数据,而不准确的价值估计则可能错误排序经验并使学习过程不稳定
  2. 然而,现有关于价值估计可靠性的证据仍然零散地分布在整个离线到在线流程中 [3,23,26,27]:算法研究往往只在孤立的环境下分析价值优化问题 [2,3],而机器人系统研究则主要报道下游性能,却很少检验所学习到的价值是否真实反映了任务进展或动作质量 [23,26,28]。因此,价值估计可靠性在离线预训练和在线改进中的作用仍有待系统性研究

为研究这一作用,作者从两个相互耦合的视角考察价值估计的可靠性:

  1. 一是如何从异构的机器人数据中学习到可靠的价值;
  2. 二是这种价值的可靠性如何在离线预训练与在线改进两个阶段影响策略学习

为使这一研究具备具体落地的载体,来自的研究者提出 Robo-ValueRL,这是一个统一的、从离线到在线的机器人强化学习框架,将“可靠价值函数学习”、“价值引导的离线策略预训练”和“真实世界中的在线改进”组织成一个连贯的流程除最终成功率之外,Robo-ValueRL 还引入了价值可靠性指标,为将价值质量与下游策略优化联系起来提供了分析依据

具体而言

  1. Robo-ValueRL 首先在离线机器人数据上训练一个以历史为条件的价值估计器,以缓解由部分可观测性和视觉遮挡带来的歧义
    其对动作质量的估计被用于为离线经验打分,以进行质量条件的一致性策略预训练 [29],从而通过一步去噪实现高效的价值引导动作生成
  2. 随后,将预训练好的策略部署到真实环境中收集带有人类在环干预的 rollout
    Robo-ValueRL 进一步在这些 rollout 上更新价值估计器,并从中筛选出高质量的在线片段,用于训练一个轻量级的残差自适应模块,从而在保留先验知识的同时,有针对性地修正失败模式

在这一离线到在线的全过程中,作者的度量指标从全局任务层面的推进情况来评估价值的可靠性,以衡量这些数值是否体现了长时间尺度上的任务推进情况,以及局部动作层面的偏好,从而评估这些数值能否刻画细粒度的动作质量

如下图所示,Robo-ValueRL 通过可靠的价值引导改进离线到在线的强化学习

  1. a) 使用可靠性度量对价值函数进行评估,以用于后续策略学习
  2. b) 可靠的价值使得能够从混合质量的演示数据中进行可扩展的离线预训练
  3. c) 基于价值引导的在线自适应稳定了策略改进过程,使毫米级芯片插入力成功率达到 86%

综合来看,Robo-ValueRL 提供了一个统一的测试平台,用于分析价值估计的可靠性如何影响离线扩展能力与在线性能提升

1.1.2 相关工作

首先,对于从异构机器人数据中学习

在扩展机器人学习规模时,一个核心挑战在于真实机器人数据的异质性[30,31]:人类示教中包含错误、犹豫以及局部次优的动作,而在线 rollouts 又会引入探索性失败和不稳定交互[20,28]

  1. 当前大规模 VLA 流水线通常通过行为克隆来吸收这类混合质量的数据,这种方式能够提供广泛的行为先验,但缺乏对动作质量的显式区分能力[8,32,33]
    因此,不区分质量的模仿学习可能同时拟合有效片段和次优片段
  2. 离线强化学习以及近期的离线到在线方法通过使用价值函数,从离线数据和在线rollouts 中挖掘更高质量的行为,从而缓解这一局限[3,23,26,34,35]

    然而,现有工作主要通过最终策略性能来评估异质数据的利用效果,对于价值估计本身的可靠性以及这种可靠性如何影响后续学习仍不清晰
    作者通过将价值估计视为异质机器人数据与策略学习之间的接口来弥补这一空白,使混合质量的轨迹能够被纳入策略优化过程

其次,对于离线到在线强化学习

离线到在线强化学习将离线强化学习的高样本效率与在线交互的适应性相结合 [1,36]

  1. 其中一个关键挑战是分布偏移:一旦部署,基于离线数据训练得到的策略可能会访问在数据中覆盖不足的状态与动作,从而导致价值评估网络(critic)失准,以及在线更新过程的不稳定 [37,38]
  2. 现有方法通常通过在离线策略周围约束在线自适应范围,并在离线数据与在线数据的使用之间进行平衡,在安全适应的同时保留有用的先验 [3,22],以缓解这一问题

    然而,这些研究多在小规模基准上进行评估。近期基于 VLA 的机器人系统 [23,26,28] 将离线到在线学习扩展到大规模通用策略,但主要汇报最终性能,对价值估计的稳定性及其设计依赖性缺乏深入探究

在本文中,作者构建了 Robo-ValueRL 框架,以系统性研究价值估计如何影响离线策略预训练和在线性能提升,并探讨能否在下游策略学习之前诊断价值函数的可靠性

最后,对于机器人操作中的价值估计

价值估计在机器人操作中处于核心地位,其中评论器(critic)为策略改进提供长时域信号。从时序差分学习与线性近似,到用于视觉控制的深度强化学习[25,39–44],价值函数传统上都作为与策略耦合的评论器进行学习

  1. 近期工作则转而训练通用价值函数,在不同目标、任务和数据集上评估任务进展与行为质量[45–48]

    其中,基于目标的价值函数、successor representations 以及 world-value models 进一步提升了价值预测的可迁移性[27,49–51]
  2. 然而,评估方法尚未跟上:现有度量(如 GVL 中的 Value-Order Correlation 以及VIP 中的平滑性)主要衡量最优轨迹[27,48],而同时期的工作虽然研究了多样的次优价值估计,却主要通过带过滤的行为克隆进行验证[51]

相比之下,作者训练了一个基于历史条件的信息进行估计的价值函数,并提出全局任务层面的进度度量与局部动作层面的偏好度量,用于评估其在离线到在线学习全过程中的作用

1.2 Robo-ValueRL

作者提出了 Robo-ValueRL,这是一个以可靠价值估计为核心、从离线到在线一体化的机器人强化学习框架

  1. Robo-ValueRL 首先训练一个基于历史条件的价值估计器,从视觉观测和历史信息中推断归一化的任务进度,并利用价值差分来构造动作质量指示信号,用于质量条件的 VLA 一致性策略预训练
  2. 在在线改进阶段,作者冻结预训练策略,仅基于真实环境交互数据学习一个轻量级残差适配器,从而在保持离线先验的同时,实现有针对性的适应

    且作者进一步引入价值可靠性度量,用于评估全局的任务阶段排序以及局部的动作级偏好,从而将价值质量与离线扩展性和在线策略改进关联起来

1.2.1 历史条件化价值估计器

在长时域机器人操作任务中,单帧价值估计本质上是含糊不清的,因为遮挡和重复的视觉模式会导致不同任务阶段在视觉上看起来相似

为了解决这一问题,作者提出了一种历史条件化的价值估计器,它将当前的视觉观测与过去观测的紧凑表示进行融合,从而实现更可靠的价值预测,具体实现细节见附录 C.1

  1. 价值估计器使用一个带有轻量级Transformer 价值头f_{\theta}^{v} 的PaliGemma 视觉-语言骨干网络[52]
    在时间步t ,当前的三视角观测o_{t}  和语言指令l 由PaliGemma 处理,以生成一个视觉-语言条件上下文\mathrm{c}_{t}^{v},其作为后续价值估计的VLM 生成前缀表示
  2. 进一步地,视觉历史h_{t} 通过一个SigLIP 编码器[53] 进行编码,并使用轻量级Perceiver 模块[54] 被汇总为紧凑的token \tilde{\mathbf{H}}_{t}

    为了预测任务价值,作者将一个可学习的价值查询\mathbf{q}_{v}  附加到\tilde{\mathbf{H}}_{t} 上,并采用一个以\mathbf{c}_{t}^{v} 为条件的基于transformer 的价值头
    该网络在K 个离散化价值区间\left\{b_{k}\right\}_{k=1}^{K}上输出一个类别分布:

    p_{\theta}\left(k \mid o_{t}, h_{t}, \ell\right)=\operatorname{softmax}_{k}\left(f_{\theta}^{v}\left(\mathbf{c}_{t}^{v}, \tilde{\mathbf{H}}_{t}, \mathbf{q}_{v}\right)\right)

首先,是训练方法

作者使用归一化的进度值v_{t}^{*} \in[0,1]来监督估计器

作者采用HL-Gaussian 分布表示[26, 55],目标v_{t}^{*}被投影到分箱上,作为一个软分布

q_{k}\left(v_{t}^{*}\right) \propto \exp \left(-\frac{\left(v_{t}^{*}-b_{k}\right)^{2}}{2 \sigma^{2}}\right)

数值头通过交叉熵损失进行优化:

\mathcal{L}_{v}=-\sum_{k=1}^{K} q_{k}\left(v_{t}^{*}\right) \log p_{\theta}\left(k \mid o_{t}, h_{t}, \ell\right)

在推理过程中,最终的标量值估计被解码为对各个区间的期望:

\hat{v}_{t}=V_{\theta}\left(o_{t}, h_{t}, \ell\right)=\sum_{k=1}^{K} b_{k} \cdot p_{\theta}\left(k \mid o_{t}, h_{t}, \ell\right)

其次,对于动作质量指示器

价值估计器提供稠密的动作质量指示,用于指导离线强化学习和在线微调

  1. 直观地说,如果一个动作能够提升估计的任务进度,则认为该动作是有益的
    形式上,对于从tt+\Delta的转移,作者将价值提升计算为

    \Delta v_{t}=V_{\theta}\left(o_{t+\Delta}, h_{t+\Delta}, \ell\right)-V_{\theta}\left(o_{t}, h_{t}, \ell\right)
  2. 然后作者通过使用预先定义的正、负边界\delta_{+}\delta_{-}\Delta v_{t}进行阈值分割,来分配离散的动作质量指示器q_{t}^{\text {act }} \in\{0,1,2\}(分别表示低质量、中性和高质量动作)

1.2.2 质量条件化的视觉-语言-动作模型

给定从离线经验中估计得到的动作质量指标,作者在异质示范上训练一个以质量为条件的VLA 模型πθ,并配备一个一致性策略头f_{\theta}^{a}该策略学习将动作模式与估计的质量关联起来,从而将高质量行为与次优片段区分开来

在推理过程中,期望的质量提示引导策略朝向高质量的动作生成,而一致性头则实现一步去噪以支持高效的实时控制。更多实现细节见附录C.2

  1. 具体来说,质量条件VLA 模型πθ 使用PaliGemma 作为视觉-语言骨干网络,并采用一致性策略头f_{\theta}^{a}作为动作专家

    对于质量这个条件
    在时间步 t,为了将基于价值的质量信息注入到语言条件策略中,作者首先将动作质量指示器q_{t}^{\text {act }} 转换为文本形式的动作质量提示\ell_{t}^{\text {act }},并将其与任务指令 l 拼接以形成\ell_{t}^{\mathrm{qc}}=\left[\ell ; \ell_{t}^{\mathrm{act}}\right]
  2. 进一步地,VLM 模型将多视角观测o_{t}质量条件的语言输入\ell_{t}^{\mathrm{qc}} 作为输入
    生成用于动作生成的视觉-语言上下文\mathbf{c}_{t}^{a}

为了实现高效的动作生成,作者将动作专家f_{\theta}^{a} 实例化为一致性策略[29]。在条件为VLM 生成的动作上下文\mathbf{c}_{t}^{a} 和机器人状态s_{t}  的情况下,该策略将噪声动作块\mathbf{x}_{\sigma_{i}}(噪声级别为\sigma)直接映射到对应的干净动作块:

\hat{\mathbf{x}}_{0}=f_{\theta}^{a}\left(\mathbf{x}_{\sigma_{i}}, \sigma_{i}, s_{t}, \mathbf{c}_{t}^{a}\right)

在推理过程中,作者从\mathbf{x}_{\sigma_{\max }} \sim \mathcal{N}\left(0, \sigma_{\max }^{2} I\right)中采样,并通过单次去噪步骤获得最终动作,从而实现低延迟的实时机器人执行

进一步而言,对于训练方案。质量条件的VLA 模型πθ 通过联合目标进行优化,该目标结合了动作重建和相邻噪声自一致性

  1. 给定真实动作片段\mathbf{x}_{0},作者从Karras 噪声调度中采样一个噪声水平\sigma_{i} 来构造带噪声的动作片段:\mathbf{x}_{\sigma_{i}}=\mathbf{x}_{0}+\sigma_{i} \boldsymbol{\epsilon},其中\epsilon \sim \mathcal{N}(0, I)

    模型首先通过动作重建损失进行监督:

    \mathcal{L}_{\mathrm{act}}=\left\|\pi_{\theta}\left(\mathbf{x}_{\sigma_{i}}, \sigma_{i}, s_{t}, o_{t}, \ell_{t}^{\mathrm{qc}}\right)-\mathbf{x}_{0}\right\|_{2}^{2}
  2. 进一步在相邻噪声水平\sigma_{i}\sigma_{i+1}之间施加自洽性,以在去噪轨迹上对齐干净动作预测
    \sigma_{i} 处的预测通过一步求解器传播到\tilde{\mathbf{x}}_{\sigma_{i+1}},从而得到一致性损失:

    \mathcal{L}_{\text {cons }}=w\left(\sigma_{i}\right)\left\|\pi_{\theta}\left(\mathbf{x}_{\sigma_{i}}, \sigma_{i}, s_{t}, o_{t}, \ell_{t}^{\mathrm{qc}}\right)-\operatorname{sg}\left[\pi_{\bar{\theta}}\left(\tilde{\mathbf{x}}_{\sigma_{i+1}}, \sigma_{i+1}, s_{t}, o_{t}, \ell_{t}^{\mathrm{qc}}\right)\right]\right\|_{2}^{2}
     

    其中
    w\left(\sigma_{i}\right)是一个与噪声相关的加权项
    \operatorname{sg}[\cdot]表示停止梯度操作
    \pi_{\bar{\theta}} 通过对在线模型\pi_{\theta} 进行指数滑动平均来更新
    这种一致性正则化鼓励完整的VLA 模型在相邻噪声水平上产生稳定的干净动作预测,使得学习到的策略在推理时能够用单步去噪近似多步去噪

  3. 最终的联合训练目标由超参数λ cons 进行平衡:

    \mathcal{L}=\mathcal{L}_{\mathrm{act}}+\lambda_{\mathrm{cons}} \mathcal{L}_{\mathrm{cons}}

1.2.3 在线残差策略自适应

在线rollouts 为策略改进提供了有价值的交互数据,但直接在异构rollouts 上微调预训练的VLA 策略会破坏优化稳定性,并导致对先验已学行为的灾难性遗忘

因此,作者冻结离线训练的基础策略\pi_{\theta}^{\text {base }},并引入一个轻量级的残差适配器h_{\phi},它预测对基础动作的有界修正,从而在保留预训练先验的同时,利用在线经验实现有针对性的适应。更多的结构和训练细节见附录C.3

给定来自冻结基础策略\pi_{\theta}^{\text {base }}的动作片段\hat{\mathbf{x}}_{t}^{\text {base }},残差适配器h_{\phi} 预测一个有界校正以对其进行细化

具体而言,适配器将VLA 动作上下文\mathbf{c}_{t}^{a} 压缩为紧凑的潜在上下文token,使用一个Perceiver 模块[54],将它们与机器人状态st 和基础动作预测\hat{\mathbf{x}}_{t}^{\text {base }} 拼接起来,并将结果输入到一个轻量级Transformer 中,以预测一个不受约束的残差\tilde{\mathbf{r}}_{t} 和一个逐步门控logit \tilde{\mathbf{g}}_{t}

\left(\tilde{\mathbf{r}}_{t}, \tilde{\mathbf{g}}_{t}\right)=h_{\phi}\left(\mathbf{c}_{t}^{a}, s_{t}, \hat{\mathbf{x}}_{t}^{\text {base }}\right)

其中将残差约束为\mathbf{r}_{t}=r_{\max } \tanh \left(\tilde{\mathbf{r}}_{t}\right)并使用sigmoid 函数约束门控为\mathbf{g}_{t}=\sigma\left(\tilde{\mathbf{g}}_{t}\right),最终自适应得到的动作块计算为:

\hat{\mathbf{x}}_{t}^{\text {adapt }}=\hat{\mathbf{x}}_{t}^{\text {base }}+\mathbf{g}_{\mathbf{t}} \odot \mathbf{r}_{\mathbf{t}}

进一步,对于训练步骤而言

仅使用离线示范\mathcal{D}_{\mathrm{off}} 和在线rollouts \mathcal{D}_{\mathrm{on}}  的混合来训练残差adapter h_{\phi},同时保持基础VLA 策略\pi_{\theta}^{\text {base }}冻结

首先使用学到的价值估计器,根据估计的动作质量指示器q_{t}^{\text {act }} 将在线rollouts 划分为高质量样本\mathcal{D}_{\mathrm{on}}^{+} 低质量样本\mathcal{D}_{\mathrm{on}}^{-}

  • 对于来自\mathcal{D}_{\mathrm{on}}^{+} 的高质量在线样本,校正损失
    \mathcal{L}_{\text {corr }}=\mathbb{E}_{\mathcal{D}_{\text {on }}^{+}}\left[\left\|\hat{\mathbf{x}}_{t}^{\text {adapt }}-\mathbf{x}_{t}\right\|_{2}^{2}\right]
    鼓励自适应动作朝向成功的在线行为移动
为方便大家更好的理解,我用一个表格 帮大家总结下

符号

出处

含义

x_0

§3.2 Training Recipe

ground-truth action chunk(离线演示中的真实动作块)

\hat{x}_t^{\text{base}}

§3.3

冻结基座策略 \pi_\theta^{\text{base}} 预测的动作块

\hat{x}_t^{\text{adapt}}

式 (7)

适配后动作块=\hat{x}_t^{\text{base}}+\mathbf{g}_t\odot\mathbf{r}_t

x_t(无 hat、无下标 0)

\mathcal{L}_{\text{corr}}

合理推断:xt​ 指的是高质量在线 rollout(Don+​ )中实际执行并记录下来的动作块

因为后文紧接着说该损失"encourages the adapted action to move toward successful online behaviors"——

即让适配动作逼近那些被价值估计器判定为高质量的在线轨迹里实际执行的动作

这里有两个值得注意的疑点

  1. 符号不一致:§3.2 中 ground-truth chunk 用 x0​ (对应 consistency policy 的去噪记号),到 §3.3 突然换成 xt​ ,二者指代的应是同类对象(真实动作块),作者没有交代记号切换

  2. 监督目标的"真值"性质存疑:在线 rollout 的动作是策略自己执行出来的,并非人工示范真值
    q_{t}^{\text {act }} 筛出"高质量"样本后对其做 BC,本质上是对成功在线行为的自蒸馏/加权行为克隆,论文 §6(p16)也承认存在 "learning corrections from low-quality samples without ground-truth corrected actions" 的问题

  • 对于来自\mathcal{D}_{\text {off }}的离线样本,行为保持损失

    \mathcal{L}_{\text {keep }}=\mathbb{E}_{\mathcal{D}_{\text {off }}}\left[\left\|\hat{\mathbf{x}}_{t}^{\text {adapt }}-\hat{\mathbf{x}}_{t}^{\text {base }}\right\|_{2}^{2}\right]

    使自适应动作保持接近冻结的基础动作\hat{\mathbf{x}}_{t}^{\text {base }} ,防止残差adapter 偏离预训练行为先验
  • 且进一步引入门控损失

    \mathcal{L}_{\text {gate }}=\mathbb{E}_{\mathcal{D}_{\text {on }}^{+} \cup \mathcal{D}_{\text {off }}}\left[\operatorname{CE}\left(\mathrm{g}_{t}, y_{t}^{g}\right)\right]

    来调节何时应激活残差校正

最终的adapter 目标为:

\mathcal{L}_{\text {adapter }}=\mathcal{L}_{\text {corr }}+\lambda_{\text {keep }} \mathcal{L}_{\text {keep }}+\lambda_{\text {gate }} \mathcal{L}_{\text {gate }}

1.2.4 价值-可靠性度量指标

为了系统地诊断价值函数的可靠性,作者建立了一套评估协议,从全局任务层面的进展和局部动作层面的偏好两个维度全面评估已学习的价值函数

给定一个预测价值序列\left\{\hat{v}_{t}\right\},该评估套件可以检验模型在判断任务推进、识别高质量动作以及检测执行错误方面的能力

首先,对于全局任务级进度

该诊断衡量价值函数是否保留了任务进度的粗略排序。给定子目标边界时间步\left\{b_{0}, \ldots, b_{K}\right\},提取每个区间的中点为m_{j}=\widehat{v}_{\left\lfloor\left(b_{j}+b_{j+1}\right) / 2\right\rfloor}

由于后面的区间对应于更高级的任务阶段,一个可靠的价值函数应当为后面的子目标分配更高的值,即m_{j+1}>m_{j}

作者将中点排序率(Midpoint Ordering Rate,MOR)定义为满足该排序关系的相邻子目标转移所占的比例:\mathrm{MOR}=\frac{1}{K-1} \sum_{j=0}^{K-2} \nVdash\left[m_{j+1}>m_{j}\right]

其次,对于局部动作层面的偏好

该诊断用于评估价值函数在局部轨迹上的动作层估计是否稳定且准确。一个可靠的价值函数在任务成功执行期间应当保持平滑、连续的估计,同时对偏离稳定任务进展的异常行为给予显著的惩罚。作者使用两个互为补充的度量指标来刻画这种行为:

  1. 流畅性:在成功的执行路径上,预测的数值序列应当平滑上升,而突然向下的跳变则表明数值估计存在噪声或不稳定

    为了量化这种局部流畅性,作者评估这些时间振荡的频率和严重程度[27]
    \rightarrow  具体而言,作者将Bump Ratio 定义为\frac{1}{T-1} \sum_{t} \nVdash\left[\hat{v}_{t+1}<\hat{v}_{t}-\epsilon_{v}\right],,用于度量预期的上升趋势被超过一个小的噪声容忍阈值ϵv 所违背的频率

    \rightarrow  同时,计算Bump Magnitude 为\frac{1}{T-1} \sum_{t} \max \left(0, \hat{v}_{t}-\hat{v}_{t+1}\right)以刻画这些向下跌落的平均幅度,从而量化价值信号的整体稳定性
  2. 时间误差辨别:流畅性度量的是在成功执行过程中的稳定性,而时间误差辨别则评估价值函数是否能够可靠地惩罚偏离正常任务进度的行为从而防止错误行为被赋予过于乐观的动作质量估计

    \rightarrow  对于每一段标注的错误片段E,作者从错误发生前的价值轨迹构造一个正常进度参考\hat{v}_{i}^{\mathrm{ref}},表示在任务不被打断的情况下所期望的价值
    \rightarrow  然后将这一参考与平滑后的预测\tilde{v}_{i} 进行比较,并将价值缺口定义为\delta_{i}=\hat{v}_{i}^{\text {ref }}-\tilde{v}_{i},其中\delta_{i}>0 意味着在正常进度下的预期之上,估计器给出了更低的价值

    报告误差敏感度S=\max _{i \in \mathcal{E}} \delta_{i}以衡量价值缺口的峰值,并报告误差斜率\alpha=\operatorname{slope}\left(\left\{\delta_{i}\right\}_{i \in \mathcal{E}}\right)以衡量该缺口在错误执行过程中是否得以持续

1.3 实验

在本研究中,作者探究如何从异质机器人数据中学习到可靠的价值函数,以及价值函数的可靠性如何在离线预训练和在线改进过程中影响策略学习

作者在两个具有挑战性的真实世界操作任务上评估 Robo-ValueRL,这些任务包含 240 小时的异质离线示范数据和超过 3,000 条在线 rollout 轨迹,如图 3 所示

  • a)芯片插入:一个长时序、细粒度的任务,机器人需要抓取一块PCB,将其调整到一个可行姿态,然后将芯片插入到PCB底板下方凹槽内、毫米级尺寸的插槽中,如红色圆圈所示
  • b)方块拆解:机器人拆解随机摆放的方块,并将其根据颜色匹配放置到布局随机的对应颜色托盘上,该任务需要具有可泛化的双臂协作能力

如此,既涵盖了既需要高精度的细粒度操作,又要求具备可泛化的双臂协作能力

如原论文所述,在这一实验设定的基础上,作者围绕三个逐步递进且相互关联的问题展开研究:

  1. 1) 如何对价值可靠性进行诊断?
    在下文第 1.3.1 节中,作者评估价值可靠性度量,并考察它们与下游策略成功之间的一致性
  2. 2) 价值可靠性如何影响离线预训练?
    在下文第 1.3.2 节中,作者在不同数据规模和质量阈值下比较基于价值引导的预训练,展示高可靠性的价值如何提升从异质示范中学习的效果
  3. 3) 价值的可靠性如何影响在线改进?
    在下文第 1.3.3 节中,作者研究了结合价值引导的 rollout 过滤的迭代式在线自适应过程,表明可靠的价值评估能够稳定基于真实世界交互的策略改进

最后,在下文第 1.3.4 节中,作者给出了与定量结果相辅相成的定性证据,表明机器人通过Robo-ValueRL 线上线下结合强化学习框架,学会了高效的执行方式以及自主的自我纠错模式

// 待更

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐