Ashvin Nair的博士论文Scalable Robot Learning 第3章 CC-RIG

论文信息

  • 论文:Contextual Imagined Goals for Self-Supervised Robotic Learning

一、研究背景

1.1 前作 RIG 的局限(本文的核心问题来源)

本文是 “Visual Reinforcement Learning with Imagined Goals”(RIG,Nair et al., NeurIPS 2018) 的后续工作。RIG 的核心流程为:

  1. 收集交互数据 {s_t}
  2. 在该数据上训练一个 VAE,学习状态的潜在表示;
  3. 从 VAE 的先验中采样"想象的目标" z_g ~ N(0, I)
  4. 训练目标条件策略去到达这些想象的目标。

RIG 的关键局限:从 VAE 先验中采样目标,隐含地假设数据集中任意状态在任何时刻都是可达的。在单一环境的简单设置下,该假设近似成立(任何过去访问过的状态都是合理目标)。

但在真实世界中,机器人会与视觉上高度多样的场景和物体交互,每次 trial 的初始场景、物体可能都不同。此时该假设失效:

例如:若场景中只有蓝色 方块,机器人从 VAE 先验采样出的目标可能要求它去推动一个红色 方块——但场景里根本没有红色 方块。这种不可达目标会导致策略训练无法进行有效学习。

论文实验也表明,这种"不可行目标"问题会严重阻碍学习,使标准 RIG 在视觉多样的环境中无法超越初始随机策略的水平。


二、算法

2.1 核心思想

在视觉复杂的场景中,表示场景中的所有元素对于控制往往是不必要的。

  • 场景(context) 是一种视觉形式的上下文,可以因子化掉;
  • 只有环境中可控制的实体(如物体位置)才需要被捕捉,用于目标设定和状态表示。

为此,本文提出一个 context-conditioned generative model(上下文条件生成模型),对之前工作中的VAE修改为CVAE,用 rollout 的初始状态 s_0 作为输入条件 c,要求在条件 s_0下想象的目标,该模型称为 CC-VAE(Context-Conditioned VAE)

网络结构

  • 初始图像 s_0 通过一个卷积编码器 e_0 编码为紧凑表示 z_c(context);
  • 当前状态 s_t 通过另一个编码器 e 编码为潜在变量 z_t
  • ee_0 不共享权重,因为它们设计用于编码图像中不同的变化因素;
  • context z_c 用于:① 输出潜在表示 z_t;② 重建当前状态 ŝ_t;③ 单独(确定性)解码出 ŝ_0 = d_0(z_c)

目标函数

LCC-VAE=LCVAE+log⁡p(s0∣zc) \mathcal{L}_{\text{CC-VAE}} = \mathcal{L}_{\text{CVAE}} + \log p(s_0 | z_c) LCC-VAE=LCVAE+logp(s0zc)

其中 CVAE 损失为:

LCVAE=−Eqϕ(z∣s,c)[log⁡p(s∣z,c)]+βDKL(qϕ(z∣s,c)∥p(z)) \mathcal{L}_{\text{CVAE}} = -\mathbb{E}_{q_\phi(z|s,c)}[\log p(s|z,c)] + \beta D_{KL}(q_\phi(z|s,c) \| p(z)) LCVAE=Eqϕ(zs,c)[logp(sz,c)]+βDKL(qϕ(zs,c)p(z))

信息瓶颈的关键作用

  • 由于 z_t 上施加了信息瓶颈(KL 项惩罚 z_t 上的信息量),损失函数会惩罚通过 z_t 传递的信息
  • 但允许从 z_c 到输出的信息无限制地流动
  • 因此,最优解会尽可能多地把信息编码到 z_c(即场景不变的上下文,如物体颜色、外观、背景),而只把 trajectory 内变化的状态信息放在 z_t(即可控的物体位置)。

这正是控制所最关心的特征:上下文(不可控)与可控行为(位置变化)的解耦

2.2 CC-RIG:Context-Conditioned RIG 算法

在这里插入图片描述

三、实验

3.1 仿真实验 1:Multi-color Pusher

  • 环境:MuJoCo 中的 multi-color pusher,Sawyer 机械臂将圆形 puck 推到目标位置;
  • 设置:每个 rollout 中,puck 颜色随机生成 RGB 值。因此目标生成必须考虑 puck 颜色——若场景中只有蓝 puck,目标是推红 puck 到某位置是不可行的。

对比方法

  • CC-RIG:本文方法(CC-VAE 表示学习);
  • RIG:标准 RIG(标准 VAE);
  • Oracle:直接用 ground-truth 状态的 goal-conditioned RL,作为性能上界参考。

结果

  • CC-RIG 显著优于 RIG
  • 标准 RIG 无法超过初始随机策略的水平(印证了不可达目标的危害);
  • CC-RIG 性能接近 Oracle,说明在视觉多样环境中,只要用表示学习把视觉复杂性因子化掉,并使目标与场景一致,自监督学习是可行的。

3.2 仿真实验 2:2D Navigation(同时变化外观与动力学)

  • 环境:2D 导航任务,点机器人绕障碍物导航;
  • 变化因素:障碍物布局从 15 种配置中选取,点机器人颜色随机 RGB
  • 该实验同时变化视觉外观和物理动力学。

结果(Figure 2 右):

  • CC-RIG 需要更多样本,但最终接近 Oracle 性能
  • RIG 性能停滞在较差水平

3.3 CC-VAE 目标采样质量分析

为理解 CC-RIG 为何优于 RIG,比较两个模型的采样质量(Figure 3):

  • CC-VAE 的样本:保持初始状态的背景、物体形状、物体颜色——目标在场景中是连贯且有意义的
  • 标准 VAE 的样本:可能生成与场景不一致的物体(颜色、形状错配)。

这说明 CC-VAE 能成功把场景特定的物体身份因子化,只变化物体位置,从而可用于视觉多样场景中的目标生成。同时表明潜在空间结构良好,潜在距离可作为 goal-reaching 的良好奖励函数

3.4 真实世界机器人实验

  • 任务:Sawyer 机器人将不同物体推到目标位置(一个 bin 中每次放一个物体),训练阶段自监督,测试阶段给定目标图像。
  • 训练数据:20 个物体;先用随机动作收集大数据训练 CC-VAE,再收集少量 on-policy 数据微调策略。
  • 数据增强:为应对一天中不同时间的光照变化,对 (s_0, s_t) 对应用 color jitter 滤镜。
  • 测试设置:包括训练时见过的物体,以及未见过的新物体(novel objects)

结论

  • CC-RIG 在所有指标上均优于 RIG
  • CC-RIG 在未见过的新物体上同样优于 RIG,甚至指标更好——说明方法具备对未见物体的泛化能力
  • CC-VAE 学会生成正确物体的目标,且对光照变化具有鲁棒性(color jitter 增强);
  • 关键观察:每列样本中物体类型、亮度、背景不变(这些信息在 z_c 中),但物体位置变化(这些信息在 z_t 中),印证了上下文与可控因子的解耦。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐