Ashvin Nair的博士论文Scalable Robot Learning 第3章 CC-RIG
Ashvin Nair的博士论文Scalable Robot Learning 第3章 CC-RIG
论文信息
- 论文:Contextual Imagined Goals for Self-Supervised Robotic Learning
一、研究背景
1.1 前作 RIG 的局限(本文的核心问题来源)
本文是 “Visual Reinforcement Learning with Imagined Goals”(RIG,Nair et al., NeurIPS 2018) 的后续工作。RIG 的核心流程为:
- 收集交互数据
{s_t}; - 在该数据上训练一个 VAE,学习状态的潜在表示;
- 从 VAE 的先验中采样"想象的目标"
z_g ~ N(0, I); - 训练目标条件策略去到达这些想象的目标。
RIG 的关键局限:从 VAE 先验中采样目标,隐含地假设数据集中任意状态在任何时刻都是可达的。在单一环境的简单设置下,该假设近似成立(任何过去访问过的状态都是合理目标)。
但在真实世界中,机器人会与视觉上高度多样的场景和物体交互,每次 trial 的初始场景、物体可能都不同。此时该假设失效:
例如:若场景中只有蓝色 方块,机器人从 VAE 先验采样出的目标可能要求它去推动一个红色 方块——但场景里根本没有红色 方块。这种不可达目标会导致策略训练无法进行有效学习。
论文实验也表明,这种"不可行目标"问题会严重阻碍学习,使标准 RIG 在视觉多样的环境中无法超越初始随机策略的水平。
二、算法
2.1 核心思想
在视觉复杂的场景中,表示场景中的所有元素对于控制往往是不必要的。
- 场景(context) 是一种视觉形式的上下文,可以因子化掉;
- 只有环境中可控制的实体(如物体位置)才需要被捕捉,用于目标设定和状态表示。
为此,本文提出一个 context-conditioned generative model(上下文条件生成模型),对之前工作中的VAE修改为CVAE,用 rollout 的初始状态 s_0 作为输入条件 c,要求在条件 s_0下想象的目标,该模型称为 CC-VAE(Context-Conditioned VAE)。
网络结构:
- 初始图像
s_0通过一个卷积编码器e_0编码为紧凑表示z_c(context); - 当前状态
s_t通过另一个编码器e编码为潜在变量z_t; e与e_0不共享权重,因为它们设计用于编码图像中不同的变化因素;- context
z_c用于:① 输出潜在表示z_t;② 重建当前状态ŝ_t;③ 单独(确定性)解码出ŝ_0 = d_0(z_c)。
目标函数:
LCC-VAE=LCVAE+logp(s0∣zc) \mathcal{L}_{\text{CC-VAE}} = \mathcal{L}_{\text{CVAE}} + \log p(s_0 | z_c) LCC-VAE=LCVAE+logp(s0∣zc)
其中 CVAE 损失为:
LCVAE=−Eqϕ(z∣s,c)[logp(s∣z,c)]+βDKL(qϕ(z∣s,c)∥p(z)) \mathcal{L}_{\text{CVAE}} = -\mathbb{E}_{q_\phi(z|s,c)}[\log p(s|z,c)] + \beta D_{KL}(q_\phi(z|s,c) \| p(z)) LCVAE=−Eqϕ(z∣s,c)[logp(s∣z,c)]+βDKL(qϕ(z∣s,c)∥p(z))
信息瓶颈的关键作用:
- 由于
z_t上施加了信息瓶颈(KL 项惩罚z_t上的信息量),损失函数会惩罚通过z_t传递的信息; - 但允许从
z_c到输出的信息无限制地流动; - 因此,最优解会尽可能多地把信息编码到
z_c(即场景不变的上下文,如物体颜色、外观、背景),而只把 trajectory 内变化的状态信息放在z_t(即可控的物体位置)。
这正是控制所最关心的特征:上下文(不可控)与可控行为(位置变化)的解耦。
2.2 CC-RIG:Context-Conditioned RIG 算法

三、实验
3.1 仿真实验 1:Multi-color Pusher
- 环境:MuJoCo 中的 multi-color pusher,Sawyer 机械臂将圆形 puck 推到目标位置;
- 设置:每个 rollout 中,puck 颜色随机生成 RGB 值。因此目标生成必须考虑 puck 颜色——若场景中只有蓝 puck,目标是推红 puck 到某位置是不可行的。
对比方法:
- CC-RIG:本文方法(CC-VAE 表示学习);
- RIG:标准 RIG(标准 VAE);
- Oracle:直接用 ground-truth 状态的 goal-conditioned RL,作为性能上界参考。
结果:
- CC-RIG 显著优于 RIG;
- 标准 RIG 无法超过初始随机策略的水平(印证了不可达目标的危害);
- CC-RIG 性能接近 Oracle,说明在视觉多样环境中,只要用表示学习把视觉复杂性因子化掉,并使目标与场景一致,自监督学习是可行的。
3.2 仿真实验 2:2D Navigation(同时变化外观与动力学)
- 环境:2D 导航任务,点机器人绕障碍物导航;
- 变化因素:障碍物布局从 15 种配置中选取,点机器人颜色随机 RGB。
- 该实验同时变化视觉外观和物理动力学。
结果(Figure 2 右):
- CC-RIG 需要更多样本,但最终接近 Oracle 性能;
- RIG 性能停滞在较差水平。
3.3 CC-VAE 目标采样质量分析
为理解 CC-RIG 为何优于 RIG,比较两个模型的采样质量(Figure 3):
- CC-VAE 的样本:保持初始状态的背景、物体形状、物体颜色——目标在场景中是连贯且有意义的;
- 标准 VAE 的样本:可能生成与场景不一致的物体(颜色、形状错配)。
这说明 CC-VAE 能成功把场景特定的物体身份因子化,只变化物体位置,从而可用于视觉多样场景中的目标生成。同时表明潜在空间结构良好,潜在距离可作为 goal-reaching 的良好奖励函数。
3.4 真实世界机器人实验
- 任务:Sawyer 机器人将不同物体推到目标位置(一个 bin 中每次放一个物体),训练阶段自监督,测试阶段给定目标图像。
- 训练数据:20 个物体;先用随机动作收集大数据训练 CC-VAE,再收集少量 on-policy 数据微调策略。
- 数据增强:为应对一天中不同时间的光照变化,对
(s_0, s_t)对应用 color jitter 滤镜。 - 测试设置:包括训练时见过的物体,以及未见过的新物体(novel objects)。
结论:
- CC-RIG 在所有指标上均优于 RIG;
- CC-RIG 在未见过的新物体上同样优于 RIG,甚至指标更好——说明方法具备对未见物体的泛化能力;
- CC-VAE 学会生成正确物体的目标,且对光照变化具有鲁棒性(color jitter 增强);
- 关键观察:每列样本中物体类型、亮度、背景不变(这些信息在
z_c中),但物体位置变化(这些信息在z_t中),印证了上下文与可控因子的解耦。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐



所有评论(0)