Ashvin Nair的博士论文Scalable Robot Learning 第2章 RIG
Ashvin Nair的博士论文Scalable Robot Learning 第2章
论文信息: 《Visual Reinforcement Learning with Imagined Goals》
作者: Ashvin Nair*, Vitchyr Pong*, Murtaza Dalal, Shikhar Bahl, Steven Lin, Sergey Levine (UC Berkeley)
核心方法: RIG (Reinforcement Learning with Imagined Goals)
1. 研究背景
1.1 强化学习的通用困境
标准深度强化学习(RL)框架通常针对单个特定任务学习策略,每个任务需要:
- 人工设计奖励函数(如根据物体与目标位置的距离设计奖励)
- 额外的感知系统(如物体检测器、关节角度传感器等)
- 对每个新任务重复进行RL训练过程
这种方式在模拟环境中尚且可行,但在真实世界中变得极其不切实际:奖励工程和传感器系统的部署成本高昂且脆弱。
1.2 人类学习的启示
人类能够在无需显式监督训练的情况下完成许多任务:
- 自主设定目标(从婴儿期的简单抓握到复杂的物体操作)
- 通过与环境交互学习经验
- 将习得的技能泛化到新的用户指定任务
论文的核心动机是:能否构建一个像人类一样能够自主设定目标、自主学习技能的RL系统?
1.3 视觉输入的挑战
直接使用原始图像作为RL的输入面临两大挑战:
- 像素级距离无意义:两幅图像的像素均方误差(MSE)不对应真实状态间的语义距离
- 样本复杂度极高:端到端的无模型RL处理图像输入需要海量样本,难以在真实机器人上应用
2. 解决的问题
本文解决的核心问题是:如何仅从原始图像输入中,无需人工监督和额外传感器,让智能体自主学习通用的目标条件化技能(goal-conditioned skills)?
具体而言,论文同时解决了以下三个子问题:
| 问题 | 挑战 |
|---|---|
| 目标设定问题 | 在视觉任务中,如何自动生成有意义的目标图像?如何定义目标采样分布p(g)? |
| 奖励设计问题 | 如何定义视觉任务的奖励函数?像素级距离不反映语义相似性 |
| 样本效率问题 | 如何提高视觉RL的样本效率,使其能够在真实机器人系统上训练? |
与现有工作的区别:
- 先前的目标重标记方法(如HER)使用真实状态(如笛卡尔坐标),需要人工设计奖励和目标分布
- 先前的视觉RL方法通常依赖地面真值状态信息或仪器化的模拟环境
- 本文是首个在真实机器人系统上,仅使用图像输入、无地面真值的无模型目标条件化RL方法
3. 核心算法:RIG (Reinforcement Learning with Imagined Goals)
3.1 整体框架
RIG通过联合学习无监督表示学习和目标条件化策略来实现自主技能获取。整体流程包含三个核心组件:
原始图像 → VAE编码器 → 潜在空间z → 目标条件化Q-learning → 策略
↑ ↓
└──── 采样想象目标 ←────┘
(目标重标记)
3.2 关键组件:变分自编码器(VAE)
VAE是整个方法的基石,承担三重互补作用:
作用1:状态量从潜在空间提取
- 将高维图像x编码为低维潜在变量z(
z = E_φ(x)),作为状态量s,而不是直接取图像x作为状态量。 - 目标量也从潜在空间中采样,而不是直接从图像空间中采样。
- 原本图像维度非常高,RL在低维空间学Q函数和策略收敛更快,大幅提升学习效率。
作用2:目标可以被想象
- VAE的先验分布p(z)被设计为标准高斯分布N(0, I)
- 智能体可直接从先验中采样潜在目标
z_g ~ p(z),即"想象"目标 - 这些采样的潜在目标通过解码器可映射回有意义的图像空间
作用3:奖励设计——使用潜在空间欧氏距离
论文对奖励函数进行了严格的理论推导和实验对比,最终选择潜在空间负欧氏距离作为奖励。
奖励形式:
r(z, z_g) = -||z - z_g||²₂
其中 z = E_φ(x) 是当前图像的编码,z_g = E_φ(x_g) 是目标图像的编码(或想象目标采样)。
为何选择欧氏距离(论文中的理论依据):
-
对比马氏距离(Log Probability奖励):
论文还考虑了使用编码器后验分布的精度矩阵的马氏距离作为奖励(即负对数概率形式):r_Mahalanobis(z, z_g) = -(z - z_g)ᵀ Σ_g⁻¹ (z - z_g)但消融实验发现效果更差。
-
对比像素MSE:
像素空间-||x - x_g||²₂的问题在于:两幅语义相近的图像(物体同位置但光照微变)像素差异可能极大;而语义差异大的图像反而可能像素差异小。奖励信号与任务目标不单调对齐,导致RL几乎无法学习。
3.3 VAE微调策略
论文中的VAE并非在训练开始前一次性训练完毕后就固定不变,而是在RL训练过程中进行周期性微调。这是保证潜在表示持续适配RL需求的关键设计。
微调的动机:
- 初始VAE仅由随机策略收集的少量图像训练得到,覆盖的状态分布有限
- RL策略改进后,智能体开始访问新的状态区域(尤其是接近目标的区域),这些区域初始VAE未见过,编码质量差
- 若不微调,VAE在新状态区域的潜在空间结构会扭曲,导致奖励计算和目标想象都出现偏差
3.4 事后目标重标记(类似HER但更通用)
- HER只能从同一条轨迹中采样目标,目标多样性受限。
- 直接从想象目标中采样,目标更加丰富。
最终算法是将两者混合。消融实验中,对比了RIG与HER在样本的差异。仅使用HER或想象的目标,其效果差不多。而将两者0.5比例进行混合,大幅提升效果。
3.5 完整算法流程

4. 实验验证
4.1 真实机器人实验结果
- 到达任务:仅需约1小时真实交互时间即可收敛
- 推物体任务:约4.5小时真实交互时间
- 两种任务均无需额外训练即可泛化到用户指定的新目标图像
5 主要贡献
-
提出RIG框架:首个将无监督表示学习(VAE)与目标条件化RL完整结合的方法,实现了从纯视觉输入的自主技能学习
-
VAE的三重创新使用:
- 学习结构化表示降低RL维度
- 提供想象目标采样机制实现自主练习
- 提供语义空间距离作为奖励信号
-
追溯式目标重标记:基于VAE潜在先验的目标重标记大幅提升离线RL的样本效率
-
真实机器人验证:在Sawyer机器人上成功实现仅用图像输入的到达和推动任务,证明方法的现实可行性
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐


所有评论(0)