本章内容包括:行为克隆(Behavioral Cloning, BC)及其误差界与复合误差推导、交互式校正(DAgger)与其保证、逆强化学习(IRL)与最大熵 IRL 的推导、生成对抗模仿(GAIL)的形式化与等价性证明、离线 RL 的核心挑战与保守化(举例 CQL)的理论直觉与推导,以及示范引导的在线精调(IBRL / IBORL 类方法)的原理与样本复杂度层面的直观保证。

1. 行为克隆(Behavioral Cloning, BC)—— 有监督的还原、误差分解与“复合误差”界

1.1 问题与目标

1.2 从监督误差到回合代价差:基本引理与全步界

证明(逐步推导,Sketch but rigorous)


2. 交互式数据聚合(DAgger)—— 在线纠偏与近线性保证

2.1 算法要点

2.2 理论保证(No-regret reduction)

DAgger 将模仿学习归约为在线 no-regret 学习。核心结果:如果用于分类器训练的基础在线学习器具有无后悔(no-regret)性质,那么聚合策略的期望代价可以保证接近专家代价,并且误差项对 horizon TTT 的依赖是线性而不是二次(在合适条件下)。

证明要点(概念性)

实践含义: DAgger 要求能在训练时反复向专家询问动作标签(即需要专家在训练时在线参与),这在现实系统(真实机器人、人工专家昂贵)中可能不可行;但概念上指明了 BC 的主因并给出了解决策略。


3. 逆强化学习(IRL)与最大熵 IRL(MaxEnt IRL)—— 从示范到奖励函数的推导

3.1 IRL 问题形式化(Ng & Russell 2000)

3.2 最大熵 IRL 的原理与推导(Ziebart 等,2008)

最大熵 IRL 提供一种概率化、规范化的 IRL 框架:在满足“与专家的特征期望匹配”的约束下,选择熵最大的轨迹分布(即在不违背观测的最少偏置下赋概率)。这既能处理亚最优示范与噪声,又避免了不可归一化的问题。

关于模糊性(ambiguity):IRL 的非唯一性仍然存在(任何对 reward 加上环境潜在函数 (potential shaping) 不改变最优策略),但 MaxEnt 提供了一种原则性归一化选择(最大熵)来选择“最不偏倚”的解释。


4. 生成对抗模仿(GAIL)—— occupancy matching 与对抗损失的等价性证明

4.1 GAIL 的目标函数与直观

4.2 等价性(occupancy measure 匹配)与推导

实践要点: GAIL 在高维连续动作空间中能很好地学习复杂策略,但优化上依赖对抗训练的稳定性(与 GAN 类似);另外,GAIL 可以看成是 MaxEnt IRL 与策略优化(policy gradient)的一种可行实现(MaxEnt IRL 的分布匹配观点可以与 GAIL 互相对应)。


5. 离线强化学习(Offline RL / Batch RL)—— 本质挑战、误差源与保守化(CQL)

5.1 问题陈述与核心难点

离线 RL 的设定:我们只被允许使用一个固定数据集 D\mathcal DD(由某个行为策略 μ\muμ 或混合策略集收集),目标是从 D\mathcal DD 学出策略 π\piπ(不允许或极少在线交互)。核心挑战来自 分布外泛化(out-of-distribution (OOD))价值估计的外推误差(extrapolation error):当策略 π\piπ 在数据集不覆盖(或覆盖甚少)的状态-动作对上被评估时,函数逼近器(Q 网络)可能会对这些未见点产生高估,从而误导 policy improvement 步骤,把策略推向未见但被高估的动作,形成恶性循环。详见多篇综述与理论分析。NeurIPS 会议录+1

5.2 CQL(Conservative Q-Learning)的核心思想与目标(Kumar et al., 2020)

直观证明要点(为何能降低外推误差)

  • Bellman residual 损失倾向于把 Q 值向 Bellman 目标拉齐,但 Bellman 目标可能包含未在数据中覆盖的动作值(由 πtarget\pi_{\text{target}}πtarget​ 采样),会把 Q 推高。

  • CQL 的保守项直接惩罚 Q 在“整体动作空间上”的尺度(用 log-sum-exp 或均值项),从而对那些不在数据集但能被 policy improvement 选中的动作施加向下的压力。

  • 在理想化的离散情形与充分优化下,CQL 可保证对任意 policy π\piπ 在数据支持集外的策略值不会被高估(paper 中给出更严格命题与条件)。详见 Kumar et al.(2020)。NeurIPS 会议录+1

5.3 相关理论与分解(误差来源)

对于离线 RL,常见的价值函数误差分解包含:

  • 估计误差(estimation error):有限数据导致的统计噪声;

  • 逼近误差(approximation error):函数近似器(神经网络等)的建模误差;

  • 分布转移 / 外推误差(extrapolation / distributional-shift error):当 policy 访问的数据点不在 D\mathcal DD 的支持上时,Q 的值被错误外推;

  • 优化误差

CQL 与许多其他离线算法(BRAC,IQL 等)本质上通过显式或隐式的约束/正则化(限制 policy 的更新步幅到数据支持内或保守化 Q 值)来减弱外推误差。

此外,有一些工作将 offline RL 问题看成 imitation(如果数据近似专家演示)与鲁棒 policy evaluation 的混合,提出了把 imitation 与 offline RL 的思想结合的理论框架(例如 Rashidinejad 等 在 NeurIPS 2021 提出将两者平滑插值),这有利于理解示范比例对最终策略的影响与分布可控性。NeurIPS 会议录


6. 示范引导的在线精调(Imitation-bootstrapped / IBORL / IBRL 等)—— 原理与样本复杂度直观保证

6.1 思路与算法家族

一类实用的高样本效率方法是:先用有限示范做行为克隆或 IRL 预训练,得到一个较好初始策略或初始价值估计,然后在真实环境中用在线 RL 对该策略进行精调(fine-tuning),并在精调过程中利用示范信息以引导探索与稳定学习。此类方法的名字多种多样:Imitation Bootstrapped RL(IBRL)、Imitation-Bootstrapped Online RL(IBORL)、示范引导的 offline-to-online 等。其共同点:

  • 预训练提供较低的初始 regret 与安全行为(学到的 policy 在初期不会完全随机),

  • 在线 RL 在示范约束或示范建议下进行(例如把 IL 策略用于行动提议 / value bootstrap / actor regularization),

  • 目标是同时降低样本复杂度与避免灾难性偏移(policy collapse)。

最近的一些工作(如 IBRL / IBORL)在机器人操作任务上展示了显著提升,特别是在图像观测与稀疏奖励场景。arXiv+1

6.2 理论直观与样本复杂度改进的要点(sketch)

下面给出一个简化的定性/半形式化说明,说明为什么示范预训练能显著降低在线样本复杂度(并指出需要的假设与限制)。

样本复杂度直观结论(非严格)

更形式化的样例结论(基于 IBRL/IBORL 类型分析)

重要 caveat(注意事项):

  • 这类改进依赖于示范数据的质量与覆盖:若示范仅覆盖极小子集且环境在未覆盖处对策略极其敏感(不可恢复),预训练可能并不能带来样本复杂度改善。

  • 预训练策略若过度确定性(entropy 太低),可能妨碍后续 RL 的探索;因此许多方法在预训练后保留或注入一定的熵正则 / 探索机制。

  • 许多理论结果都需要可恢复性、覆盖性、以及(在函数逼近情形下)泛化边界的假设。


7. 小结(归纳与实践建议)

  • 行为克隆(BC):概念上直接、实现简单,但有分布偏移导致的“误差复合”问题;理论上在最坏情况给出 O(T2ε)O(T^2\varepsilon)O(T2ε) 的界(Ross & Bagnell)。若能用 DAgger 之类的交互式采集方法则可把量级降到近线性。卡内基梅隆大学机器人研究所+1

  • 逆强化学习(IRL):通过恢复 reward 实现泛化(MaxEnt IRL 提供概率化与特征匹配的清晰导出),但 reward 的非唯一性与计算复杂度仍是核心问题。AAAI

  • GAIL:把模仿学习转化为 occupancy measure 的对抗匹配问题,实质是最小化专家与学者策略的分布差(如 JS 散度),在实践上结合策略优化(policy gradient)用于学习复杂策略。arXiv

  • 离线 RL 的挑战:主要来自外推 / 分布差导致的值函数高估;保守 Q-learning (CQL) 等方法通过惩罚/约束机制抑制未见动作上的高估以实现更稳健的离线学习。arXiv

  • 示范引导的在线精调(IBRL / IBORL):把 IL 的先验(安全/有效的初始策略)与在线 RL 的自我改进结合起来,可在许多真实机器人任务中显著降低在线样本数,理论上依赖示范覆盖与可恢复性假设。近期有关 IBRL/IBORL 的论文报告在复杂机器人任务(dexterous hand 等)上取得了良好效果。arXiv+1


参考文献

  • Ross, S., Gordon, G., & Bagnell, D. (2011). A Reduction of Imitation Learning and Structured Prediction to No-Regret Online Learning. (DAgger 与理论). 卡内基梅隆大学机器人研究所+1

  • Ross, S., & Bagnell, D. (2010). Efficient Reductions for Imitation Learning.(BC 的复合误差理论). cs.cmu.edu

  • Ho, J., & Ermon, S. (2016). Generative Adversarial Imitation Learning (GAIL). arXiv+1

  • Ng, A. Y., & Russell, S. (2000). Algorithms for Inverse Reinforcement Learning. ICML 2000. 斯坦福人工智能实验室

  • Ziebart, B. D., Maas, A., Bagnell, J. A., & Dey, A. K. (2008). Maximum Entropy Inverse Reinforcement Learning. AAAI 2008. AAAI

  • Kumar, A., Zhou, A., Tucker, G., & Levine, S. (2020). Conservative Q-Learning for Offline Reinforcement Learning (CQL). NeurIPS 2020. (离线 RL 的保守化方法). arXiv+1

  • Hu, H. et al. (2023). Imitation Bootstrapped Reinforcement Learning (IBRL) / 后续 IBORL 相关工作(示范-引导在线精调)。近年来有若干 arXiv / robotics-proc 报告显示该方向在机器人任务上效果良好。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐