导读

论文标题:Causal Influence Detection for Improving Efficiency in Reinforcement Learning(NeurIPS 2021)
开源代码仓库:https://github.com/martius-lab/cid-in-rl

现有强化学习(RL)算法(DDPG+HER、VIME、Prioritized Experience Replay 等)在机器人抓取、放置这类多实体稀疏奖励环境中存在严重样本效率缺陷:无法区分 “动作能改变物体的可控关键状态” 与 “无交互无效状态”,大量算力浪费在无价值交互;同时传统时序因果度量、内在动机方法无法逐状态量化智能体对单一实体的局部因果控制力,且受训练策略分布偏移干扰,难以适配 Off-Policy 回放场景。

本文从独立因果机制(ICM)原理出发,提出CAI(Causal Action Influence,因果动作影响力) 量化指标,基于局部因果图与条件互信息刻画单状态下智能体对目标实体的可控程度;设计高斯动力学 + 蒙特卡洛 KL 近似的可训练估计方案,并将 CAI 落地为三套正交 RL 优化策略:CAI 内在探索奖励、主动因果动作选择、CAI 优先经验回放。

在 1DSLIDE、FetchPickAndPlace、FetchRotTable 三类机器人仿真环境验证:CAI 因果检测精度全面超越熵、Transformer 注意力、模拟器接触信号等基线;融合三套 CAI 改进方案后,稀疏操纵任务样本效率提升 4–10 倍,仅 3000 轮 episode 即可达到 95% 抓取成功率,且在观测噪声、外部环境扰动(旋转桌子)场景具备强鲁棒性。

背景动机

抓取 / 放置属于稀疏奖励任务,仅抵达目标才有反馈,绝大多数随机交互无价值,需要数十万轮训练;现实世界由独立实体(机械臂、物体、桌子)构成,只有局部接触时动作才能改变物体,但标准 DDPG、HER、VIME 等算法不区分 “可控状态 / 无效状态”,算力大量浪费;

高价值交互样本稀缺,物体碰撞、抓取这类非线性动力学难拟合,但随机探索很难采集足够多的可控交互样本;离线回放无因果区分,PER 仅基于 TD 误差加权样本,无法识别 “能改变目标物体” 的关键过渡。

独立因果机制 ICM 原理

环境可拆解为多个独立实体,每个实体拥有自主动力学模块;实体间的因果交互局部、稀疏、情境依赖:是否能产生作用完全由当前状态决定(机械臂远离物体时动作无任何影响)。

核心思路是说 可控状态(动作能因果改变物体)是训练最高价值样本

只要量化当前状态下智能体对物体的因果控制力,就能针对性引导探索、优先回放高价值数据,从根源提升样本效率。

可控交互天然稀少,随机探索难以覆盖;接触动力学高度非线性,需要更多梯度更新拟合;可控状态是完成操纵任务的必经中间节点。

方法框架

可分解 MDP 设定

标准 MDP < S , A , P , r , γ > <S,A,P,r,\gamma> <S,A,P,r,γ>,状态空间拆分为独立实体维度: S = S 1 × S 2 × . . . × S N S=S_1 \times S_2 \times ... \times S_N S=S1×S2×...×SN S i S_i Si代表单个实体(机械臂末端、待操纵物体坐标),贴合机器人多实体环境。

局部因果图 G S = s G_{S=s} GS=s(核心建模工具)

全局因果图:全局层面,上一步所有实体、动作都可能作用于下一时刻所有实体,因此全连接;

局部因果图:固定当前状态 S = s S=s S=s后,删除所有无效因果边 A → S j ′ A \to S_j' ASj(动作无法改变实体j),仅保留真实因果作用;

在这里插入图片描述

图 1 (b):机械臂远离物体,无红色因果边,无控制力;图 1 ( c):机械臂接触物体,存在红色因果边,具备控制力;

Proposition 1:可控性等价于条件不独立

局部图存在因果边 A → S j ′    ⟺    S j ′ ⊥̸ A ∣ S = s A \to S_j' \iff S_j' \not\perp A \mid S=s ASjSjAS=s ----> 当前状态下动作能影响物体j,当且仅当下一时刻物体状态与动作在当前状态条件下相互依赖。

Proposition 2:策略鲁棒性,适配离线 RL

只要存在任意满支撑策略观测到 S j ′ ⊥̸ A ∣ S = s S_j' \not\perp A \mid S=s SjAS=s,则所有策略下都存在因果影响力;反之,若某一满支撑策略下二者独立,则所有策略均无影响。

计算 CAI 时直接使用均匀随机策略即可,不受训练策略分布偏移干扰,完美适配 off-policy 回放数据。

动作A是物体变化的原因:更换动作则物体下一状态必然改变;本文不区分单个动作好坏,仅判断当前整体状态是否存在因果控制能力(状态层面,而非动作层面)。

CAI 因果动作影响力度量

采用点式条件互信息 CMI量化状态s下,动作A对实体j的因果控制力:

C j ( s ) : = I ( S j ′ ; A ∣ S = s ) = E a ∼ π [ D K L ( P S j ′ ∣ s , a ∥ P S j ′ ∣ s ) ] C^{j}(s):=I(S_{j}';A\mid S=s)=\mathbb {E}_{a\sim \pi }\Big [D_{KL}\Big (P_{S_{j}'\mid s,a} \parallel P_{S_{j}'\mid s}\Big )\Big ] Cj(s):=I(Sj;AS=s)=Eaπ[DKL(PSjs,aPSjs)]

物理含义:给定当前状态s,动作能为下一时刻实体j带来多少额外信息; C j ( s ) = 0 C^j(s)=0 Cj(s)=0代表完全无控制,数值越高控制力越强;

全局因果强度 = E s [ C j ( s ) ] =\mathbb{E}_s[C^j(s)] =Es[Cj(s)],CAI 是单点s下的局部取值。

熵分解直观理解: C j ( s ) = H ( S j ′ ∣ s ) − H ( S j ′ ∣ A , s ) C^j(s)=H(S_j'|s)-H(S_j'|A,s) Cj(s)=H(Sjs)H(SjA,s)等于 “无动作时物体的不确定性” 减去 “给定动作后物体剩余不确定性”,即动作能消除的物体状态不确定性,直接量化可控程度。

连续高维状态下,非参数互信息无法直接求解,本文三步近似:

  1. 高斯动力学模型假设

假设单步转移分布 p ( s j ′ ∣ s , a ) ∼ N ( μ θ ( s , a ) , σ θ 2 ( s , a ) ) p(s_j'|s,a) \sim \mathcal{N}(\mu_\theta(s,a), \sigma^2_\theta(s,a)) p(sjs,a)N(μθ(s,a),σθ2(s,a)),用 MLP 输出均值、方差,通过高斯负对数似然训练;

训练技巧:谱归一化稳定方差预测,softplus 约束方差恒正,输入归一化;

  1. 蒙特卡洛采样近似边际分布

均匀采样K个动作 a ( 1 ) . . . a ( K ) a^{(1)}...a^{(K)} a(1)...a(K),用有限高斯混合近似边际 p ( s j ′ ∣ s ) = ∫ p ( s j ′ ∣ s , a ) π ( a ) d a p(s_j'|s)=\int p(s_j'|s,a)\pi(a)da p(sjs)=p(sjs,a)π(a)da,得到估计器: C ^ j ( s ) = 1 K ∑ i = 1 K [ D K L ( p ( s j ′ ∣ s , a ( i ) ) ∥ 1 K ∑ k = 1 K p ( s j ′ ∣ s , a ( k ) ) ) ] \hat{C}^{j}(s)=\frac{1}{K} \sum_{i=1}^{K}\left[D_{KL}\left(p\left(s_{j}' | s, a^{(i)}\right) \| \frac{1}{K} \sum_{k=1}^{K} p\left(s_{j}' | s, a^{(k)}\right)\right)\right] C^j(s)=K1i=1K[DKL(p(sjs,a(i))K1k=1Kp(sjs,a(k)))]

  1. 高斯混合 KL 闭式近似

高斯混合分布 KL 无解析解,采用 Durrieu 提出的上下界均值 D m e a n D_{mean} Dmean近似,最终截断为非负(KL 散度天然≥0)。

验固定 K = 32 / 64 K=32/64 K=32/64(采样动作数量); K = 8 K=8 K=8即可基础可用,更大K提升边缘场景鲁棒性。

三大 CAI 强化学习优化方案

基础基线:DDPG + HER(多目标稀疏奖励机器人操纵标准算法);测试环境:FetchPush、FetchPickAndPlace、FetchRotTable(旋转桌子,物体存在外部自转干扰,区分因果难度更高)。

三种方案正交、可叠加,各自独立提升样本效率,组合后增益成倍放大。

方案 1:CAI 内在探索奖励(CAI-Bonus)

给可控状态附加内在奖励,引导智能体主动访问能操纵物体的区域;总奖励: r t o t a l = r t a s k + λ b o n u s ⋅ C j ( s ) r_{total}=r_{task}+\lambda_{bonus} \cdot C^j(s) rtotal=rtask+λbonusCj(s);也可仅用 CAI 作为唯一奖励(无任务外部反馈)。

  • 无任务奖励场景:智能体自发学会抓取、举升物体,证明 CAI 能自主发现基础操纵技能;

  • 稀疏奖励任务:最优 λ b o n u s = 0.2 \lambda_{bonus}=0.2 λbonus=0.2,达成 60% 成功率速度比基线快 4 倍; λ \lambda λ过大会让内在奖励盖过任务奖励,性能下降;

方案 2:主动因果动作探索(CAI-Act)

替换 / 混合传统 ϵ \epsilon ϵ-greedy 随机探索;不随机选探索动作,主动选择预期 CAI 最大的干预动作(主动做因果实验);无控制状态时退回随机动作。

a ∗ = a r g m a x a ∈ { a ( 1 ) , . . . , a ( K ) } D K L ( p ( s j ′ ∣ s , a ) ∥ 1 K ∑ k = 1 K p ( s j ′ ∣ s , a ( k ) ) ) a^{*}=\underset{a \in\left\{a^{(1)}, ..., a^{(K)}\right\}}{arg max } D_{KL}\left(p\left(s_{j}' | s, a\right) \| \frac{1}{K} \sum_{k=1}^{K} p\left(s_{j}' | s, a^{(k)}\right)\right) a=a{a(1),...,a(K)}argmaxDKL(p(sjs,a)K1k=1Kp(sjs,a(k)))

结果:100% 主动因果动作探索,学习速度提升约 2 倍;单独优于 VIME、集成分歧等主流内在动机基线。

方案 3:CAI 优先经验回放(CAI-P)

标准 PER 基于 TD 误差加权样本,本文按完整 episode 总 CAI 逆秩分配回放优先级,优先回放包含大量可控交互的轨迹;episode 内部均匀采样状态(避免完全丢弃低控制样本,保证 TD 误差向前期状态回传)。
p ( i ) = ( M + 1 − r a n k i ∑ t = 1 T C j ( s ( t ) ) ) − 1 p^{(i)}=\left(M+1-rank_{i} \sum_{t=1}^{T} C^{j}\left(s^{(t)}\right)\right)^{-1} p(i)=(M+1rankit=1TCj(s(t)))1

  • r a n k i rank_i ranki:所有 episode 按总 CAI 降序排序后的排名,M为总 episode 数量。

CAI-P 性能媲美甚至超越带特权信息的 EBP;比标准 PER 快 1.5~2.5 倍;FetchRotTable(旋转桌子)优势最明显:能区分 “桌子自转导致物体移动” 和 “机械臂动作控制物体移动”,不会错误优先回放无因果的无效样本。

单一模块收益排序:CAI-P(优先回放)> CAI-Bonus(探索奖励)> CAI-Act(主动动作);双模块叠加:任意两种组合效果优于单一模块;三模块全部融合(CAI-All):样本效率提升4~10 倍,FetchPickAndPlace 仅 3000 episode 即可达到 95% 任务成功率;横向对比主流基线:CAI 全组合方案显著优于 VIME、集成不确定性分歧。

实验分析

测试环境

  • 1DSLIDE(一维滑动极简仿真):因果真值可解析求解,基础验证;
  • FetchPickAndPlace(OpenAI Gym 标准抓取):7 自由度机械臂,真值用机械臂可达椭球启发式标注;
  • 困难变种:添加高斯观测噪声、随机策略采集极度稀疏正样本数据集(仅 3.3% 可控交互样本)。

对比基线

  • Entropy:仅使用 H ( S j ′ ∣ s ) H(S'_j|s) H(Sjs)作为检测分数;
  • Attention(Pitis 2020):Transformer 注意力权重;
  • Contacts:模拟器内置二进制接触信号(特权信息,现实不可获取)。

定量核心结果

  • 纯净观测环境:CAI AUC≈1.0(1DSLIDE)、0.97(抓取);注意力基线 AUC 仅 0.42~0.46,差距极大;
  • 噪声鲁棒性:随观测噪声提升,CAI 性能平滑衰减,熵、注意力基线快速失效;
  • 极度稀疏正样本场景:仅 3.3% 可控样本,PR 曲线仍保持高精度,无严重退化。

定性可视化验证

  • 无接触阶段:CAI≈0;
  • 短暂碰撞物体:CAI 瞬时尖峰;
  • 持续抓取举升物体:CAI 稳定高分;

完全匹配人类对 “可控 / 不可控” 的直观认知。

总结与思考

基于局部条件互信息定义CAI 逐点因果影响度量,严格证明其与局部因果图边、Janzing 全局因果强度的等价关系;证明 CAI 具备策略鲁棒性,可通过均匀随机策略离线计算,适配 off-policy 强化学习。

提出高斯动力学 + 蒙特卡洛 KL 近似的可扩展 CAI 估计算法,解决连续高维状态下条件互信息难以估计的工程难题,兼顾精度与计算效率。

要求环境全部状态可观测,无隐变量;POMDP 部分可观测场景需要结合潜变量因果模型;CAI 精度完全依赖高斯动力学模型拟合效果,复杂高频接触动力学下模型拟合存在误差;不支持多步间接因果链(机械臂推物体、物体撞桌子这类长程链式影响无法量化)。

未来可拓展多步间接因果影响力检测,建模长程干预因果链;结合因果表征学习,从原始像素图像自动拆分独立实体,消除手动分解状态的先验;将 CAI 用于信用分配:区分动作的有效因果贡献,优化策略梯度更新;拓展 POMDP 部分可观测场景,融合潜变量因果推断;

概念补充

Empowerment 定义(一步赋能,单步信道容量)
Empowerment ( s ) = max ⁡ π ( ⋅ ∣ s ) I ( A ; S ′ ∣ S = s ) \text{Empowerment}(s) = \max_{\pi(\cdot|s)} I(A; S' \mid S=s) Empowerment(s)=π(s)maxI(A;SS=s) 赋能是全局层面:给定当前状态s,寻找最优策略 π \pi π,最大化 动作A和全部未来全局状态 S ′ S' S的互信息

CAI 是 Empowerment 的下界 C j ( s ) = I ( S j ′ ; A ∣ S = s ) ≤ max ⁡ π I ( A ; S ′ ∣ S = s ) = Empowerment ( s ) C^j(s) = I(S_j';A\mid S=s) \le \max_{\pi} I(A;S' \mid S=s) = \text{Empowerment}(s) Cj(s)=I(Sj;AS=s)maxπI(A;SS=s)=Empowerment(s)

为什么是下界?

Empowerment 取最优策略,CAI 只用均匀随机策略 U ( A ) U(A) U(A),策略更差,信息增益天然更小;
Empowerment 耦合全部实体,CAI 只单独看单个目标实体 S j ′ S_j' Sj,丢弃无关实体的信息,数值更小。

Empowerment:机械臂挥舞空气(只改变自身位置)也会给出高分,误导探索;CAI:只有动作能改变方块坐标时分数才高,精准引导抓取交互。 ------ 不需要求解信道容量优化 max ⁡ π \max_\pi maxπ,直接用均匀动作采样即可;Empowerment 需要内层最大化,计算开销极高。

VIME / 集成模型分歧(动力学不确定性探索)

二者都属于预测误差驱动的内在奖励,只关心 动力学模型预测准不准,不区分因果方向、不区分实体。

内在奖励 = 状态转移的信息增益(全局所有维度): r VIME ( s , a ) = D K L ( P ( ϕ ∣ s , a , S ′ )   ∥   P ( ϕ ) ) r_{\text{VIME}}(s,a) = D_{KL}\big(P(\phi\mid s,a,S') \,\big\|\, P(\phi)\big) rVIME(s,a)=DKL(P(ϕs,a,S) P(ϕ))

  • ϕ \phi ϕ:动力学模型参数;衡量一次交互 ( s , a , s ′ ) (s,a,s') (s,a,s)能减少多少模型参数不确定性。

机械臂挥空、没碰到方块:模型预测误差很小,但 VIME 依然会计算全局机械臂坐标的预测信息增益,给探索奖励;

r Disagree ( s , a ) = Var [ f ^ 1 ( s , a ) , f ^ 2 ( s , a ) , . . . , f ^ M ( s , a ) ] r_{\text{Disagree}}(s,a) = \text{Var}\big[\hat{f}_1(s,a),\hat{f}_2(s,a),...,\hat{f}_M(s,a)\big] rDisagree(s,a)=Var[f^1(s,a),f^2(s,a),...,f^M(s,a)]

M个独立动力学网络,奖励等于多个网络预测下一状态的方差。

5 个模型预测机械臂挥空后的末端位置差异大 → 分歧高,给高探索分;哪怕方块完全不动,只要机械臂自身预测不准,就会引导重复无效动作。 CAI 只计算方块 S j ′ S_j' Sj上、由动作A带来的分布偏移;

  1. 满支撑策略的因果不变性

满支撑策略 π full \pi_{\text{full}} πfull对动作空间内任意动作a,都满足 π ( a ∣ s ) > 0 \pi(a|s) > 0 π(as)>0。也就是说 无论什么动作,这个策略都有概率选到,不会完全屏蔽任何动作。

“有无因果控制力” 是状态s本身的固有物理属性,和你用哪个满支撑策略去测试无关。只要拿一个满支撑策略(均匀随机)测一次,结论对所有策略通用。

均匀随机策略 U ( A ) U(A) U(A),所有动作等概率,天然满支撑。

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐