(AICS 2025)HPR‑CAPQL :借鉴 HER 思想,用偏好重标记增强 MORL 回放
导读
论文题目:Hindsight Preference Replay Improves Preference-Conditioned Multi-Objective Reinforcement Learning(AICS 2025)
面向偏好条件多目标强化学习(Preference-Conditioned MORL),提出事后偏好回放 HPR 数据增强策略,在不改动基线算法 CAPQL 网络与损失的前提下,大幅提升样本效率、拓宽帕累托前沿。
背景动机
基线算法 :CAPQL(Concavity-Aware Preference-based Q-Learning)
基于 SAC 改造的偏好条件 Actor-Critic:
- 策略网络、价值网络均以偏好向量 w 作为输入,单网络适配全部目标权衡;
- 评论家损失增加凹性正则项,提升帕累托前沿覆盖度、训练稳定性,是连续控制 MORL 强基线。
CAPQL 存在数据低效利用:一条在偏好 w 0 w_0 w0 下采集的转移 ( s , a , r , s ′ , w 0 ) (s,a,r,s',w_0) (s,a,r,s′,w0),仅能用于训练对应 w 0 w_0 w0 的策略;而这条轨迹对单纯形内邻近、其他偏好同样具备学习价值,却被直接丢弃。
HER(事后经验回放)
单目标、目标条件 RL 中,HER 通过重标记目标把失败轨迹转为有效训练样本,解决稀疏奖励。本文借鉴 HER “事后重标记” 思想,但重标记对象从目标改为偏好权重 w,提出 HPR(事后偏好回放)。
目标条件 RL(GCRL) 新增条件变量 g ∈ G \boldsymbol{g}\in\mathcal{G} g∈G(目标 goal),完整元组: M = ( S , A , G , R , T , γ ) \mathcal{M}=(S,A,\mathcal{G},R,T,\gamma) M=(S,A,G,R,T,γ)
- 策略: π ( a ∣ s , g ) \pi(a \mid s, g) π(a∣s,g),输入当前状态 s + 目标 g,输出动作;
- 价值函数: V ( s , g ) = E π [ ∑ t = 0 ∞ γ t r ( s t , g ) ∣ s 0 = s , 目标 g ] V(s,g) = \mathbb{E}_\pi\left[\sum_{t=0}^\infty \gamma^t r(s_t,g) \mid s_0=s, \text{目标}g\right] V(s,g)=Eπ[∑t=0∞γtr(st,g)∣s0=s,目标g];
智能体需要根据任意给定目标 g,学习对应的行为;典型奖励设计(稀疏奖励):
r ( s ′ , g ) = { 1 状态 s ′ 满足目标 g 0 其他情况 r(s', g) = \begin{cases} 1 & \text{状态}s' \text{满足目标}g \\ 0 & \text{其他情况} \end{cases} r(s′,g)={10状态s′满足目标g其他情况
只有到达目标才获得正奖励,全程未抵达目标时整条轨迹奖励全为0,无法有效更新网络,这是GCRL核心痛点。
已有多目标 HER 仅针对目标重标记、进化多目标优化、元自适应策略,没有针对偏好向量 w 的事后重标记回放方案,无法复用跨偏好的异策略样本。
HER重标记从 失败轨迹已实际到达过的中间状态中选取一个作为新目标 g ~ \tilde{g} g~,将轨迹中所有转移元组里的原始目标 g orig g_{\text{orig}} gorig 全部替换为 g ~ \tilde{g} g~,重新计算每条转移的奖励 r ~ t = r ( s t + 1 , g ~ ) \tilde{r}_t = r(s_{t+1},\tilde{g}) r~t=r(st+1,g~),生成全新训练样本存入回放缓存。 --------------- HER只修改任务目标 g,仅适用于单目标、稀疏奖励场景;完全不处理多目标冲突、用户偏好权衡问题,没有偏好权重向量 w \boldsymbol{w} w 的概念。
6 个环境中 5 个超体积 HV 提升、4 个期望效用 EUM 提升,人形机器人 mo-humanoid-v5 取得数量级性能暴涨;同时分析唯一负例 mo-halfcheetah-v5 的内在原因,并给出过滤缓解方案。
方法框架
核心思想:原始转移 ( s , a , r , s ′ , w ) (s,a,r,s',w) (s,a,r,s′,w) 不修改状态、动作、奖励,仅替换偏好权重 w 为新 w ~ \tilde{w} w~,生成多条衍生样本存入回放缓存;训练时混合原始 + 重标记样本,一条轨迹同时服务多个偏好的策略更新。
仅替换偏好 w ~ \tilde{w} w~,不改动 s , a , r , s ′ s,a,\boldsymbol{r},s' s,a,r,s′会不会出问题?
向量回报 G \boldsymbol{G} G是这条轨迹真实达成的收益分布;如果采样一个极端对立的 w ~ \tilde{w} w~,会得到极低甚至负标量效用 u w ~ = w ~ ⊤ G u_{\tilde{w}}=\tilde{w}^\top \boldsymbol{G} uw~=w~⊤G,用这种样本更新网络会引入冲突监督信号,拉低帕累托前沿覆盖。(偏好采样范围过散,梯度方差爆炸,训练震荡)
每条原始转移生成K条重标记样本,回放缓存容量线性扩张;无约束重标记会充斥大量低价值、噪声样本,有效数据占比下降,同等环境交互步数下收敛变慢。
人形机器人轨迹收益 G = [ 120 , − 80 ] \boldsymbol{G}=[120,-80] G=[120,−80](速度高、能耗大),采样极端偏好 w ~ = [ 0.01 , 0.99 ] \tilde{w}=[0.01,0.99] w~=[0.01,0.99](极致省电),计算效用 0.01 ∗ 120 + 0.99 ∗ ( − 80 ) = − 78 0.01*120+0.99*(-80) = -78 0.01∗120+0.99∗(−80)=−78,这条样本会教模型 “这条高速轨迹是差策略”,和真实收益事实冲突。
两种偏好重标记策略
邻域采样 Neighborhood Sampling
以原始偏好 w 为中心,从狄利克雷分布 D i r ( κ w ) Dir(\kappa w) Dir(κw) 采样 K 个新偏好 w ~ \tilde{w} w~:
- κ \kappa κ:浓度参数, κ \kappa κ 越大,采样偏好越贴近原偏好,局部泛化更强;论文取值 κ ∈ { 10 , 20 , 50 } \kappa\in\{10,20,50\} κ∈{10,20,50};
- 每步交互最多生成 K 条重标记样本( K ∈ { 0 , 1 , 2 , 4 } K\in\{0,1,2,4\} K∈{0,1,2,4})。
回报对齐重标记 Return-Aligned Relabeling
单条轨迹计算折扣累积回报向量 G,构造对齐轨迹收益的偏好: w ~ ∝ softplus ( G ) \tilde{w} \propto \text{softplus}(G) w~∝softplus(G)
再投影到单纯形(权重归一和为 1);可与原偏好加权混合,控制偏移幅度。
一条轨迹的真实向量收益 G \boldsymbol{G} G 客观存在;对任意合法单纯形偏好 w ~ \tilde{\boldsymbol{w}} w~,都天然存在一个真实效用 w ~ ⊤ G \tilde{\boldsymbol{w}}^\top \boldsymbol{G} w~⊤G,这个值是客观真值,不存在 “这条轨迹不是在 w ~ \tilde{\boldsymbol{w}} w~ 下采集就不能算” 的说法。
w ~ ∝ softplus ( G ) \tilde{\boldsymbol{w}} \propto \text{softplus}(\boldsymbol{G}) w~∝softplus(G),softplus 保证分量全正,再投影到单纯形,最终 w ~ \tilde{\boldsymbol{w}} w~ 的分量大小完全跟随 G \boldsymbol{G} G 的分量:
- 若 G = [ 120 , − 80 ] \boldsymbol{G} = [120, -80] G=[120,−80](速度收益高、能耗代价大),softplus 后正向分量远大于负向分量,生成的 w ~ \tilde{\boldsymbol{w}} w~ 天然偏向速度维度;
- 不会凭空生成一个极致省电 w ~ = [ 0.01 , 0.99 ] \tilde{\boldsymbol{w}}=[0.01,0.99] w~=[0.01,0.99] 去匹配这条高速高能耗轨迹。
本质是函数插值数据增强:用同一个输入自变量 G \boldsymbol{G} G,扩充条件输入 w \boldsymbol{w} w 的监督集合,和监督学习里 “同一张图做数据增强” 逻辑一致,不存在因果偏差,只是增加采样点。

初始化:CAPQL 策略 / 目标网络、空回放缓存 B、超参数 K(单步重标记数量)、 κ \kappa κ、重标记样本占比 ρ \rho ρ;
循环采集交互(直到 30 万步预算耗尽)
- 采样行为偏好 w,与环境交互,原始转移存入缓存;
- HPR 重标记分支 1(邻域采样):循环 K 次,采样 w ~ \tilde{w} w~,满足过滤条件则存入缓存;
- 单 episode 结束后HPR 重标记分支 2(回报对齐):用整条轨迹累计回报 G 生成 w ^ \hat{w} w^,过滤后存入缓存;
训练更新:从缓存采样 minibatch,其中 ρ \rho ρ 比例为重标记样本,用 CAPQL 原有损失更新网络;
定期评估:固定偏好网格计算 EUM、HV、稀疏度,记录帕累托前沿。
实用过滤机制(解决部分环境性能退化)
当目标正交性极强时,无约束重标记会引入无效梯度、破坏训练,设计筛选条件:
- 余弦相似度约束: cos ( w ~ , G ) ≥ τ , τ ∈ { 0.7 , 0.8 } \cos(\tilde{w},G)\ge\tau,\tau\in\{0.7,0.8\} cos(w~,G)≥τ,τ∈{0.7,0.8};
- 效用下界约束: w ~ ⊤ G ≥ w ⊤ G − ε , ε ∈ { 0 , 0.1 } \tilde{w}^\top G \ge w^\top G-\varepsilon,\varepsilon\in\{0,0.1\} w~⊤G≥w⊤G−ε,ε∈{0,0.1};
仅满足条件的重标记样本才存入缓存,缓解 mo-halfcheetah-v5 这类任务的性能下降。
实验分析
测试环境:MO-Gymnasium 6 套 2 维目标连续机器人
全部基于 MuJoCo 物理引擎,奖励为二维冲突向量:
| 环境 | 观测维度 | 动作维度 | 优化目标 |
|---|---|---|---|
| mo-hopper-2obj-v5 | 11 | 3 | 前进速度、跳跃高度 |
| mo-walker2d-v5 | 17 | 6 | 前进速度、控制能耗 |
| mo-halfcheetah-v5 | 17 | 6 | 前进速度、控制能耗 |
| mo-humanoid-v5 | 348 | 17 | 前进速度、控制能耗(高维最难) |
| mo-swimmer-v5 | 8 | 2 | 前进速度、控制能耗 |
| mo-ant-2obj-v5 | 105 | 8 | X 方向速度、Y 方向速度 |
统一预算:每个任务固定30 万环境交互步,每 1 万步评估一次;
对照组:原生 CAPQL vs HPR-CAPQL,相同代码框架,5 个随机种子取均值 ± 标准差;
HV 超体积(核心):6 环境中5 个 HPR-CAPQL 显著更优,仅 mo-halfcheetah-v5 原生 CAPQL 更强;
EUM 期望效用:6 环境中4 个 HPR-CAPQL 更高;
稀疏度 Sparsity:HPR 拓展前沿后解集间距普遍变大(覆盖 - 稠密权衡);
统计显著性:人形、walker2d、ant 三个任务 HV Welch 检验 p<0.01,提升可信度极高。
代表性暴涨案例:mo-humanoid-v5(高维人形机器人)
CAPQL:EUM=323±125,HV=0.52M
HPR-CAPQL:EUM=1613±464,HV=9.63M
p=0.0009(p<0.001,极显著),性能数量级提升;原因是高维任务原生样本极度稀缺,HPR 通过重标记成倍扩充有效监督信号。
唯一负例:mo-halfcheetah-v5
HPR-CAPQL HV 显著更低(5.99M vs 8.72M,p=0.035),EUM 基本持平;
该环境奖励几何结构特殊,激进跨偏好重标记引入大量冲突梯度,抵消拓展收益;论文给出解决方案:降低 K、收紧过滤阈值、训练末期关闭 HPR 做稠密化微调。
平局:mo-swimmer-v5
环境简单,两种算法快速收敛至相近帕累托前沿,指标差异无统计意义(p=0.2926)。



(Fig1-EUM、Fig2-HV、Fig3-Sparsity)

帕累托前沿可视化
总结与思考
HPR 是极简、通用的回放增强方案,适配偏好条件 MORL,无需修改原有算法网络与损失;样本效率大幅提升,适合采集成本昂贵的真实机器人场景。
未来可以拓展至多目标 m>2场景(本文仅二维目标);自适应偏好采样分布、可学习的重标记接受过滤条件;结合进化多目标优化、元学习进一步提升泛化。
额外补充
- 为什么选用狄利克雷分布 w ~ ∼ Dir ( κ ⋅ w orig ) \tilde{w}\sim \text{Dir}(\kappa \cdot w_{\text{orig}}) w~∼Dir(κ⋅worig)做邻域采样?
偏好权重约束: Δ m = { w ∈ R m ∣ w i ≥ 0 , ∑ i = 1 m w i = 1 } \Delta^m = \left\{ w\in\mathbb{R}^m \mid w_i\ge0,\ \sum_{i=1}^m w_i=1 \right\} Δm={w∈Rm∣wi≥0, ∑i=1mwi=1}
所有合法偏好向量必须落在单纯形上,普通正态、均匀分布采样会出现负数 / 和不为 1,需要额外归一化,且无法天然约束在单纯形内部。
狄利克雷是单纯形上的共轭先验,天然适配偏好空间
狄利克雷分布是定义在标准单纯形上的连续概率分布,采样输出天然满足:分量非负、求和等于 1,无需额外投影修正权重合法性,完美匹配偏好w的数学约束。
DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。
更多推荐
所有评论(0)