1.摘要
机器人操作任务(RMTs)通常需要学习较长的动作序列,以持续控制机械臂完成目标。现有强化学习方法面临两个瓶颈:原始动作空间过大导致探索低效,稀疏奖励下经验采样不足又容易引发灾难性遗忘。论文提出参数化动作原语进化强化学习(ERLAP),将分层强化学习(HRL)的动作原语库与进化算法的双种群机制结合起来。HRL负责选择原语类型并生成参数,EA把完整原语序列作为个体保存、筛选和进化,从而改善经验回放分布。实验表明,ERLAP在带稠密奖励的模拟操作任务上优于四种RL基线,并能在更具挑战性的稀疏奖励任务中有效缓解灾难性遗忘。
2.研究背景与动机
见个人简介
所有评论(0)