1.摘要

机器人操作任务(RMTs)通常需要学习较长的动作序列,以持续控制机械臂完成目标。现有强化学习方法面临两个瓶颈:原始动作空间过大导致探索低效,稀疏奖励下经验采样不足又容易引发灾难性遗忘。论文提出参数化动作原语进化强化学习(ERLAP),将分层强化学习(HRL)的动作原语库与进化算法的双种群机制结合起来。HRL负责选择原语类型并生成参数,EA把完整原语序列作为个体保存、筛选和进化,从而改善经验回放分布。实验表明,ERLAP在带稠密奖励的模拟操作任务上优于四种RL基线,并能在更具挑战性的稀疏奖励任务中有效缓解灾难性遗忘。

2.研究背景与动机

见个人简介

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐