1.摘要

动态环境中的机器人群需要在任务位置、任务需求和通信关系持续变化时完成协同分配,论文将问题建模为去中心化部分可观测马尔可夫决策过程(Dec-POMDP),提出局部信息聚合多智能体深度确定性策略梯度算法(LIA-MADDPG)。集中训练阶段,LIA模块只聚合与当前机器人空间邻近或动作同步的机器人信息,降低全局联合状态造成的维度爆炸;分布式执行阶段,策略改进机制根据任务容量和邻居冲突程度动态修正动作。

2.研究背景与问题

见个人简介

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐