相比单智能体RL,多智能体强化学习MARL最大的优势就是天然契合Agent、多机器人、自动驾驶、具身智能等热门场景,因此近两年顶会发文数量明显增加。到了今年,它已经从"算法设计"逐渐进入"MARL×基础模型×Agent"的新阶段。

而相应的,从研究趋势判断,目前MARL最有潜力的几个路线主要有LLM+MARL、异构MAPPO、多智能体通信、离线 MARL,以及高上限高门槛的大规模种群博弈等。这在今年的顶会顶刊上也有所体现。

本文整理了26篇MARL相关的最新论文,全部筛选自ICML、AAAI、NeurIPS、ESWA等顶会顶刊,附代码,旨在帮助大家快速了解MARL的最新发展进程,为后续确定idea、论文设计提供一些启发。

全部论文+开源代码需要的同学看文末

【ESWA】Explainable autonomous cyber defense using adversarial multi-agent reinforcement learning

背景动机:APT攻击者通过篡改遥测制造观测混淆,现有网络防御方案仅依赖相关性分析,缺少因果约束、对抗式多智能体校验与人机可解释管控一体化设计,易产生大量误报与不合理处置动作,因此亟需一套完整解决方案。

核心创新:本文提出C-MADF因果多智能体决策框架,核心创新是将因果结构模型SCM约束的MDP-DAG决策链路与红蓝双智能体对抗强化学习耦合,通过红蓝策略分歧量化不确定性并配套可解释透明度评分ETS实现人机协同自主网络防御,大幅降低APT篡改遥测带来的误报。

实验结果:在CICIoT2023数据集上,C-MADF相较三类主流基线将误报率大幅降至1.8%,取得0.997精确率、0.961召回率、0.979 F1分数,消融实验证实因果SCM、红蓝对抗多智能体模块均为性能核心,且ETS分数可与证据完备度、策略分歧程度形成稳定单调对应关系。

【AAAI 2026】LLM Collaboration with Multi-Agent Reinforcement Learning

背景动机:当下多LLM协作方案要么仅在推理阶段依靠提示进行交互,难以形成稳定协同产出,要么采用单智能体独立微调方式,依赖繁琐分角色奖励设计、缺乏全局联合优化与收敛保证,难以适配多轮复杂协作任务,为此本文基于多智能体强化学习思路开展针对性研究。

核心创新:本文将大模型协作建模为Dec-POMDP合作多智能体强化学习问题,提出MAGRPO算法,依托多轮分组相对优势实现中心化训练、去中心化执行的多LLM联合微调,解决现有提示交互/单智能体微调协作差、收敛难的缺陷。

实验结果:在文本写作、代码协作两类任务上,MAGRPO相较单大模型、提示式多智能体等全部基线,兼顾更高推理速度、文本结构/代码语法/单元测试等质量指标与全局协作收益,多轮版本还能借助外部反馈进一步提升协作产出效果。

关注下方《学姐带你玩AI》🚀🚀🚀

回复“222”获取全部方案+开源代码

码字不易,欢迎大家点赞评论收藏

Logo

DAMO开发者矩阵,由阿里巴巴达摩院和中国互联网协会联合发起,致力于探讨最前沿的技术趋势与应用成果,搭建高质量的交流与分享平台,推动技术创新与产业应用链接,围绕“人工智能与新型计算”构建开放共享的开发者生态。

更多推荐