国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:王子豪,张严心,黄志清,殷辰堃
单位:北京交通大学 电子信息工程学院,北京 100091,,北京交通大学 电子信息工程学院,北京 100091,,北京工业大学 信息学部,北京 100124,,北京交通大学 电子信息工程学院,北京 100091,
关键词:多智能体;深度强化学习;部分可观测;多智能体深度确定性策略梯度;智能体间通信
多智能体深度强化学习(MADRL)将深度强化学习的思想和算法应用到多智能体系统的学习和控制中,是开发具有群智能体的多智能体系统的重要方法.现有的MADRL研究主要基于环境完全可观测或通信资源不受限的假设展开算法设计,然而部分可观测性是多智能体系统实际应用中客观存在的问题,例如智能体的观测范围通常是有限的,可观测的范围外不包括完整的环境信息,从而对多智能体间协同造成困难.鉴于此,针对实际场景中的部分可观测问题,基于集中式训练分布式执行的范式,将深度强化学习算法Actor-Critic扩展到多智能体系统,并增加智能体间的通信信道和门控机制,提出recurrent gated multi-agent Actor-Critic算法(RGMAAC).智能体可以基于历史动作观测记忆序列进行高效的通信交流,最终利用局部观测、历史观测记忆序列以及通过通信信道显式地由其他智能体共享的观察进行行为决策;同时,基于多智能体粒子环境设计多智能体同步且快速到达目标点任务,并分别设计2种奖励值函数和任务场景.实验结果表明,当任务场景中明确出现部分可观测问题时, RGMAAC算法训练后的智能体具有很好的表现,在稳定性方面优于基线算法.
来源:2023年第5期
《控制与决策》期刊编辑部