控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2021年第1期:MADDPG算法经验优先抽取机制

发布日期:

作者:何明,张斌,柳强,陈希亮,杨铖

单位:中国人民解放军陆军工程大学指挥控制工程学院,南京210007,,中国人民解放军陆军工程大学指挥控制工程学院,南京210007,,海军指挥学院,南京210000,,中国人民解放军陆军工程大学指挥控制工程学院,南京210007,,中国人民解放军陆军工程大学指挥控制工程学院,南京210007,

关键词:多智能体;深度强化学习;MADDPG;经验优先抽取

基金:国家重点研发计划项目(2018YFC0806900,2016YFC0800606,2016YFC0800310);江苏省自然科学基金项目(BK20161469);江苏省重点研发计划项目(BE2016904,BE2017616,BE2018754);中国博士后基金项目(2018M633757).

针对多智能体深度确定性策略梯度算法(MADDPG)学习训练效率低、收敛速度慢的问题,研究MADDPG算法经验优先抽取机制,提出PES-MADDPG算法.首先,分析MADDPG算法的模型和训练方法;然后,改进多智能体经验缓存池,以策略评估函数误差和经验抽取训练频率为依据,设计优先级评估函数,以优先级作为抽取概率获取学习样本训练神经网络;最后,在合作导航和竞争对抗2类环境中进行6组对比实验,实验结果表明,经验优先抽取机制可提高MADDPG算法的训练速度,学习后的智能体具有更好的表现,同时对深度确定性策略梯度算法(DDPG)控制的多智能体训练具有一定的适用性.

来源:2021年第1期

《控制与决策》期刊编辑部

查看控制与决策杂志2021年第1期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员