控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2021年第1期:Actor-Critic框架下一种基于改进DDPG的多智能体强化学习算法

发布日期:

作者:陈亮,梁宸,张景异,刘韵婷

单位:沈阳理工大学自动化与电气工程学院,沈阳110159,,沈阳理工大学自动化与电气工程学院,沈阳110159,,沈阳理工大学自动化与电气工程学院,沈阳110159,,沈阳理工大学自动化与电气工程学院,沈阳110159,

关键词:强化学习;深度学习;多智能体;RNN;DDPG;Actor-Critic

基金:国家重点研发计划项目(2017YFC0821004,2017YFC0821001);辽宁省自然科学基金项目(20170540788);辽宁省教育厅基本科研项目(LG201707).

现实世界的人工智能应用通常需要多个agent协同工作,人工agent之间有效的沟通和协调是迈向通用人工智能不可或缺的一步.以自主开发的警员训练虚拟环境为测试场景,设定任务需要多个不同兵种agent小队互相协作或对抗完成.为保证沟通方式有效且可扩展,提出一种混合DDPG(Mi-DDPG)算法.首先,在Actor网络加入双向循环神经网络(BRNN)作为同兵种agent信息交流层;然后,在Critic网络加入其他兵种agent信息来学习多agent协同策略.另外,为了缓解训练压力,采用集中训练,分散执行的框架,同时对Critic网络里的Q函数进行模块化处理.实验中,在不同的场景下用Mi-DDPG算法与其他算法进行对比,Mi-DDPG在收敛速度和任务完成度方面有明显提高,具有在现实世界应用的潜在价值.

来源:2021年第1期

《控制与决策》期刊编辑部

查看控制与决策杂志2021年第1期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员