控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2019年第9期:基于改进Q-学习算法的多阶段群体决策模型

发布日期:

作者:张峰,刘凌云,郭欣欣

单位:河北大学数学与信息科学学院,河北保定071002,,河北大学数学与信息科学学院,河北保定071002,,河北大学数学与信息科学学院,河北保定071002,

关键词:群体决策;多阶段群体决策;强化学习;Q-学习;群体共识;不确定性

基金:国家自然科学基金项目(61672205);河北省自然科学面上基金项目(F2017201020,F2018201115);河北省教育厅青年基金项目(QN2015026,QN2017019).

多阶段群体决策问题是一类典型的动态群体决策问题,主要针对离散的确定状态下的最优群体决策问题求解.但由于现实环境面临的大部分是不确定状态空间,甚至是未知环境空间(例如状态转移概率矩阵完全未知),为了寻求具有较高共识度的多阶段群体最优策略,决策者需要通过对环境的动态交互来获得进一步的信息.针对该问题,利用强化学习技术,提出一种求解多阶段群体决策的最优决策算法,以解决在不确定状态空间下的多阶段群体决策问题.结合强化学习中的Q-学习算法,建立多阶段群体决策Q-学习基本算法模型,并改进该算法的迭代过程,从中学习得到群体最优策略.同时证明基于Q-学习得到的多阶段群体最优策略也是群体共识度最高的策略.最后,通过一个计算实例说明算法的合理性及可行性.

来源:2019年第9期

《控制与决策》期刊编辑部

查看控制与决策杂志2019年第9期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员