控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2023年第11期:融合认知行为模型的深度强化学习框架及算法

发布日期:

作者:陈浩,李嘉祥,黄健,王菖,刘权,张中杰

单位:国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,

关键词:认知行为模型;强化学习;近端策略优化;深度Q网络;信念-愿望-意图;GOAL;空战机动决策

基金:国家自然科学基金项目(61906202).

面对高维连续状态空间或稀疏奖励等复杂任务时,仅依靠深度强化学习算法从零学习最优策略十分困难,如何将已有知识表示为人与学习型智能体之间相互可理解的形式,并有效地加速策略收敛仍是一个难题.对此,提出一种融合认知行为模型的深度强化学习框架,将领域内先验知识建模为基于信念-愿望-意图(belief- desire-intention, BDI)的认知行为模型,用于引导智能体策略学习.基于此框架,分别提出融合认知行为模型的深度Q学习算法和近端策略优化算法,并定量化设计认知行为模型对智能体策略更新的引导方式.最后,通过典型gym环境和空战机动决策对抗环境,验证所提出算法可以高效利用认知行为模型加速策略学习,有效缓解状态空间巨大和环境奖励稀疏的影响.

来源:2023年第11期

《控制与决策》期刊编辑部

查看控制与决策杂志2023年第11期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员