国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:罗俊仁,张万鹏,苏炯铭,蒋超远,陈璟
单位:国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,,国防科技大学 智能科学学院,长沙 410073,
关键词:分层决策;多智能体强化学习;协同突防;行动规划
基金:国家自然科学基金项目(61806212);湖南省研究生科研创新项目(CX20210011).
利用多智能体强化学习方法赋能异构多实体系统是分布式人工智能领域的前沿课题.多机协同突防海上目标任务中异构多编队之间的高效协同是制胜的关键,由于环境的部分可观导致多智能体强化学习方法的探索效率不高.为此,提出一种知识耦合分层值分解(hierarchical value decompostion,HAVED)的多机协同突防行动策略规划方法,上层围绕多机编队间(intra-team)占位规划展开资源调度,下层围绕编队内(inner-team)任务规划展开目标分配.对值分解基类算法利用加权算子对联合动作对应的损失进行加权,避免陷入局部最优,着力提升多机多编队在对抗场景中突防策略的探索与学习效率.为验证算法的有效性,以多机协同突防海上目标为典型任务场景,设计典型任务想定.采用集中式训练-分布式执行范式,在墨子兵棋推演平台上进行仿真实验,对多类值分解方法进行对比分析,以验证所提出方法的有效性.最后通过对推演对抗过程数据进行复盘分析,总结出智能体涌现出的3种典型行动策略.
来源:2025年第1期
《控制与决策》期刊编辑部