国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:刘旖菲,李小帅,杨俊安,杨渡佳,王健
单位:国防科技大学 电子对抗学院,合肥 230037,,国防科技大学 电子对抗学院,合肥 230037;电子制约技术安徽省重点实验室,合肥 230037,,国防科技大学 电子对抗学院,合肥 230037;电子制约技术安徽省重点实验室,合肥 230037,,国防科技大学 电子对抗学院,合肥 230037;电子制约技术安徽省重点实验室,合肥 230037,,国防科技大学 电子对抗学院,合肥 230037;电子制约技术安徽省重点实验室,合肥 230037,
关键词:无人机集群;干扰决策;通信对抗;资源分配;强化学习;近端策略优化
基金:国家自然科学基金项目(62201601).
针对高动态通信对抗场景下无人机集群协同干扰资源分配问题,提出一种结合状态正态化、优势标准化、熵正则化机制和近端策略优化算法(state normalization,advantage normalization and entropy regularization-based proximal policy optimization,SANER-PPO)的干扰资源分配方法.首先,以无人机集群有效干扰的目标电台数量最大化和消耗的干扰功率最小化为目标函数,建立干扰资源分配优化问题;然后,将无人机集群映射为智能体,根据干扰资源分配模型建立马尔科夫决策过程;最后,利用SANER-PPO算法求解资源分配优化问题,生成无人机集群的干扰波束和干扰功率的优化决策结果.相比于原始PPO算法,SANER-PPO算法将状态正态化机制引入智能体的决策阶段以增强算法的有效性,将优势标准化机制和熵正则化机制引入更新阶段来提升算法的收敛速度和稳定性.结果表明,所提出算法能有效解决协同干扰资源分配问题,相较于原始PPO和柔性演员评论家两种算法,在资源消耗量和有效干扰的成功率方面具有明显优势.进一步,通过逐步移除所提出算法的改进机制来进行消融实验,验证了3种改进机制的有效性.
来源:2024年第12期
《控制与决策》期刊编辑部