国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:孙辉辉,胡春鹤,张军国
单位:北京林业大学 工学院,北京 100083;华北科技学院 机电工程学院,河北 廊坊 065201,,北京林业大学 工学院,北京 100083;国家林业和草原局林业装备与自动化重点实验室,北京 100083,,北京林业大学 工学院,北京 100083;国家林业和草原局林业装备与自动化重点实验室,北京 100083,
关键词:深度强化学习;多机器人;风险防御;协同对抗;事件驱动
基金:国家自然科学基金项目(61703047);河北省高等学校科学技术研究项目(QN2021312).
深度强化学习因其在多机器人系统中的高效表现,已经成为多机器人领域的研究热点.然而,当遭遇连续时变、风险未知的非结构场景时,传统方法暴露出风险防御能力差、系统安全性能脆弱的问题,未知风险将以对抗攻击的形式给多机器人的状态空间带来非线性入侵.针对这一问题,提出一种基于主动风险防御机制的多机器人强化学习方法(APMARL).首先,基于局部可观察马尔可夫博弈模型,建立多机记忆池共享的风险判别机制,通过构建风险状态指数提前预测当前行为的安全性,并根据风险预测结果自适应执行与之匹配的风险处理模式;特别地,针对有风险侵入的非安全状态,提出基于增强型注意力机制的Actor-Critic主动防御网络架构,实现对重点信息的分级增强和危险信息的有效防御.最后,通过广泛的多机协作对抗任务实验表明,具有主动风险防御机制的强化学习策略可以有效降低敌对信息的入侵风险,提高多机器人协同对抗任务的执行效率,增强策略的稳定性和安全性.
来源:2023年第5期
《控制与决策》期刊编辑部