国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:朴敏楠,李浩龙,李海丰,范龙飞
单位:中国民航大学 计算机科学与技术学院,天津 300300,,中国民航大学 计算机科学与技术学院,天津 300300,,中国民航大学 计算机科学与技术学院,天津 300300,,中国民航大学 计算机科学与技术学院,天津 300300,
关键词:飞机蒙皮检测;任务规划;深度强化学习;注意力机制;策略梯度
基金:国家自然科学基金项目(U2433202, 62203450, 62373365);航空科学基金项目(2022Z034067004);天津市自然科学基金多元投入青年项目(24JCQNJC00070);中央高校基本科研业务费专项资金项目(3122025PT01, 3122023PT16, 3122024PT08, KJZ53420210066).
针对飞机蒙皮覆盖检测的场景下, 传统人工检测存在的作业效率低下及检测时效性约束严格等瓶颈问题, 现有研究多集中于多无人机协同作业的技术方案, 其中面向飞机蒙皮盖检测的多无人机协同任务规划(MCMP)是描述多无人机协同检测的问题模型, 当前算法多采用启发式算法, 但其求解速度和解的质量无法满足实际要求. 为此, 将MCMP问题建模为带有容量约束的车辆路径规划问题(CVRP), 提出两阶段的深度强化学习(TSDRL)的求解模型: 第1阶段根据节点数量, 利用基于注意力机制的策略网络求解最优无人机数量; 第2阶段设计一种新的编码器-解码器结构的策略网络, 以构建每架无人机的路径. 该模型通过策略梯度训练, 能够快速求解每架无人机的高质量路径, 为了解决三维环境碰撞问题, 使用RRT*算法优化路径以满足碰撞约束. 仿真结果表明, 所提模型在计算效率与求解质量上均优于现有的深度强化学习方法和启发式算法, 并且模型具有良好的泛化性, 可应用于不同机型.
来源:2026年第3期
《控制与决策》期刊编辑部