国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:许驰,唐紫萱,金曦,夏长清
单位:中国科学院沈阳自动化研究所 机器人学国家重点实验室,沈阳 110016;中国科学院 网络化控制系统重点实验室,沈阳 110016;中国科学院 机器人与智能制造创新研究院,沈阳 110169,,中国科学院沈阳自动化研究所 机器人学国家重点实验室,沈阳 110016;中国科学院 网络化控制系统重点实验室,沈阳 110016;中国科学院 机器人与智能制造创新研究院,沈阳 110169;中国科学院大学,北京 100049,,中国科学院沈阳自动化研究所 机器人学国家重点实验室,沈阳 110016;中国科学院 网络化控制系统重点实验室,沈阳 110016;中国科学院 机器人与智能制造创新研究院,沈阳 110169,,中国科学院沈阳自动化研究所 机器人学国家重点实验室,沈阳 110016;中国科学院 网络化控制系统重点实验室,沈阳 110016;中国科学院 机器人与智能制造创新研究院,沈阳 110169,
关键词:异构工业任务;任务迁移;李雅普诺夫优化;马尔可夫决策过程;深度强化学习
基金:国家自然科学基金项目(92267108,62173322,62133014,61972389);辽宁省科技计划项目(2023JH3/ 10200004,2023JH3/10200006,2022JH25/10100005);中国科学院青年创新促进会项目(2019202,2020207, Y2021062).
针对多终端、多边缘服务器场景下异构工业任务的端边协同处理问题,提出一种基于李雅普诺夫优化和深度强化学习的多任务端边迁移算法.首先,以联合优化任务迁移决策、迁移比例和传输功率为目标,充分考虑计算频率、传输功率、长期能耗和任务截止期等约束,构建系统长期平均开销最小化问题;由于问题中长期目标及约束中变量在不同时隙相互耦合,难以求解,基于李雅普诺夫优化理论,将长期平均开销最小化问题解耦为独立时隙的策略优化问题;通过马尔可夫决策过程建模,并采用双层竞争深度神经网络架构,提出基于深度强化学习的多任务迁移算法.实验结果表明,所提算法能够稳定收敛,并在长期能耗约束和任务截止期要求下有效降低系统长期平均开销.
来源:2024年第7期
《控制与决策》期刊编辑部