国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:代学武,吴越,石琦,崔东亮,俞胜平
单位:东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,,东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,,东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,,东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,,东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,
关键词:高速铁路;调度算法;深度强化学习;状态向量;动作空间;优先经验回放
基金:国家自然科学基金项目(61790574).
高铁行车调度是一个复杂的多阶段序列决策问题,需要考虑列车、线路设备等条件,且决策空间随问题规模的增大呈指数增长.而深度强化学习(DQN)兼备强大的搜索和学习能力,为高铁调度提供了新的解决方案,但存在经验利用效率低、迁移能力差等问题.本文提出一种基于优先经验回放可迁移深度强化学习的高铁调度方法.将包含股道运用计划等约束的高铁调度问题构建为多阶段序列决策过程,为提高算法的迁移能力,提出一种新的支持源域和目标域共享的状态向量和动作空间.为提高经验的利用效率和算法的收敛速度,设计了一种融合优先经验回放的深度Q网络训练方法.以徐兰线小规模案例为源域问题的经验学习实验表明,所提算法的经验利用效率和算法收敛速度优于传统DQN算法,并可适当增大优先级指数和调节权重参数以改善其收敛性能.以京沪线繁忙路段的晚点案例为目标域问题,本文提出的在线决策算法相比于经典的混合整数规划算法,决策时间平均减少约75$%$,且在近77$%$的案例中,总晚点时间的性能损失在15$%$以内.
来源:2023年第8期
《控制与决策》期刊编辑部