国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:王福杰,彭永岗,李醒,郭芳,秦毅,戚远航
单位:东莞理工学院 计算机科学与技术学院,广东 东莞 523808,,东莞理工学院 计算机科学与技术学院,广东 东莞 523808,,东北大学 流程工业综合自动化国家重点实验室,沈阳 110819,,东莞理工学院 计算机科学与技术学院,广东 东莞 523808,,东莞理工学院 计算机科学与技术学院,广东 东莞 523808,,电子科技大学中山学院 计算机学院,广东 中山 528402,
关键词:深度强化学习;充电枪装配;软演员-评论家算法;事后经验回放;策略延迟更新
基金:国家自然科学基金项目(62203116, 62273095);国家重点研发计划课题(2024YFB3312403);广东省基础与应用基础研究基金面上项目(2024A1515010222, 2022A1515240058);广东省普通高校重点领域专项(2023ZDZX1040, 2022ZDZX1045).
为解决充电枪装配过程中传统强化学习算法训练样本效率低、策略不稳定和对硬件资源利用不充分的问题, 提出融合事后经验回放(HER)和策略延迟更新(DPU)的软演员-评论家(SAC)算法 (SAC with HER-DPU). 首先, 建立充电枪装配模型, 通过在经验回放池中引入HER, 重新定义目标以生成“伪成功”经验; 然后, 在算法的梯度更新部分加入DPU, 通过多次更新价值网络后再更新策略网络, 确保策略更新基于更稳定的价值估计; 最后, 在使用SAC with HER-DPU 算法进行充电枪装配训练时采用双线程训练架构, 将数据收集和神经网络训练解耦. 实验结果表明, 所提算法的收敛时间为33.2 h, 平均装配步数为75步, 相较于SAC算法, 收敛时间减少21.4 h, 平均装配步数少17步, 可有效提高训练的样本效率、策略稳定性和训练速度.
来源:2026年第5期
《控制与决策》期刊编辑部