控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2024年第5期:基于强化学习的挖掘机时间最优轨迹规划

发布日期:

作者:张韵悦,孙志毅,孙前来,王银

单位:太原科技大学 电子信息工程学院,太原 030024,,太原科技大学 电子信息工程学院,太原 030024,,太原科技大学 电子信息工程学院,太原 030024,,太原科技大学 电子信息工程学院,太原 030024,

关键词:挖掘机;自主作业;轨迹规划;多智能体;PPO算法;智能决策

基金:山西省重点研发计划项目(201903D121130);山西省自然科学基金项目(201901D111265);山西省研究生创新项目(2021Y670);太原科技大学科研启动基金项目(20192014).

针对挖掘机的自主作业场景,提出基于强化学习的时间最优轨迹规划方法.首先,搭建仿真环境用于产生数据,以动臂、斗杆和铲斗关节的角度、角速度为状态观测变量,以各关节的角加速度值为动作信息,通过状态观测信息实现仿真环境与自主学习算法的交互;然后,设计以动臂、斗杆和铲斗关节运动是否超出允许范围、完成任务 总时间和目标相对距离为奖励函数对策略网络参数进行训练;最后,利用改进的近端策略优化算法(proximal policy optimization, PPO)实现挖掘机的时间最优轨迹规划.与此同时,与不同连续动作空间的强化学习算法进行对比,实验结果表明:所提出优化算法效率更高,收敛速度更快,作业轨迹更平滑,可有效避免各关节受到较大冲击,有助于挖掘机高效、平稳地作业.

来源:2024年第5期

《控制与决策》期刊编辑部

查看控制与决策杂志2024年第5期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员