国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:余伶俐,魏亚东,霍淑欣
单位:中南大学自动化学院,长沙410083,,中南大学自动化学院,长沙410083,,中南大学自动化学院,长沙410083,
关键词:路径规划;蒙特卡罗预测;智能车辆;深度策略梯度;强化学习;决策
基金:国家重点研发计划项目(2018YFB1201602);国家自然科学基金项目(61976224);湖南省科技重大专项(2017GK1010).
针对智能车路径规划过程中常存在动态环境感知预估不足的问题,使用基于蒙特卡罗深度策略梯度学习(Monte Carlo prediction deep deterministic policy gradient,MCPDDPG)的智能车辆路径规划方法,设计一种基于环境感知预测、行为决策和控制序列生成的框架,实现实时的决策和规划,并输出连续的车辆控制序列.首先,利用序贯蒙特卡罗预估他车行为状态量;然后,设计基于强化Q学习的行为决策方法,使智能车辆实时预知碰撞风险,采取合理的规避策略;最后,构建深度策略梯度学习网络框架,获取智能车辆规划路径的最优轨迹序列.实验结果表明,所提方法能够缓解环境感知的预估不足问题,提升智能车辆行为决策的快速性,保障路径规划的主动安全,并输出连续的轨迹序列,为智能车辆导航控制提供前提.
来源:2021年第4期
《控制与决策》期刊编辑部