国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:邓小豪,侯进,谭光鸿,万斌杨,曹婷婷
单位:西南交通大学 信息科学与技术学院,成都 611756,,西南交通大学 信息科学与技术学院,成都 611756,,西南交通大学 信息科学与技术学院,成都 611756,,西南交通大学 信息科学与技术学院,成都 611756,,西南交通大学 信息科学与技术学院,成都 611756,
关键词:自主决策;车辆跟随;半自动驾驶;强化学习;深度确定性策略梯度;马尔可夫决策过程
基金:浙江大学CAD&CG国家重点实验室开放课题(A1923);成都市科技项目(2015-HM01-00050-SF).
为满足自适应巡航系统跟车模式下的舒适性需求并兼顾车辆安全性和行车效率,解决已有算法泛化性和舒适性差的问题,基于深度确定性策略梯度算法(deep deterministic policy gradient,DDPG),提出一种新的多目标车辆跟随决策算法.根据跟随车辆与领航车辆的相互纵向运动学特性,建立车辆跟随过程的马尔可夫决策过程(Markov decision process,MDP)模型.结合最小安全距离模型,设计一个高效、舒适、安全的车辆跟随决策算法.为提高模型收敛速度,改进了DDPG算法经验样本的存储方式和抽取策略,根据经验样本重要性的不同,对样本进行分类存储和抽取.针对跟车过程的多目标结构,对奖赏函数进行模块化设计.最后,在仿真环境下进行测试,当测试环境和训练环境不同时,依然能顺利完成跟随任务,且性能优于已有跟随算法.
来源:2021年第10期
《控制与决策》期刊编辑部