国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:司彦娜,普杰信,于晓升,司鹏举,孙力帆
单位:河南科技大学 信息工程学院,河南 洛阳 471023,,河南科技大学 信息工程学院,河南 洛阳 471023,,东北大学 机器人科学与工程学院,沈阳 110169,,河南科技大学 信息工程学院,河南 洛阳 471023,,河南科技大学 信息工程学院,河南 洛阳 471023,
关键词:RBF神经网络;强化学习;Sarsa算法;连续空间;值函数近似;资格迹
基金:航空科学基金项目(20185142003);国家国防基础研究计划项目(JCKY2018419C001);河南省高等学校重点科研项目(20A120008);河南省自然科学基金项目(202300410149).
针对具有连续状态空间的无模型非线性系统,提出一种基于径向基(radial basis function,RBF)神经网络的多步强化学习控制算法.首先,将神经网络引入强化学习系统,利用RBF神经网络的函数逼近功能近似表示状态-动作值函数,解决连续状态空间表达问题;然后,结合资格迹机制形成多步Sarsa算法,通过记录经历过的状态提高系统的学习效率;最后,采用温度参数衰减的方式改进softmax策略,优化动作的选择概率,达到平衡探索和利用关系的目的.MountainCar任务的仿真实验表明:所提出算法经过少量训练能够有效实现无模型情况下的连续非线性系统控制;与单步算法相比,该算法完成任务所用的平均收敛步数更少,效果更稳定,表明非线性值函数近似与多步算法结合在控制任务中同样可以具有良好的性能.
来源:2023年第4期
《控制与决策》期刊编辑部