控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2024年第5期:基于环境反馈机制的四足机器人运动技能学习

发布日期:

作者:张思远,朱晓庆,阮晓钢,李春阳,刘鑫源

单位:北京工业大学 信息学部,北京 100124;北京计算智能与智能系统重点实验室,北京 100124,,北京工业大学 信息学部,北京 100124;北京计算智能与智能系统重点实验室,北京 100124,,北京工业大学 信息学部,北京 100124;北京计算智能与智能系统重点实验室,北京 100124,,北京工业大学 信息学部,北京 100124;北京计算智能与智能系统重点实验室,北京 100124,,北京工业大学 信息学部,北京 100124;北京计算智能与智能系统重点实验室,北京 100124,

关键词:强化学习;四足机器人;仿生步态学习;环境探索;状态反馈引导

基金:国家自然科学基金项目(62103009);北京市自然科学基金项目(4202005).

哺乳动物的运动学习机制已得到广泛研究,犬科动物可以根据环境反馈的引导性信息自主地学习运动技能,对其提供更为特定的训练引导可以加快其对相关任务的学习速度.受上述启发,在软演员-评论家算法(SAC)的基础上提出一种基于期望状态奖励引导的强化学习算法(DSG-SAC),利用环境中的状态反馈机制来引导四足机器人进行有效探索,可以提高四足机器人仿生步态学习效果,并提高训练效率.在该算法中,策略网络与评价网络先近似拟合期望状态观测与当前状态的误差,再经过当前状态的正反馈后输出评价函数与动作,使四足机器人朝着期望的方向动作.将所提出算法在四足机器人上进行验证,通过实验结果可知,所提出的算法能够完成四足机器人的仿生步态学习.进一步,设计消融实验来探讨超参数温度系数和折扣因子对算法的影响,实验结果表明,改进后的算法具有比单纯的SAC算法更加优越的性能.

来源:2024年第5期

《控制与决策》期刊编辑部

查看控制与决策杂志2024年第5期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员