控制与决策

北大核心,JST,Pж(AJ),EI,CSCD

国内刊号:21-1124/TP

国际刊号:1001-0920

控制与决策杂志2026年第6期:基于非对称强化学习的移动机器人自主导航算法研究

发布日期:

作者:何乃峰,杨忠,许诺,卓浩泽,徐宏雨,陈凯

单位:南京航空航天大学 自动化学院,南京 210000,,南京航空航天大学 自动化学院,南京 210000,,南京航空航天大学 自动化学院,南京 210000;广东电网有限责任公司东莞供电局 东南区供电局,广东 东莞 523000,,南京航空航天大学 自动化学院,南京 210000;广西电网有限责任公司电力科学研究院 广西电力装备智能控制与运维重点实验室,南宁 530000,,南京航空航天大学 自动化学院,南京 210000,,南京航空航天大学 自动化学院,南京 210000,

关键词:移动机器人;自主导航;避障;强化学习;环境理解;域随机化

基金:广西电网公司2024年科技创新专业科技项目(GXKJXM20240152).

针对动态非结构化环境中移动机器人感知不确定性与策略泛化能力不足的挑战, 提出一种基于非对称强化学习的鲁棒自主导航策略优化框架(RANav). 该方法融合隐式环境估计、域随机化与非对称强化学习机制, 提升机器人对动态环境的建模与决策能力. 首先, 构建多模态融合的隐式环境估计网络, 以精确提取动态障碍物特征并提升场景表征能力; 其次, 引入基于行为域随机化机制, 提升策略的Sim-to-Real迁移能力; 最后, 采用非对称近端策略优化(PPO)算法, 利用特权信息优化Critic网络提升策略学习效率. 在多组仿真与真实场景实验中, RANav在导航成功率、避障鲁棒性与路径效率方面均显著优于现有方法, 充分验证了其在复杂非结构环境中的鲁棒泛化能力与实际部署潜力.

来源:2026年第6期

《控制与决策》期刊编辑部

查看控制与决策杂志2026年第6期

联系我们

  • 地址:沈阳市和平区文化路3巷11号
  • 电话:024-83687766
  • E-mail:kzyjc@mail.neu.edu.cn

咨询工作人员