国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:李梦花,王鼎,赵明明,乔俊飞
单位:北京工业大学 信息科学技术学院,北京 100124;北京工业大学 计算智能与智能系统北京市重点实验室,北京 100124;北京工业大学 智慧环保北京实验室,北京 100124;北京工业大学 北京人工智能研究院,北京 100124,,北京工业大学 信息科学技术学院,北京 100124;北京工业大学 计算智能与智能系统北京市重点实验室,北京 100124;北京工业大学 智慧环保北京实验室,北京 100124;北京工业大学 北京人工智能研究院,北京 100124,,北京工业大学 信息科学技术学院,北京 100124;北京工业大学 计算智能与智能系统北京市重点实验室,北京 100124;北京工业大学 智慧环保北京实验室,北京 100124;北京工业大学 北京人工智能研究院,北京 100124,,北京工业大学 信息科学技术学院,北京 100124;北京工业大学 计算智能与智能系统北京市重点实验室,北京 100124;北京工业大学 智慧环保北京实验室,北京 100124;北京工业大学 北京人工智能研究院,北京 100124,
关键词:自适应评判设计;自适应动态规划;连续系统;零和博弈;非对称约束;初始容许控制
基金:国家自然科学基金项目(62222301, 61890930-5, 62021003);新一代人工智能国家科技重大专项(2021ZD0112302, 2021ZD0112301);北京市自然科学基金项目(JQ19013).
利用自适应评判控制方法研究具有非对称约束的连续时间零和博弈问题. 首先, 建立一种新颖的非二次型函数处理非对称约束问题, 以降低对控制矩阵的限制. 其次, 推导最优控制、最坏扰动, 以及Hamilton-Jacobi-Isaacs方程. 然后, 建立一种自适应评判控制方法以近似最优代价函数, 从而获得近似最优控制以及近似最坏扰动. 针对具有非对称约束的零和博弈问题, 提出一种新型评判学习准则来强化学习过程并消除对初始容许控制的依赖. 此外, 利用Lyapunov方法证明系统状态和评判网络权值近似误差的稳定性. 最后, 利用F-16战斗机和倒立摆两个实例验证所提算法的有效性. 同时, 给出传统学习算法下的仿真结果, 进一步说明所提新型学习准则的可行性.
来源:2025年第4期
《控制与决策》期刊编辑部