国内刊号:21-1124/TP
国际刊号:1001-0920
发布日期:
作者:曹瑞,吕慧涛
单位:扬州大学 信息与人工智能学院,江苏 扬州 225101;北京理工大学 自主智能无人系统全国重点实验室,北京 100081,,沈阳飞机设计研究所扬州协同创新研究院有限公司,江苏 扬州 225006,
关键词:概率推理学习控制;不确定性;蒙特卡洛;量化;学习策略;演化分析
基金:江苏省自然科学基金项目(BK20230560);国家自然科学基金项目(62303400, 92371116, 52272369);自主智能无 人系统全国重点实验室开放课题项目(ZZKF2025-3-1);江苏省高等学校面上项目(23KJB590003);2022年度扬州市“绿扬金凤计划”优秀博士项目(YZLYJFJH2022YXBS109).
研究概率推理学习控制(PILCO)方法如何在决策过程中使用不确定性, 并进一步探索不确定性对PILCO优化性能的影响. 首先, 对给定策略下函数模型中不同不确定性的来源进行梳理和量化; 然后, 使用方差作为不确定性度量, 并采用总方差定律将总成本不确定性分解为两个组成部分; 最后, 引入一个金标准蒙特卡洛方案, 通过传播轨迹来近似PILCO的动力学模型, 从而分别量化成本中的随机不确定性和认知不确定性. 仿真结果表明, 当PILCO有效学习时, 它选择的是认知成本不确定性在总成本不确定性中具有高占比相关的策略.
来源:2026年第2期
《控制与决策》期刊编辑部