摘要: 提出了一种在线积分策略迭代算法,用来求解内部非线性动力模型未知的双人非零和博弈问题.通过在控制策略和干扰策略中引入探测信号,从而避开了系统的模型信息,得到了一个求解非零和博弈的无模型的近似动态规划算法.该算法同步更新值函数、控制策略、扰动策略,并且最终得到收敛的策略权值.在算法实现过程中,使用4个神经网络分别近似两个值函数、控制策略和扰动策略,使用最小二乘法估计神经网络的未知参数.最后仿真结果验证了算法的有效性.
中图分类号:
杨明, 罗艳红, 王义贺. 模型未知非零和博弈问题的策略迭代算法[J]. 东北大学学报:自然科学版, 2015, 36(3): 318-322.
YANG Ming, LUO Yan-hong, WANG Yi-he. Policy Iteration Algorithm for Nonzero-Sum Games with Unknown Models[J]. Journal of Northeastern University Natural Science, 2015, 36(3): 318-322.