摘要: 提出了一种在线积分策略迭代算法,用来求解内部非线性动力模型未知的双人非零和博弈问题.通过在控制策略和干扰策略中引入探测信号,从而避开了系统的模型信息,得到了一个求解非零和博弈的无模型的近似动态规划算法.该算法同步更新值函数、控制策略、扰动策略,并且最终得到收敛的策略权值.在算法实现过程中,使用4个神经网络分别近似两个值函数、控制策略和扰动策略,使用最小二乘法估计神经网络的未知参数.最后仿真结果验证了算法的有效性.
                                                        
                            
                              
                             
                            
                            																								
								
																中图分类号: 
																 
								
								
																                            
                            
                                
                                    
                                
                                
                                    
                                        															杨明, 罗艳红, 王义贺. 模型未知非零和博弈问题的策略迭代算法[J]. 东北大学学报:自然科学版, 2015, 36(3): 318-322.	
																																									     												                                                                                                        	                                                                                                                      YANG Ming, LUO Yan-hong, WANG Yi-he. Policy Iteration Algorithm for Nonzero-Sum Games with Unknown Models[J]. Journal of Northeastern University Natural Science, 2015, 36(3): 318-322.