Page 258 - 《软件学报》2026年第6期
P. 258

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2577


                 信息消融实验, 测试了算法面向不同强度的动态环境随机信息的性能.
                    如图  6  所示, 在  Lunar Lander 环境中, 面对不同强度的动态环境随机环境信息的影响, PGVO              表现出稳定的优
                 越性能, 是唯一一个在所有不同强度风力影响下能在                 5 000  回合内达到目标性能阈值的算法. 实验观察到随着风力
                 增大, PGVO  和  PPO  需要更多回合进行训练, 这符合客观规律. 在价值网络损失方面, HVF                 始终存在过拟合现象,
                 而  PGVO  的价值网络损失在训练前期表现出比            PPO  更快的下降速度, 有助于强化算法性能的快速收敛.


                                                      PPO    HVF    PGVO
                                    (918, 202.57)  (3 688, 200.15)  10 5
                            200
                                                                10 4
                           Cumulative reward  −200 0            Value net loss  10 3 2



                                                                10

                           −400                                 10 1

                           −600                                 10 0
                                0        2 000      4 000           0   1 000  2 000  3 000  4 000  5 000
                                           Episodes                            Episodes
                                    (a) 累计奖励: wind_ power=0            (b) 价值网络损失: wind_ power=0
                                                                10 5
                            400              (3 664, 200.77)
                                                 (4 143, 200.99)
                            200                                 10 4
                           Cumulative reward  −200 0            Value net loss  10 3 2


                                                                10
                           −400
                                                                10 1
                           −600
                           −800                                 10 0
                                0        2 000      4 000           0   1 000  2 000  3 000  4 000  5 000
                                           Episodes                            Episodes
                                    (c) 累计奖励: wind_ power=5            (d) 价值网络损失: wind_ power=5
                                     (3 575, 202.83)  (4 281, 200.19)  10 5
                            200
                                                                10 4
                           Cumulative reward  −200 0            Value net loss  10 3 2



                                                                10

                                                                10 1
                           −400

                                                                10 0
                                0        2 000      4 000           0   1 000  2 000  3 000  4 000  5 000
                                           Episodes                            Episodes
                                    (e) 累计奖励: wind_ power=10          (f) 价值网络损失: wind_ power=10
                                         图 6 Lunar Lander 环境随机信息消融的性能曲线
   253   254   255   256   257   258   259   260   261   262   263