Page 259 - 《软件学报》2026年第6期
P. 259

2578                                                       软件学报  2026  年第  37  卷第  6  期



                                                                 10 5
                                             (4 139, 201.36)
                            200
                                                                 10 4
                           Cumulative reward  −200              Value net loss  10 3 2
                              0

                                                                 10

                           −400
                                                                 10 1
                           −600                                  10 0
                                0        2 000     4 000            0   1 000  2 000  3 000  4 000  5 000
                                           Episodes                            Episodes
                                    (g) 累计奖励: wind_ power=15          (h) 价值网络损失: wind_ power=15
                                       图 6 Lunar Lander 环境随机信息消融的性能曲线          (续)
                    如图  7  所示, 在  Thrower 环境中, 面对不同强度的动态环境随机信息影响, PGVO              展现出最稳定的优化性能,
                 且最终收敛的累计奖励最优. 虽然其达到目标性能阈值所需的训练回合并非在所有情况下最少, 但从整体来看,
                 当  HVF  具有优势时差距并不显著; 而在强干扰环境中, PGVO             较  HVF  减少了  55.6%  的训练回合. 在价值网络损失
                 方面, PGVO  和  HVF  均比  PPO  表现出更快的损失下降速度. 在保持较低价值网络损失值的同时, PGVO                  在抖动控
                 制上明显优于     HVF. 总结以上随机信息消融实验, 可以证明本算法面向不同强度的动态环境随机信息, 都能表现
                 出较为稳定的性能, 加快深度强化学习的收敛速度和提高收敛时的累计奖励.

                                                     PPO    HVF    PGVO
                                                                 10 3
                           −30
                                  (507, −40.00)
                                 (489, −39.97) (6 378, −40.00)   10 2
                          Cumulative reward  −50               alue net loss  V  10 1
                           −40



                           −60

                           −70
                                                                 10 0
                               0     5 000  10 000  15 000  20 000  0    5 000  10 000  15 000  20 000
                                          Episodes                            Episodes
                                       (a) 累计奖励: 无 h                     (b) 价值网络损失: 无 h
                           −30                                   10 3

                           −40   (630, −40.00)  (9 437, −39.97)  10 2
                          Cumulative reward  −50  (713, −39.98)  alue net loss  V



                           −60
                           −70                                   10 1

                           −80                                   10 0
                               0     5 000  10 000  15 000  20 000  0    5 000  10 000  15 000  20 000
                                          Episodes                            Episodes
                                    (c) 累计奖励: h~(0,0.05)              (d) 价值网络损失: h~(0,0.05)
                                           图 7 Thrower 环境随机信息消融的性能曲线
   254   255   256   257   258   259   260   261   262   263   264