Page 257 - 《软件学报》2026年第6期
P. 257

2576                                                       软件学报  2026  年第  37  卷第  6  期


                 络收敛特性分析, PGVO      较  PPO  表现出更快的下降速度, 较       HVF  表现出更小的稳态振荡. 同时, 网络优化时间的
                 对比结果进一步验证了        PGVO  的优越性.

                                                      PPO    HVF    PGVO
                            (1 555, 200.98) (4 098, 202.73)  10 5            1 000
                    200                         10 4                          800
                   Cumulative reward  −200 0   Value net loss  10 3 2        Net opt time  600

                                                                              400
                                                10
                   −400
                   −600                         10 1 0                        200 0
                                                10
                        0     2 000   4 000        0  1 000  2 000 3 000 4 000 5 000  0  1 000  2 000 3 000 4 000 5 000
                               Episodes                    Episodes                      Episodes
                         (a) Lunar Lander 累计奖励:     (b) Lunar Lander 价值网络损失:      (c) Lunar Lander 网络优化时间:
                             wind_ power=1               wind_ power=1                 wind_ power=1
                    −30                         10 3
                          (489, −40.00)           2                          6 000
                   Cumulative reward  −50  (6 523, −39.99)  Value net loss  10 1  Net opt time  4 000
                          (496, −39.99)
                    −40

                                                10
                    −60
                                                                             2 000
                    −70                                                         0
                                                10 0
                        0  5 000  10 000 15 000 20 000  0  5 000  10 000 15 000 20 000  0  5 000  10 000 15 000 20 000
                               Episodes                    Episodes                      Episodes
                       (d) Thrower 累计奖励: h~(0,0.01)  (e) Thrower 价值网络损失: h~(0,0.01)  (f) Thrower 网络优化时间: h~(0,0.01)
                    −40    (5 564, −50.00)  (6 459, −49.99)  10 3            6 000
                                                                             5 000
                                    (11 503, −49.99)
                  Cumulative reward  −100       Value net loss  10 2 1      Net opt time  4 000
                    −60
                    −80
                                                                             3 000
                                                                             2 000
                                                10
                   −120
                   −140                         10 0                         1 000 0
                        0  5 000  10 000 15 000 20 000  0  5 000  10 000 15 000 20 000  0  5 000  10 000 15 000 20 000
                               Episodes                    Episodes                      Episodes
                       (g) Pusher 累计奖励: h~(0,0.01)  (h) Pusher 价值网络损失: h~(0,0.01)  (i) Pusher 网络优化时间: h~(0,0.01)
                             图 5 OpenAI Gym  训练过程中累计奖励、网络优化时间和价值损失的可视化曲线

                    在  Pusher 环境中, PGVO  达到目标性能阈值所需的训练回合数为              5 564  回合, 相较于  PPO  的  11 503  回合和
                 HVF  的  6 459  回合分别减少  51.6%  和  13.86%. 实验结果表明, 训练完成时     PGVO  的累计奖励均值较       PPO  提升
                 3.94 (增长  8.4%), 较  HVF  提升  4.94 (增长  10.32%); 中值较  PPO  提升  4.58 (增长  9.7%), 较  HVF  提升  6.76 (增长
                 13.69%). 通过价值网络损失分析可知, PGVO        不仅具有比     PPO  更快的收敛速度, 且在稳定后较         HVF  呈现更小的
                 方差. 此外, 在网络优化时间方面, PGVO        相较  HVF  也具有一定优势.
                    通过对   3  个环境的实验分析可知, PGVO       在训练效率、性能稳定性和优化效率等方面均表现出明显优势. 这
                 主要得益于    PGVO  能够通过隐变量因果模型有效刻画动态环境中的数据生成机制, 以此推断未观测随机信息, 进
                 而降低策略梯度优化的方差, 加速策略梯度算法收敛并提升其累计奖励表现.
                  5.4   消融实验
                    为了评估本文方法的稳定性和有效性, 基于上述实验, 在                  Lunar Lander 环境和  Thrower 环境做了未观测随机
   252   253   254   255   256   257   258   259   260   261   262