Page 257 - 《软件学报》2026年第6期
P. 257
2576 软件学报 2026 年第 37 卷第 6 期
络收敛特性分析, PGVO 较 PPO 表现出更快的下降速度, 较 HVF 表现出更小的稳态振荡. 同时, 网络优化时间的
对比结果进一步验证了 PGVO 的优越性.
PPO HVF PGVO
(1 555, 200.98) (4 098, 202.73) 10 5 1 000
200 10 4 800
Cumulative reward −200 0 Value net loss 10 3 2 Net opt time 600
400
10
−400
−600 10 1 0 200 0
10
0 2 000 4 000 0 1 000 2 000 3 000 4 000 5 000 0 1 000 2 000 3 000 4 000 5 000
Episodes Episodes Episodes
(a) Lunar Lander 累计奖励: (b) Lunar Lander 价值网络损失: (c) Lunar Lander 网络优化时间:
wind_ power=1 wind_ power=1 wind_ power=1
−30 10 3
(489, −40.00) 2 6 000
Cumulative reward −50 (6 523, −39.99) Value net loss 10 1 Net opt time 4 000
(496, −39.99)
−40
10
−60
2 000
−70 0
10 0
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes Episodes
(d) Thrower 累计奖励: h~(0,0.01) (e) Thrower 价值网络损失: h~(0,0.01) (f) Thrower 网络优化时间: h~(0,0.01)
−40 (5 564, −50.00) (6 459, −49.99) 10 3 6 000
5 000
(11 503, −49.99)
Cumulative reward −100 Value net loss 10 2 1 Net opt time 4 000
−60
−80
3 000
2 000
10
−120
−140 10 0 1 000 0
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes Episodes
(g) Pusher 累计奖励: h~(0,0.01) (h) Pusher 价值网络损失: h~(0,0.01) (i) Pusher 网络优化时间: h~(0,0.01)
图 5 OpenAI Gym 训练过程中累计奖励、网络优化时间和价值损失的可视化曲线
在 Pusher 环境中, PGVO 达到目标性能阈值所需的训练回合数为 5 564 回合, 相较于 PPO 的 11 503 回合和
HVF 的 6 459 回合分别减少 51.6% 和 13.86%. 实验结果表明, 训练完成时 PGVO 的累计奖励均值较 PPO 提升
3.94 (增长 8.4%), 较 HVF 提升 4.94 (增长 10.32%); 中值较 PPO 提升 4.58 (增长 9.7%), 较 HVF 提升 6.76 (增长
13.69%). 通过价值网络损失分析可知, PGVO 不仅具有比 PPO 更快的收敛速度, 且在稳定后较 HVF 呈现更小的
方差. 此外, 在网络优化时间方面, PGVO 相较 HVF 也具有一定优势.
通过对 3 个环境的实验分析可知, PGVO 在训练效率、性能稳定性和优化效率等方面均表现出明显优势. 这
主要得益于 PGVO 能够通过隐变量因果模型有效刻画动态环境中的数据生成机制, 以此推断未观测随机信息, 进
而降低策略梯度优化的方差, 加速策略梯度算法收敛并提升其累计奖励表现.
5.4 消融实验
为了评估本文方法的稳定性和有效性, 基于上述实验, 在 Lunar Lander 环境和 Thrower 环境做了未观测随机

