Page 259 - 《软件学报》2026年第6期
P. 259
2578 软件学报 2026 年第 37 卷第 6 期
10 5
(4 139, 201.36)
200
10 4
Cumulative reward −200 Value net loss 10 3 2
0
10
−400
10 1
−600 10 0
0 2 000 4 000 0 1 000 2 000 3 000 4 000 5 000
Episodes Episodes
(g) 累计奖励: wind_ power=15 (h) 价值网络损失: wind_ power=15
图 6 Lunar Lander 环境随机信息消融的性能曲线 (续)
如图 7 所示, 在 Thrower 环境中, 面对不同强度的动态环境随机信息影响, PGVO 展现出最稳定的优化性能,
且最终收敛的累计奖励最优. 虽然其达到目标性能阈值所需的训练回合并非在所有情况下最少, 但从整体来看,
当 HVF 具有优势时差距并不显著; 而在强干扰环境中, PGVO 较 HVF 减少了 55.6% 的训练回合. 在价值网络损失
方面, PGVO 和 HVF 均比 PPO 表现出更快的损失下降速度. 在保持较低价值网络损失值的同时, PGVO 在抖动控
制上明显优于 HVF. 总结以上随机信息消融实验, 可以证明本算法面向不同强度的动态环境随机信息, 都能表现
出较为稳定的性能, 加快深度强化学习的收敛速度和提高收敛时的累计奖励.
PPO HVF PGVO
10 3
−30
(507, −40.00)
(489, −39.97) (6 378, −40.00) 10 2
Cumulative reward −50 alue net loss V 10 1
−40
−60
−70
10 0
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes
(a) 累计奖励: 无 h (b) 价值网络损失: 无 h
−30 10 3
−40 (630, −40.00) (9 437, −39.97) 10 2
Cumulative reward −50 (713, −39.98) alue net loss V
−60
−70 10 1
−80 10 0
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes
(c) 累计奖励: h~(0,0.05) (d) 价值网络损失: h~(0,0.05)
图 7 Thrower 环境随机信息消融的性能曲线

