Page 258 - 《软件学报》2026年第6期
P. 258
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2577
信息消融实验, 测试了算法面向不同强度的动态环境随机信息的性能.
如图 6 所示, 在 Lunar Lander 环境中, 面对不同强度的动态环境随机环境信息的影响, PGVO 表现出稳定的优
越性能, 是唯一一个在所有不同强度风力影响下能在 5 000 回合内达到目标性能阈值的算法. 实验观察到随着风力
增大, PGVO 和 PPO 需要更多回合进行训练, 这符合客观规律. 在价值网络损失方面, HVF 始终存在过拟合现象,
而 PGVO 的价值网络损失在训练前期表现出比 PPO 更快的下降速度, 有助于强化算法性能的快速收敛.
PPO HVF PGVO
(918, 202.57) (3 688, 200.15) 10 5
200
10 4
Cumulative reward −200 0 Value net loss 10 3 2
10
−400 10 1
−600 10 0
0 2 000 4 000 0 1 000 2 000 3 000 4 000 5 000
Episodes Episodes
(a) 累计奖励: wind_ power=0 (b) 价值网络损失: wind_ power=0
10 5
400 (3 664, 200.77)
(4 143, 200.99)
200 10 4
Cumulative reward −200 0 Value net loss 10 3 2
10
−400
10 1
−600
−800 10 0
0 2 000 4 000 0 1 000 2 000 3 000 4 000 5 000
Episodes Episodes
(c) 累计奖励: wind_ power=5 (d) 价值网络损失: wind_ power=5
(3 575, 202.83) (4 281, 200.19) 10 5
200
10 4
Cumulative reward −200 0 Value net loss 10 3 2
10
10 1
−400
10 0
0 2 000 4 000 0 1 000 2 000 3 000 4 000 5 000
Episodes Episodes
(e) 累计奖励: wind_ power=10 (f) 价值网络损失: wind_ power=10
图 6 Lunar Lander 环境随机信息消融的性能曲线

