Page 256 - 《软件学报》2026年第6期
P. 256
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2575
能指标: 策略的累计奖励达到目标性能阈值所需训练回合数和策略收敛后的累计奖励. 对于目标性能阈值的设定,
Lunar Lander 环境已明确规定累计奖励达到 200 即表示任务完成, 因此直接采用该值作为阈值. 由于 Thrower 和
Pusher 环境未设定明确的任务完成标准, 本文将 PPO 算法收敛后的平均奖励值向下取整至最近的 5 的倍数, 即分
别以−40 和−50 作为这两个环境的目标性能阈值.
表 1 基于隐变量因果模型的策略梯度算法超参数
超参数 取值 参数描述
β 10 000 因果编解码框架的缓存池容量
J 128 因果编解码框架单轮优化网络批次采样数
ρ 0.8 强化样本采样比例
w KL 0.7 因果编解码框架的KL散度项权重
w recon 0.3 因果编解码框架的重构损失项权重
w e 0.01 策略的熵权重
γ 0.99 强化折扣因子
δ 0.1 近端策略裁剪系数
lr causal 0.000 3 因果编解码框架的学习率
lr a 0.000 3 动作网络的学习率
lr v 0.000 05 因果价值网络的学习率
d h 4 隐变量的信息维度
d s 256 价值网络状态处理分支的可观测状态特征的维度
d o 64 价值网络隐变量序列处理分支的隐变量序列特征的维度
表 2 和图 5 分别展示了 PPO、HVF 和 PGVO 这 3 种算法在不同环境下的性能指标结果. 表 2 记录了累计奖
励达到目标性能阈值所需训练回合数、累计奖励均值 (±标准差) 和累计奖励中值, 其中性能优势指标以粗体标注.
对于未能在规定回合数内达到目标性能阈值的算法, 表 2 中标记为“×”. 图 5 用虚线标识达标回合数并在其与累积
奖励曲线的交点处标注“(达标回合数, 达标时累计奖励)”, 未达标算法则不显示虚线.
表 2 OpenAI Gym 实验不同算法的最终性能表现
Lunar Lander Thrower Pusher
性能指标 wind_power=1 h ∼ N(0,0.01) h ∼ N(0,0.01)
PPO HVF PGVO PPO HVF PGVO PPO HVF PGVO
累计奖励达到目标性能阈值所需训练回合数 4 098 × 1 555 6 523 489 496 11 503 6 459 5 564
累计奖励均值 197.69 57.39 238.89 −39.11 −34.47 −30.91 −46.88 −47.88 −42.94
(±标准差) (±13.65) (±129.21) (±25.78) (±0.98) (±1.65) (±0.91) (±2.21) (±5.01) (±1.74)
累计奖励中值 201.37 9.35 247.28 −38.76 −34.36 −30.90 −47.21 −49.39 −42.63
在 Lunar Lander 环境中, PGVO 达到目标性能阈值所需的训练回合数从 PPO 的 4 098 回合减少至 1 555 回合
(减少 62.05%). 实验表明, 训练完成时 PGVO 在累计奖励的均值和中值方面均显著优于对比算法, 具体而言, 均值
较 PPO 提升 41.2 (提升 20.84%), 中值较 PPO 提升 45.91 (提升 22.8%). 值得注意的是, 尽管 PPO 的标准差较低,
但 PGVO 在最大方差情况下的性能仍优于 PPO 的最佳表现. 在价值网络损失方面, PGVO 呈现出最为显著的前期
下降趋势, 这从侧面验证了其能以最少训练回合数达到目标性能阈值的合理性. 相比之下, HVF 虽然价值网络损
失下降迅速, 但在经过 5 000 回合训练后累计奖励仍未达到 200 点的目标阈值. 深入分析表明, 这可能源于 HVF 未
能有效捕捉动态环境的因果结构, 在还原额外信息时过度依赖奖励信息, 导致价值网络过拟合. 此外, 作为降低策
略梯度方差的算法, PGVO 在网络优化时间上明显优于 HVF.
在 Thrower 环境中, PGVO 达到目标性能阈值所需的训练回合数从 PPO 的 6 523 回合显著降低至 496 回合
(减少 92.4%). 实验数据表明, 训练结束时 PGVO 的累计奖励均值较 PPO 提升 8.2 (增长 20.97%), 较 HVF 提升
3.56 (增长 10.33%); 中值较 PPO 提升 7.86 (增长 20.28%), 较 HVF 提升 3.46 (增长 10.07%). 需要指出的是, HVF 虽
在达到阈值的回合数上略优于 PGVO (减少 1.41%), 但其最终累计奖励表现不及 PGVO (降低 11.5%). 通过价值网

