Page 256 - 《软件学报》2026年第6期
P. 256

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2575


                 能指标: 策略的累计奖励达到目标性能阈值所需训练回合数和策略收敛后的累计奖励. 对于目标性能阈值的设定,
                 Lunar Lander 环境已明确规定累计奖励达到         200  即表示任务完成, 因此直接采用该值作为阈值. 由于              Thrower 和
                 Pusher 环境未设定明确的任务完成标准, 本文将           PPO  算法收敛后的平均奖励值向下取整至最近的               5  的倍数, 即分
                 别以−40  和−50  作为这两个环境的目标性能阈值.

                                         表 1 基于隐变量因果模型的策略梯度算法超参数

                       超参数                取值                               参数描述
                         β                10 000                    因果编解码框架的缓存池容量
                         J                 128                  因果编解码框架单轮优化网络批次采样数
                         ρ                 0.8                          强化样本采样比例
                        w KL               0.7                     因果编解码框架的KL散度项权重
                        w recon            0.3                     因果编解码框架的重构损失项权重
                         w e              0.01                            策略的熵权重
                         γ                0.99                            强化折扣因子
                         δ                 0.1                          近端策略裁剪系数
                       lr causal         0.000 3                      因果编解码框架的学习率
                         lr a            0.000 3                        动作网络的学习率
                         lr v            0.000 05                      因果价值网络的学习率
                         d h               4                            隐变量的信息维度
                         d s               256                价值网络状态处理分支的可观测状态特征的维度
                         d o               64              价值网络隐变量序列处理分支的隐变量序列特征的维度

                    表  2  和图  5  分别展示了  PPO、HVF  和  PGVO  这  3  种算法在不同环境下的性能指标结果. 表         2  记录了累计奖
                 励达到目标性能阈值所需训练回合数、累计奖励均值                   (±标准差) 和累计奖励中值, 其中性能优势指标以粗体标注.
                 对于未能在规定回合数内达到目标性能阈值的算法, 表                  2  中标记为“×”. 图  5  用虚线标识达标回合数并在其与累积
                 奖励曲线的交点处标注“(达标回合数, 达标时累计奖励)”, 未达标算法则不显示虚线.

                                         表 2 OpenAI Gym  实验不同算法的最终性能表现

                                                      Lunar Lander         Thrower           Pusher
                             性能指标                     wind_power=1         h ∼ N(0,0.01)     h ∼ N(0,0.01)
                                                  PPO    HVF   PGVO    PPO  HVF  PGVO   PPO   HVF  PGVO
                 累计奖励达到目标性能阈值所需训练回合数              4 098   ×     1 555  6 523  489  496  11 503  6 459  5 564
                            累计奖励均值               197.69  57.39  238.89  −39.11 −34.47 −30.91  −46.88 −47.88 −42.94
                             (±标准差)              (±13.65) (±129.21) (±25.78) (±0.98) (±1.65) (±0.91) (±2.21) (±5.01) (±1.74)
                            累计奖励中值               201.37  9.35  247.28  −38.76 −34.36 −30.90  −47.21 −49.39 −42.63

                    在  Lunar Lander 环境中, PGVO  达到目标性能阈值所需的训练回合数从            PPO  的  4 098  回合减少至  1 555  回合
                 (减少  62.05%). 实验表明, 训练完成时    PGVO  在累计奖励的均值和中值方面均显著优于对比算法, 具体而言, 均值
                 较  PPO  提升  41.2 (提升  20.84%), 中值较  PPO  提升  45.91 (提升  22.8%). 值得注意的是, 尽管  PPO  的标准差较低,
                 但  PGVO  在最大方差情况下的性能仍优于          PPO  的最佳表现. 在价值网络损失方面, PGVO         呈现出最为显著的前期
                 下降趋势, 这从侧面验证了其能以最少训练回合数达到目标性能阈值的合理性. 相比之下, HVF                            虽然价值网络损
                 失下降迅速, 但在经过      5 000  回合训练后累计奖励仍未达到        200  点的目标阈值. 深入分析表明, 这可能源于          HVF  未
                 能有效捕捉动态环境的因果结构, 在还原额外信息时过度依赖奖励信息, 导致价值网络过拟合. 此外, 作为降低策
                 略梯度方差的算法, PGVO      在网络优化时间上明显优于          HVF.
                    在  Thrower 环境中, PGVO  达到目标性能阈值所需的训练回合数从              PPO  的  6 523  回合显著降低至  496  回合
                 (减少  92.4%). 实验数据表明, 训练结束时       PGVO  的累计奖励均值较       PPO  提升  8.2 (增长  20.97%), 较  HVF  提升
                 3.56 (增长  10.33%); 中值较  PPO  提升  7.86 (增长  20.28%), 较  HVF  提升  3.46 (增长  10.07%). 需要指出的是, HVF  虽
                 在达到阈值的回合数上略优于           PGVO (减少  1.41%), 但其最终累计奖励表现不及        PGVO (降低  11.5%). 通过价值网
   251   252   253   254   255   256   257   258   259   260   261