Page 247 - 《软件学报》2026年第6期
P. 247

2566                                                       软件学报  2026  年第  37  卷第  6  期


                 (PGVO) 分别与  PPO (proximal policy optimization) [19] 和  HVF (hindsight value function) [17] 进行对比, 验证了本方法
                 的优越性和稳定性.

                  1   相关工作

                  1.1   隐因果强化学习
                    因果关系在深度强化学习中的应用已取得显著成效, 为解决模型“黑盒”问题提供了新视角, 提升了系统可解
                 释性. Lin  等人  [20] 提出了面向自动驾驶的安全感知因果表征方法, 通过将因果结构融入离线强化学习, 显著提高了
                 决策的可信度与安全性. Chen       等人  [21] 研究了因果感知大语言模型, 展示了如何通过因果学习增强深度强化学习智
                 能体的决策能力, 使其能更好地适应和行动. Wang             等人  [22] 开发的  ERCI 方法将可解释的经验回放与因果推断相结
                 合, 使深度强化学习系统能够解释其学习过程和决策依据. Cao                 等人  [23] 的研究则聚焦于因果信息优先级排序, 通过
                 识别关键因果因素提高了深度强化学习的效率. 这些研究表明, 因果推理正成为连接深度强化学习性能与可解释
                 性的重要桥梁, 使决策更具可解释性.
                    在这些因果强化学习方法中, 隐因果强化学习作为一个新兴分支与本工作密切相关. 隐因果强化学习主要通
                 过隐变量建模环境中的本质特征和不确定性, 可分为两个主要研究方向.
                    在环境表征与建模方面, 隐变量用于捕获环境中的本质特征和不确定性. Zhang                       等人  [24] 通过双向训练提取任
                 务相关的因果信息, 构建环境的稳定表征, 在连续控制任务中实现了优异的泛化性能. Bennett 等人                         [25] 针对离线强
                 化学习, 通过隐变量显式建模未观测的混杂因素, 在保持计算效率的同时提升了模型泛化能力.
                    在环境适应与迁移方面, 研究者提出了基于隐变量分解的方法. Huang                   等人  [26] 设计了变分推断框架, 通过预训
                 练实现环境变化的多维度分解. Feng         等人  [27] 采用因子分解方法处理环境迁移, 利用结构化隐变量表示提升了知识
                 迁移效果和可解释性.
                    然而, 现有基于隐变量建模的因果强化学习方法主要关注环境表征与迁移问题, 对策略梯度估计中的高方差
                 问题尚缺乏有效解决方案. 策略梯度方差过大不仅降低收敛速度, 还会影响收敛时累计奖励的性能. 本文从因果模
                 型角度出发, 提出一种新的方差降低方法, 通过因果结构的显式建模提升策略梯度估计的准确性与稳定性.
                  1.2   降低策略梯度方差的方法
                    策略梯度方法的发展始于早期的            REINFORCE  算法, 其主要基于直接优化策略函数和使用梯度上升的思想.
                 在策略梯度方法中, 策略梯度估值的方差会影响算法的收敛速度和性能, 对算法的稳定性和训练效率有着重要的
                 影响. 为了降低策略梯度估值的方差, 研究者们提出了多种方法.
                    一种常见的方法是重要性采样. Thomas 等人           [14] 提出了一种数据高效的离策略        (off-policy) 策略评估方法, 用
                 重要性采样提升评估准确性和效率. Gu           等人  [28] 在  Q-Prop  中结合离策略价值估计, 通过重要性采样减小方差, 提高
                 样本效率. Espeholt 等人  [29] 在  IMPALA  中采用重要性加权修正不同策略采样的数据, 实现大规模分布式深度强化
                 学习. Gruslys 等人  [30] 在  Reactor 中使用快速且样本高效的  Actor-Critic 算法, 结合重要性采样实现高效学习. 基于
                 重要性采样的方法虽然能识别样本间的策略分布差异, 降低这部分差异造成的策略梯度估值方差, 但它不能捕获
                 样本中环境机制的随机性, 无法解决因此产生的高方差问题.
                    另一种常见的方法是改进梯度更新过程. Schulman             等人  [15] 提出了信任域策略优化     (trust region policy optimi-
                 zation, TRPO) 算法, 通过约束策略更新的步长, 在保证单调提升的同时, 有效地控制了策略变化的幅度, 提高了训
                 练的稳定性. Schulman  等人  [19] 进一步提出了近端策略优化       (proximal policy optimization, PPO) 算法, 通过引入替代
                 目标函数和策略裁剪技术, 在         TRPO  的基础上简化了优化过程, 使得算法更易于实现和调参. Papini 等人               [12] 提出了
                 随机方差减少策略梯度         (stochastic variance reduced policy gradient, SVRPG) 算法, 通过引入方差减少技术, 如
                 SVRG  和  SAGA, 来降低策略梯度估计的方差, 提高了训练效率和稳定性. Liu               等人  [16] 对策略梯度和自然策略梯度
                 方法进行了改进分析, 提出了新的方差减少技术, 并给出了收敛性保证, 进一步提高了这些方法的理论基础和实践
                 效果. Xu  等人  [31] 对  SVRPG  算法进行了改进分析, 提供了更紧致的收敛界, 展示了该算法在方差减少和收敛速度
   242   243   244   245   246   247   248   249   250   251   252