Page 246 - 《软件学报》2026年第6期
P. 246
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2565
大多数策略梯度算法应用于实际场景仍面临着高方差问题 [10] . 这种方差会导致算法收敛速度变慢, 甚至可能陷入
次优解. 因此, 研究一种优化策略梯度方差的方法具有一定的实际意义和价值.
为了应对策略梯度算法中的高方差问题, 目前的工作通过重要性采样 [11] 、改进梯度更新过程 [12] 、减基线 [13]
等方式来优化策略梯度的估计. 尽管现有方法在一定程度上缓解了策略梯度算法中的高方差问题, 但它们仍然存
在一些局限性. 重要性采样方法通过计算不同策略样本的分布差异 [14] 来降低方差, 对样本内部的随机信息并不敏
感. 改进梯度更新过程的方法通过限制策略更新幅度 [15] 或改进梯度估计 [16] 来减少方差, 未能充分利用环境的动态
特性. 减基线法性能高度依赖于基线函数的选择, 而已有的基线函数未考虑环境随机机制 [17] , 应对不同随机机制
的环境表现较差.
针对这些局限性, 如何充分考虑环境随机性, 降低策略梯度估计方差, 是进一步提升策略梯度算法性能的关
键. 在实际应用中, 环境往往具有复杂的动态性和随机性, 不同状态间存在着错综复杂的关系. 传统方法难以捕捉
这些关系, 导致其在面对环境变化时表现出较大的不稳定性. 如图 1(a) 在无风时, 月球登陆车 (Lunar Lander) 在决
策动作后的落点为 B1; 但在受到风等未观测随机信息的影响时, 月球登陆车位置在相同动作决策下发生偏移, 落
点为 B2, 导致得到的奖励结果不同. 针对类似场景, 传统智能体只建模环境可观测状态、动作和奖励的马尔可夫
决策过程 (如图 1(b) 所示), 使用状态作为价值基线判断的拟合信息源, 以此计算动作优势估计值. 在不同未观测随
机信息的干扰下, 传统智能体计算的动作优势估计值会出现不同的波动, 使策略网络出现方差抖动问题. 这种情况
下, 传统的价值基线便不能辅助智能体从根本上解决环境随机性导致策略梯度高方差的问题.
无风环境 … h t−1 h t h t+1 …
B1 … a t−1 a t a t+1 … … a t−1 a t a t+1 …
有风环境 … s t−1 s t s t+1 … … s t−1 s t s t+1 …
B2 … r t−2 r t−1 r t … … r t−2 r t−1 r t …
(a) 无风和有风的 Lunar Lander 环境 (b) 传统深度强化学习模型 (c) 隐变量因果模型
图 1 隐变量因果模型建模
通过上述分析发现, 如果智能体能获得环境的随机信息, 以此辅助价值评估, 便能让策略梯度算法更准确地估
计动作优势的值. 此时, 动态环境中未观测的随机信息可能在智能体做出决策动作后, 扰动下一时刻返回的可观测
状态信息. 这部分未观测的随机信息可以刻画为隐变量, 并通过因果模型来建模如图 1(c) 所示的动作、状态和奖
励之间的互相影响机制. 因此, 本文从隐变量因果模型的视角提出了一种策略梯度方差优化 (policy gradient
variance optimization, PGVO) 方法. 该方法首先引入隐变量刻画未观测随机信息, 构建含有隐变量的结构因果模
型. 接着, 基于所构建的动态环境的结构因果模型, 以与期望回报存在直接或间接因果关系的外生变量为输入, 构
建因果价值函数 (causal value function, CVF), 识别隐变量对期望回报的影响. 最后, 上述步骤可以通过利用深度强
化学习过程中收集的轨迹数据训练因果模型, 学习动态环境因果机制. 利用因果模型推断的环境未观测随机信息,
进而使用因果价值函数评估当前时刻的价值, 降低策略梯度估值中动作优势估计值的方差.
本文主要贡献包括以下 3 个方面: (1) 提出一种基于隐变量因果模型的策略梯度方差优化方法. 引入隐变量刻
画未观测随机信息, 构建并学习隐变量因果模型. 引入因果编码网络和因果解码网络, 将难以求解的后验分布问题
转化为变分下界问题, 确保因果模型对环境因果机制的拟合能力和对未观测随机信息的推断能力. (2) 提出因果价
值函数, 结合长短期记忆网络, 根据时效性区分衡量未观测随机信息对价值估计的影响作用, 提高动作优势函数预
估的准确性, 降低策略梯度方差. (3) 在 OpenAI Gym 平台 [18] 中, 将基于隐变量因果模型的策略梯度方差优化方法

