Page 248 - 《软件学报》2026年第6期
P. 248

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2567


                 上的优势. 基于改进梯度更新过程的方法通过限制策略更新幅度或改进梯度估计来减少方差, 未能充分利用环境
                 的动态特性.
                    减基线法也是常见的降低方差的技术. Schulman 等人            [32] 提出了广义优势估计     (generalized advantage estimation,
                 GAE), 引入状态价值函数的自举, 通过         TD(λ) 误差来估计优势函数, 从而在降低方差的同时保持较低的偏差. Wu
                 等人  [33] 提出利用策略的结构性信息构建基于动作的基线函数, 针对每个因素计算独立的基线, 排除其他因素的影
                 响, 从而减少方差. Mao    等人  [34] 提出了基于元学习的方法学习一个输入依赖基线, 它综合考虑状态和整个后续输
                 入序列, 可以排除外部产生的随机扰动, 从而更准确地估计一个动作的质量, 降低方差. Guo                         等人  [17] 提出了一种信
                 息论方法, 通过学习与未来状态和奖励的互信息最大且与当前动作无关的后见向量                           (hindsight vector), 然后再获得
                 后见价值函数, 从而持续降低策略梯度方法的奖励方差, 得到稳定的训练效果. 上述基线或因没考虑到未观测随机
                 信息, 而无法消除未观测信息对动作优势估计值的影响; 或只是直观地利用了互信息, 没把握动态环境的数据生成
                 机制, 面对不同环境机制时的效果较差.
                    不同于现有降低策略梯度方差的方法, 本文从环境数据生成机制的角度出发, 利用因果模型描述动态环境中
                 不变的因果关系, 并引入隐变量刻画未观测随机信息. 基于因果编解码框架推断隐变量, 结合因果价值函数充分考
                 虑未观测随机信息的影响, 从而提高动作优势函数预估的准确性, 有效降低策略梯度方差.

                  2   基础知识

                    本文所提方法主要关于深度强化学习、策略梯度方法和结构因果模型, 下面就相关概念和基本知识予以介绍.
                  2.1   深度强化学习

                    深度强化学习      (deep reinforcement learning, DRL) 是一种机器学习方法, 通过与环境的交互来学习策略, 以最
                 大化累计奖励. 与监督学习不同, 深度强化学习不需要预先标注的数据, 而是通过试错和反馈机制来进行学习. 深
                 度强化学习中的主要组成部分包括智能体                (Agent)、环境  (Environment)、动作  (Action)、状态  (State) 和奖励
                 (Reward). 为了系统化地描述深度强化学习问题, 通常使用马尔可夫决策过程                    (Markov decision process, MDP), 如
                 图  1(b) 所示. MDP  是一个包含五元组的数学模型        ⟨S,A,P,R,γ⟩ S  是状态空间,  s t  表示在时刻  t 的状态.  A 是动作空
                                                                 .
                 间,  a t  表示智能体在时刻  t 的动作.  P 是状态转移概率,     P(s t+1 |s t ,a t ) 表示在状态   s t  执行动作  a t  后转移到下一时刻状
                 态  s t+1  的概率.  R 是奖励函数,  R(s t ,a t , s t+1 ) 表示在状态转移过程对应的奖励.  γ 是折扣因子, 用于衡量未来奖励和当
                 前奖励的相对重要性. 在        MDP  中, 智能体在深度强化学习过程中收集的轨迹为所有时刻的状态、动作和奖励的

                 集合, 记作  τ = {s 0 ,a 0 ,r 0 , s 1 ,a 1 ,r 1 ,..., s T ,a T ,r T , s T+1 }.
                  2.2   策略梯度方法
                    策略梯度方法是一类直接优化策略的深度强化学习算法, 通过最大化策略的期望回报来学习最佳策略. 如果已
                                                                                                 ∑  T  t
                 知智能体在深度强化学习过程中收集的轨迹为               τ = {s 0 ,a 0 ,r 0 , s 1 ,a 1 ,r 1 ,..., s T ,a T ,r T , s T+1 }, 该轨迹的回报  G(τ) =  γ r t.
                                                                                                    t=0
                 假设策略   π 由参数   θ a  参数化, 其性能指标表示为     J(θ a ). 策略梯度方法的目标是最大化策略的期望回报, 则            J(θ a ) =
                                                            [         (   )]
                     [G(τ)]. 策略    性能指标的梯度为                                . 为了降低策略梯度的方差, 一般引入
                 E τ∼π θa      π θ a            ∇ θ a  J(θ a ) = E τ∼π θ a  G(τ)∇ θ a  log p τ|π θ a
                 基线价值函数     V, 使策略     性能指标的梯度为:
                                    π θ a

                                                         [             (   )]
                                                                                                      (1)
                                             ∇ θ a  J(θ a ) = E τ∼π θ a  (G(τ)−V)∇ θ a  log p τ|π θ a
                  2.3   结构因果模型
                    结构因果模型      (structural causal model, SCM) [35] 提供了一种描述系统中变量之间因果关系结构的框架. 通过明
                 确定义变量之间的因果影响, 结构因果模型从因果机制层面总结了数据的生成过程, 为因果推断和分析提供了坚
                                                            .
                 实的基础. 结构因果模型        M  是一个四元组    ⟨U,X,F,P(u)⟩ U  是一组外生变量的集合     {U 1 ,U 2 ,...,U n }, 外生变量是系
                 统外部的因素或背景条件, 由模型外部因素决定.               X  是一组内生变量的集合       {X 1 ,X 2 ,...,X n }, 内生变量是模型内部需
                 要解释或预测的变量, 由其他变量           (其他内生变量和外生变量) 决定; 在内生变量             X i  的父节点集合中, 由其他内生
   243   244   245   246   247   248   249   250   251   252   253