Page 249 - 《软件学报》2026年第6期
P. 249

2568                                                       软件学报  2026  年第  37  卷第  6  期


                                        .
                 变量组成的子集被表示为         PA i F  是一组函数的集合    { f 1 , f 2 ,..., f n }, 每个函数   f i  是其他变量集合  PA i ∪{U i } 到内生变
                                                                                              ,
                                                                                    ,
                 量子集   {Y i } 的映射. 函数和各个对应的变量集构成结构方程           Y i := f i (PA i ,U i ), 其中  U i ∈ U PA i ⊆ X\X i i = 1,2,...,n.
                 结构方程明确了因果方向, 刻画了系统内部的因果关系. SCM                  的一个关键优势在于其模块化和可解释性. 通过将
                 复杂系统分解为相互关联的子模块. 这种模块化使得模型更容易构建、理解和维护, 同时也有助于识别关键的因
                 果关系和潜在的干预目标. 通过明确表示变量之间的因果关系, SCM                    使研究者能够提出和回答关于系统行为的问
                 题, 识别关键的因果机制, 并估计因果效应.

                  3   隐变量因果模型和因果价值函数

                  3.1   隐变量因果模型
                    通过上述分析可知, 策略梯度算法的高方差问题主要源于环境中的外部扰动. 这些扰动通常表现为未观测的
                 随机信息, 且可能影响下一时刻可观测的状态. 这使得                t 时刻的状态除了依赖       t–1  时刻可观测的状态和动作外, 还
                 受到  t–1  时刻的未观测的随机扰动的影响, 从而使策略梯度估计的方差增大. 以                    Gym  的  Lunar Lander 环境为例,
                 风就是一个典型的未观测随机信息. 其可能在智能体做出决策动作后, 扰动下一时刻返回的可观测状态信息. 在实
                 际环境中, 类似的未观测随机信息普遍存在, 例如机器人运行过程由于接触材料变化而引起的摩擦力变化或运输
                 车因为货物装卸而产生的不同负重等. 因此, 本文在传统深度强化学习中的马尔可夫决策过程五元组基础上, 引入
                            t
                 隐变量   h t  刻画   时刻的动态环境的未观测随机信息, 并假设存在隐变量              h t  指向下一时刻可观测状态信息        s t+1  的因
                 果边. 其因果关系如图      1(c) 所示. 因此, 在时刻  t 时, 含有隐变量的结构因果模型可以形式化为:

                                                   
                                                    a t := f a (s t )
                                                   
                                                   
                                                   
                                                   
                                                   
                                                    s t := f s (s t−1 ,a t−1 ,h t−1 )                (2)
                                                   
                                                   
                                                   
                                                   
                                                     r t := f r (s t ,a t , s t+1 )
                  3.2   因果价值函数
                    基于上述因果模型, 状态转移不仅取决于可观察状态信息和采取的动作, 还受到未观测随机信息的影响. 而奖
                 励函数会结合当前时刻的状态、动作和下一时刻的状态返回环境的反馈, 这也意味着未观测随机信息还可能影响
                 奖励信息. 在给定时刻      t 下的状态为    s t  时, 内生变量  r t  的结构方程可以展开为:

                                   r t = f r (s t ,a t , s t+1 ) = f r (s t ,a t , f s (s t ,a t ,h t )) = f r (s t , f a (s t ), f s (s t , f a (s t ),h t ))  (3)
                 可以得知与内生变量        r t  存在直接或间接因果关系的外生变量集合为            (s t ,h t ). 相同地, 在给定时刻  t+1  下的状态为
                 s t+1 , 通过结构因果模型的分析, 可以寻找与内生变量          r t+1  存在直接或间接因果关系的外生变量集合为            (s t ,h t ,h t+1 ).
                                                                                               ∑  T
                    在给定时刻     t 下的状态为    s t  时, 从时刻  t 开始累计, 到轨迹最终结束的时刻       T  的轨迹回报为   G t =    γ t ′ −t r t ′ ,
                                                                                                  t ′ =t
                 所以与  G t  存在直接或间接因果关系的外生变量集合为             (s t ,h t ,h t+1 ,...,h T ). 为了方便表示, 引入从时刻  t 开始到轨迹
                 结束的所有隐变量序列的定义:

                                                      +
                                                     h ≜ (h t ,h t+1 ,...,h T )                       (4)
                                                      t
                                                                                  +
                    因为价值函数      V  往往就是对轨迹回报      G t  的期望值的拟合, 所以   V  可以使用  (s t ,h ) 作为网络输入进行拟合. 故
                                                                                  t
                 提出因果价值函数       (CVF) 的定义如下所示:

                                                         +
                                                  V  causal  (s t ,h ) ≜ E τ∼π θ a  [ G t |s t ,h + t  ]  (5)
                                                         t
                    根据公式    (3) 可知, 奖励函数会受到隐变量的干扰. 当采用状态价值函数                 V (s t ) ≜ E τ∼π θ a  [G t |s t ]  作为基线  V t  时,
                                                                               s
                                                                                             +
                 动作优势函数     A t = G t −V t  的估计值会受到隐变量序列的影响. 这是因为轨迹回报          G t  受隐变量序列  h  的影响, 而状
                                                                                             t
                                           +
                 态价值函数并未考虑隐变量序列           h  的影响, 导致动作优势估计存在较大方差. 在样本充足且隐变量均值为                     0  的情
                                           t
                 况下, 对动作优势估计值多次求平均可实现类似无偏的效果, 但会降低数据样本效率. 而且即使通过平均实现了动
                                                                    +
                 作优势的无偏估计, 策略梯度在优化过程中仍会受到隐变量序列                     h  的影响, 导致梯度估计的方差过大并影响收敛
                                                                    t
   244   245   246   247   248   249   250   251   252   253   254