Page 250 - 《软件学报》2026年第6期
P. 250

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2569


                                                                                               h  对轨迹回
                                                                                                +
                 速度和收敛时累计奖励的性能. 因此, 本文采用因果价值函数作为基线                      V t , 以此充分考虑隐变量序列
                                                                                                t
                 报  G t  的影响, 提高动作优势预估的准确性并降低策略梯度的方差.

                                                                   +
                                                     A t = G t −V  causal (s t ,h )                   (6)
                                                                   t
                    定理  1. 假设数据的生成机制满足公式          (2), 那么基于因果价值函数的策略梯度估计是无偏的.
                    证明: 引入因果价值函数作为基线函数后, 策略梯度可以表示为:

                                        [(      causal )  (  ) ]
                                         G(τ)−V
                            ∇ θ a  J(θ a ) = E τ∼π θa  ∇ θ a  log p τ|π θ a
                                                                       
                                              T
                                            ∑(             )           
                                                       (   )           
                                                    causal  +          
                                   = E s 0:T+1 ,a 0:T ,r 0:T    G t −V  s t ,h  ∇ θ a  logπ θ a  (a t |s t )  
                                                          t            
                                             t=0
                                              T                      T                   
                                            ∑                      ∑                     
                                                                         (   )           
                                                                      causal  +          
                                   = E s 0:T+1 ,a 0:T ,r 0:T    G t ∇ θ a  logπ θ a  (a t |s t )  −E s 0:T+1 ,a 0:T    V  s t ,h ∇ θ a  logπ θ a  (a t |s t )    (7)
                                                                               t
                                                            
                                                                                         
                                             t=0                      t=0
                                                                              T ∑   (    )
                                                                                        +
                    根据环境的因果模型展开,         V causal  ( s t ,h + t  )   中   s t 和h  都不是关于  a t  的函数, 且   V  causal  s t ,h ∇ θ a  logπ θ a (a t |s t ) 涉及
                                                         +
                                                                                        t
                                                         t
                                                                              t=0
                   s 0:T 、               s T+1 , 可得:
                 的     h 0:T  和   a 0:T  都不依赖于

                                     T                            T                    
                                   ∑                            ∑                      
                                       causal  (  + )               causal  (  +  )    
                                                                                       
                                                                             t
                             E s 0:T+1 ,a 0:T    V  s t ,h ∇ θ a  logπ θ a  (a t |s t )  = E s 0:T ,a 0:T    V  s t ,h ∇ θ a  logπ θ a  (a t |s t )  
                                                           
                                              t
                                                                                       
                                    t=0                            t=0
                                                              T ∑
                                                                   [    (   )           ]
                                                                           +
                                                            =   E s t ,a t  V  causal  s t ,h ∇ θ a  logπ θ a (a t |s t )
                                                                           t
                                                              t=0
                                                                  {    (   )   [           ] }
                                                              T ∑
                                                                          +
                                                            =   E s t  V  causal  s t ,h ×E a t  ∇ θ a  logπ θ a (a t |s t )
                                                                          t
                                                              t=0
                                                              T ∑
                                                                  [    (   )  ]
                                                                          +
                                                            =      V  causal  s t ,h ×0
                                                                          t
                                                                E s t
                                                              t=0
                                                            = 0                                       (8)
                                                                      
                                                         T
                                                        ∑             
                    综合公式    (7) 和  (8), 易证   J(θ a ) = E s 0:T+1 ,a 0:T ,r 0:T      (a t |s t )  , 故定理  1  成立.
                                                                       
                                                                       
                                        ∇ θ a
                                                          G t ∇ θ a  logπ θ a  
                                                         t=0
                    定理  2. 相对于以状态价值函数作为基线函数, 基于因果价值函数的策略梯度算法在动作优势估计值上的方
                 差更小.
                    证明: 引入因果价值函数作为基线函数后, 策略梯度估值中动作优势估计值的方差为:

                                                                               ]
                     [        (   ) ]  ⟨ {[      (   )    }⟩  ⟨ {[       (   )    }⟩
                                                      ]
                    V G t −V  causal  s t ,h + t  = E V G t −V  causal  s t ,h +  s t ,h + t  +V E G t −V causal  s t ,h +  s t ,h + t
                                                     t
                                                                              t
                                      [ (     )]  { [    (   )   ]}   { (    )   [    (   )   ]}
                                   = E V G t s t ,h +  −E V V  causal  s t ,h s t ,h +  +V E G t s t ,h +  −E V  causal  s t ,h s t ,h +

                                                             +

                                                                                            +
                                              t              t    t            t            t    t
                                      [ (     )]  { (     )   [  (    )   ]}

                                                                       +

                                   = E V G t s t ,h +  +V E G t s t ,h +  −E E G t |s t ,h s t ,h +
                                              t            t           t    t
                                      [ (     )]  { (     )   (     ) }


                                   = E V G t s t ,h + t  +V E G t s t ,h + t  −E G t |s t ,h + t
                                      [ (     )]

                                   = E V G t s t ,h +                                                (9)
                                              t
                                                    {         }         { [             ]}
                         [    ]   {      [    ]} 2  [        ] 2           causal  (  )   +
                                                                                  +
                 其中, 由  V f (x)|x = E⟨ f(x)−E f(x)|x  ⟩ = E f(x)− f(x)  = 0, 可知  E V V  s t ,h s t ,h  = 0. 结合公式  (5) 给
                                                                                  t    t
                 出的因果价值函数定义, 可推导出公式            (9) 第  3  个等式.
                    使用状态价值函数作为基线函数时, 策略梯度估值中动作优势估计值的方差为:

                                                            { [ (     )]  [ (     )]}
                                          s

                                   V[G t −V (s t )] = E[V(G t |s t )] = E E V G t s t ,h +  +V E G t s t ,h +

                                                                      t            t
                                                 [ (     )]  { [ (     )]}


                                              = E V G t s t ,h + t  +E V E G t s t ,h + t
                                                 [ (     )]   [       (   ) ]

                                              ⩾ E V G t s t ,h +  = V G t −V  causal  s t ,h +      (10)
                                                         t                t
                 其中, 利用公式    (9) 的证明逻辑可以证明公式       (10) 第  1 个等式, 利用  V(y) = E V(y|x) +V E(y|x)  可以证明公式  (10)
                                                                                ]
                                                                                    [
                                                                                         ]
                                                                           [
   245   246   247   248   249   250   251   252   253   254   255