Page 254 - 《软件学报》2026年第6期
P. 254

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2573



                 算法  2. 基于隐变量因果模型的策略梯度算法的网络训练方法.
                                {                                            }
                                                {                            }
                                                    (l)
                                                  (l)

                                                       (l)
                                                                    (l)
                                                                      (l)
                                                                         (l)
                                                         (l)
                                                            (l)
                                                              (l)
                                     (1)
                                          (L)  (l)
                                  (0)
                 输入: L  条完整轨迹    τ ,τ ,...,τ τ = s ,a ,r , s ,a ,r ,..., s ,a ,r , s (l)  , 强化样本采样比例  ρ, 迭代次数
                                                  0  0  0  1  1  1  T  T  T  T+1
                                                                                         F φ , 已完成训练的因
                 I, 折扣因子  γ, 因果价值网络    F θ CVF  , 动作网络   F θ a  , 熵的损失加权   ω e , 裁剪系数   δ, 因果编码网络
                              φ;
                 果编码网络参数
                 输出: 因果价值网络参数       θ CVF , 动作网络参数  .
                                                   θ a
                 1. 初始化   F θ CVF ,   F θ a
                 2. for  l = 1 : L do
                 3.   for  t = 0 : T  do
                                                        (       )
                                                         (l)
                                                            (l)
                                                   (l)
                                                (l)
                 4.     推断隐变量均值和标准差:           µ t , σ t = F φ s t ,a t , s (l)
                                                               t+1
                                        (       )
                                           [  (l)  ] 2
                                   (l)
                                         (l)
                 5.     重参数化:     h t ∼ N µ t , σ t  I
                                                                     (  )
                 6.     计算更新前动作对数概率和熵:                    (l)   (l)    (l)
                                                  log pa_old t ,e_old t = F θ a  s t
                                                     (   (l) +  )
                                                      (l)
                                               (l)
                 7.     计算更新前价值评估:         V_old t = F θ a  s t ,h t
                                          ∑ T
                                       (l)
                 8.     计算轨迹回报:       G t =   γ t ′ −t (l)
                                                  t
                                                 r ′
                                            t ′ =t
                                            (l)
                                                (l)
                 9.     计算动作优势估计值:         A t = G t −V_old t (l)
                 10.   end for
                 11. end for
                 12. for  i = 1 : I do
                 13.   for  l = 1 : L do
                 14.     for  t = 0 : T  do
                                                                      (  )
                                                 (l)    (l)   (l)  (l)  (l)
                 15.       更新动作对数概率          log pa t   和熵  e t  :  log pa t ,e t = F θ a  s t
                                                 (     )
                 16.       更新价值评估:         (l)    (l)  (l) +
                                          V t = F θ a  s t ,h t
                 17.     end for
                 18.   end for
                                               {        } {                    } {               } {
                                                                                      (ρ)
                                                                                                    (ρ)
                                                                  (ρ)
                 19.   从  L  条完整轨迹的数据中采样:       A ,...,A (ρ)  , log pa_old ,...,log pa_old (ρ)  , log pa ,...,log pa (ρ)  , e ,...,
                                                 (ρ)

                                                 1     K          1           K       1        K    1
                   } {        } {       }
                  (ρ)  (ρ)  (ρ)  (ρ)   (ρ)
                 e K  , G ,...,G K  , V ,...,V K
                       1
                                 1
                                                              (ρ)
                                                       (ρ)
                 20.   计算新旧策略比率为:       α k = exp(log pa_old −log pa )
                                                       k      k
                                              1  K ∑{  [              ]        }
                                                                        (ρ)
                 21.   计算动作网络损失项:       L a = −   min α k ,clip(α k ,1−δ,1+δ) A +ω e e (ρ)
                                             K                          k     k
                                                k=1
                                                1  K ∑ 
  (ρ)
 2

                                                      (ρ)
                 22.   计算因果价值网络损失项:         L v =   
 
G −V
                                                          k
                                                      k
                                                K
                                                  k=1
                 23.   根据动作网络损失项, 更新        θ a
                 24.   根据因果网络损失项, 更新        θ CVF
                 25. end for
                  5   实验结果与分析
                  5.1   实验环境
                    本文选择使用 OpenAI Gym 平台中的        3  个经典环境: Lunar Lander、 Thrower 和  Pusher 作为实验环境, 如图  4
                 所示. OpenAI Gym 是一个流行的深度强化学习环境平台, 提供了丰富多样的环境供研究者开展实验, 涵盖了从基
                 础控制任务到复杂模拟环境的多种场景.
   249   250   251   252   253   254   255   256   257   258   259