Page 251 - 《软件学报》2026年第6期
P. 251

2570                                                       软件学报  2026  年第  37  卷第  6  期


                 第  2  个等式.
                                                        [
                    综合公式    (9) 和  (10), 易证得  V[G t −V (s t )] ⩾ V G t −V causal  ( s t ,h + t  )] , 故定理  2  成立.
                                                 s
                  4   算法实现

                  4.1   学习隐变量因果模型
                    本文受因果模型和变分推断的启发, 提出了基于隐变量因果模型的因果编解码框架                             (如图  2  所示). 该框架通
                 过引入隐变量刻画未观测随机信息, 旨在实现隐变量因果模型的学习和隐变量的推断. 框架主要包含因果编码网
                 络  (causal encoder) 和因果解码网络  (causal decoder) 两个核心组件. 因果编码网络基于变分推断方法, 利用观测信
                 息推断隐变量的变分后验分布. 具体而言, 编码网络首先推断后验分布的参数                        (如均值和方差), 随后在假设隐变量
                 服从先验分布的条件下, 采用重参数化技巧实现端到端的有效优化. 这一设计既保证了优化效率, 又保持了因果模
                 型在表示和推理因果关系方面的能力. 因果解码网络则基于推断的隐变量, 结合当前时刻的可观测状态与动作信
                 息, 对下一时刻的可观测状态进行重构预测, 从而拟合状态转移的数据生成机制. 通过对比重构状态与真实观测状
                 态之间的偏差, 可有效评估因果模型的拟合性能. 最终, 该框架通过编码和解码网络的协同作用, 实现了对隐变量
                 因果机制的有效拟合和轨迹中隐变量信息的准确推断.




                                  s t                    μ t    s t
                                                                                      ˆ
                                         Causal encoder                Causal decoder
                                 s t+1                   σ t    h t                   s t+1
                                  a t                    ε t    a t
                                                       (0, 1)
                                            图 2 基于结构因果模型的因果编解码框架

                    在该框架下, 首先将轨迹中所有时刻信息的联合概率建模为一个边缘对数似然. 这个边缘对数似然是通过将
                 每个时刻的隐变量边缘化而得到的. 然后, 利用因果模型内在的因果依赖关系, 结合变分推断技术, 将这个边缘对
                 数似然进一步拆解, 以便于计算和优化. 通过这种方式, 原本难以求解的后验概率问题被转化为优化变分下界
                 (evidence lower bound, ELBO) 的问题. 设引入的因果编码网络参数为       φ, 因果解码网络为     ψ, 则轨迹中所有时刻信
                 息的对数联合概率为:

                                                           T ∑
                                                                (                      )
                           log p(s 0 ,a 0 ,r 0 , s 1 ,a 1 ,r 1 ,..., s T ,a T ,r T , s T+1 ) =  D KL q φ (h t |s t ,a t , s t+1 ) ∥ p(h t |s t ,a t , s t+1 ) + ELBO  (11)
                                                           t=0
                 其中, 等式右侧第     1  项表示近似后验分布      (由因果编码网络推断) 和真实后验分布的             Kullback-Leibler 散度  (KL  散
                 度) 在所有时刻上的总和, 反映轨迹中因果编码网络在拟合真实后验分布时的误差. 事实上, KL                           散度是非负的. 又
                 由于近似后验分布与真实后验分布在实际应用中几乎不可能完全相同, 这一项恒大于                                0. 等式右侧第    2  项为
                 ELBO. 通过最大化    ELBO, 使近似后验分布更好地拟合真实后验分布, 即提高因果编码网络对隐变量的推断能力.
                 ELBO  通过因果模型内在的因果依赖关系, 进一步展开:

                                           T ∑                         T ∑
                                                                            (               )
                            ELBO =log p(s 0 )+  E h t ∼q φ (h t |s t ,a t ,s t+1 ) log p ψ (s t+1 |s t ,a t ,h t )−  D KL q φ (h t |s t ,a t , s t+1 ) ∥ p(h t )
                                           t=0                        t=0
                                     T ∑          T ∑
                                   +   logπ θ a (a t |s t )+  log p R (r t |s t ,a t , s t+1 )       (12)
                                    t=0          t=0
                    因为   p(s 0 ) 为样本给定的固定数值、     π θ a (a t |s t ) 由动作网络决定、 p R (r t |s t ,a t , s t+1 ) 由环境奖励机制决定, 都与因
   246   247   248   249   250   251   252   253   254   255   256