Page 147 - 《软件学报》2026年第2期
P. 147

626                                                        软件学报  2026  年第  37  卷第  2  期


                    (1)   f j  在每个分量上是非线性的.
                                                                                      ∂ 2     ( )
                    (2) 关于每个外源噪声变量        U j , 其分布密度函数   p n   关于  U j  值域的每个取值   u j  有   log p n  u j  等于某个
                                                           N j                      (  ) 2  N j
                                                                                     ∂u j
                                       ∂ 2      ( )
                 和  n, j 相关的常数. 类似的,       log p c  u j  同样等于某个和  n, j 相关的常数.
                                      (  ) 2  N j
                                       ∂u j
                    本文注意到, 上述的假设在过去的许多文献中也同样被提出, 例如文献                      [17,20,33].

                                                  表 1 本文重要符号说明表

                                          符号                                 含义
                                           X                               样本矩阵
                                           P                             概率密度函数
                                           G                                因果图
                                     s(X) = ∇ X logp(X)                    得分函数
                                           f                               结构函数
                                           n                               样本数量
                                           d                               特征数量
                                           H                               海森矩阵
                                           J                              雅可比矩阵
                                                                           扩散模型
                                          M
                                           δ                             得分函数的变化

                  2.4   去噪扩散模型
                    最初的扩散模型概念        [34] , 旨在往一个原始的数据分布      x 0 ∼ p data (x) 中按照时间步添加呈现正态分布的噪声变
                                              (            )
                                               √
                 量   x t = N (0,(1−α t )I), 即  q(x t x t−1 ) = N  α t x t−1 ,(1−α t )I , 这里  q  代表了前向过程的分布,  α t  代表了时间相关的某
                 个标量,  I  是单位矩阵,   N  是正态分布. 前向过程的目标是将原始的数据分布               p data  通过不断添加高斯噪声, 最终变
                 成一个高斯分布. 和变分自编码器的逻辑类似               [35]  , 扩散模型将  T  时间步后形成的噪声分布类比成隐变量分布, 并

                 通过逆向过程来从       x T  还原出  . 基于扩散模型     (diffusion probabilistic model, DPM) 的概念, 去噪扩散模型
                                         x 0
                 (denoising DPM, DDPM) 优化了噪声变量的学习过程, 提出了更加稳定、更加平滑的优化目标. 具体来说, DDPM
                 模型  [36] 通过在每一时刻从标准高斯分布          ϵ = N (0,1)  中随机采样一个噪声, 代入     DPM  的前向过程中计算       x t =
                 √     √
                  α t x θ +  1−α t ϵ . 进而, DDPM  优化生成噪声的一致性:

                                                            [           ]
                                                                       2
                                                θ = argminE x 0 ,t,ϵ λ(t)ϵ θ (x t ,t)−ϵ ,
                                                 ∗
                                                                       2
                                              θ
                                                                          ,
                 其中,  ϵ θ (x t ,t) 代表了神经网络的输出,   代表了神经网络的参数,      t ∼ U (o,T) λ(t) 是某个依赖于时间步的加权函数.
                 进一步的, 基于分数匹配的扩散模型           (DDIM) [37] 通过估计和匹配前向-逆向过程中得分函数的一致性来取代采样的
                 一致性:

                                                          [               ]
                                               ∗
                                              θ = argminE x 0 ,t,ϵ s θ (x)−∇ x logp data (x) 2        (2)
                                                                         2
                    如果将对数概率密度方向类比成场的概念, 那么沿着采样过程中的分数, 即增长最快的场方向走, 就可以收敛
                 到数据分布的高概率密度区域, 因此最终生成的样本一定符合数据的原始分布.
                  3   扩散模型引导的根因分析
                  3.1   得分函数支撑的因果干预识别
                    在文献   [33] 中, 得分函数首次被提出用于因果结构识别. 在本文中, 用                s(X) 来表示随机向量     X  的得分函数
                 向量, 且通过上标区分其在不同数据环境下               (  n/c) 得到的得分函数, 用下标区分      s(X) 的不同分量, 例如    s(X)  表
                                                                                                     n
                                                                                                      j
                                                   j 个分量. 具体来说, 在   ANM  的  SCM  模型下, 得分函数具备如下的推
                 示在正常数据分布下得到的得分函数的第
                 导性质:
   142   143   144   145   146   147   148   149   150   151   152