Page 147 - 《软件学报》2026年第2期
P. 147
626 软件学报 2026 年第 37 卷第 2 期
(1) f j 在每个分量上是非线性的.
∂ 2 ( )
(2) 关于每个外源噪声变量 U j , 其分布密度函数 p n 关于 U j 值域的每个取值 u j 有 log p n u j 等于某个
N j ( ) 2 N j
∂u j
∂ 2 ( )
和 n, j 相关的常数. 类似的, log p c u j 同样等于某个和 n, j 相关的常数.
( ) 2 N j
∂u j
本文注意到, 上述的假设在过去的许多文献中也同样被提出, 例如文献 [17,20,33].
表 1 本文重要符号说明表
符号 含义
X 样本矩阵
P 概率密度函数
G 因果图
s(X) = ∇ X logp(X) 得分函数
f 结构函数
n 样本数量
d 特征数量
H 海森矩阵
J 雅可比矩阵
扩散模型
M
δ 得分函数的变化
2.4 去噪扩散模型
最初的扩散模型概念 [34] , 旨在往一个原始的数据分布 x 0 ∼ p data (x) 中按照时间步添加呈现正态分布的噪声变
( )
√
量 x t = N (0,(1−α t )I), 即 q(x t x t−1 ) = N α t x t−1 ,(1−α t )I , 这里 q 代表了前向过程的分布, α t 代表了时间相关的某
个标量, I 是单位矩阵, N 是正态分布. 前向过程的目标是将原始的数据分布 p data 通过不断添加高斯噪声, 最终变
成一个高斯分布. 和变分自编码器的逻辑类似 [35] , 扩散模型将 T 时间步后形成的噪声分布类比成隐变量分布, 并
通过逆向过程来从 x T 还原出 . 基于扩散模型 (diffusion probabilistic model, DPM) 的概念, 去噪扩散模型
x 0
(denoising DPM, DDPM) 优化了噪声变量的学习过程, 提出了更加稳定、更加平滑的优化目标. 具体来说, DDPM
模型 [36] 通过在每一时刻从标准高斯分布 ϵ = N (0,1) 中随机采样一个噪声, 代入 DPM 的前向过程中计算 x t =
√ √
α t x θ + 1−α t ϵ . 进而, DDPM 优化生成噪声的一致性:
[ ]
2
θ = argminE x 0 ,t,ϵ λ(t)ϵ θ (x t ,t)−ϵ ,
∗
2
θ
,
其中, ϵ θ (x t ,t) 代表了神经网络的输出, 代表了神经网络的参数, t ∼ U (o,T) λ(t) 是某个依赖于时间步的加权函数.
进一步的, 基于分数匹配的扩散模型 (DDIM) [37] 通过估计和匹配前向-逆向过程中得分函数的一致性来取代采样的
一致性:
[ ]
∗
θ = argminE x 0 ,t,ϵ s θ (x)−∇ x logp data (x) 2 (2)
2
如果将对数概率密度方向类比成场的概念, 那么沿着采样过程中的分数, 即增长最快的场方向走, 就可以收敛
到数据分布的高概率密度区域, 因此最终生成的样本一定符合数据的原始分布.
3 扩散模型引导的根因分析
3.1 得分函数支撑的因果干预识别
在文献 [33] 中, 得分函数首次被提出用于因果结构识别. 在本文中, 用 s(X) 来表示随机向量 X 的得分函数
向量, 且通过上标区分其在不同数据环境下 ( n/c) 得到的得分函数, 用下标区分 s(X) 的不同分量, 例如 s(X) 表
n
j
j 个分量. 具体来说, 在 ANM 的 SCM 模型下, 得分函数具备如下的推
示在正常数据分布下得到的得分函数的第
导性质:

