Page 154 - 《软件学报》2026年第2期
P. 154
王浩天 等: 扩散模型引导的根因分析 633
仍处于不稳定、尚待研究的状态, 尽管 KCI 已经是非线性估计中最好的测试工具之一, 但是面对样本量大、结构
复杂的数据分布时, 对应的因果发现效果会下降. 这也和本文的主旨相吻合: 基于因果发现的根因分析同样会受到
因果发现这一流程本身精度的制约.
● 基于线性结构的 LinearEST 算法表现不太稳定, 并且效果也不是很理想 (平均指标在 50%–60% 摇摆). 这一
现象的原因是线性模型的前件假设不满足本节生成的仿真数据. 在模型误识别的情况下, LinearEST 算法本身的理
论基础会不成立.
● 基于非线性统计量构造的 iSCAN 算法表现优于大多数基线方法, 这也验证了本文的动机, 即非线性、不依
赖先验因果发现任务的根因分析方法是未来根因分析框架设计的目标之一. 然而, iSCAN 本身对于数据分布的估
计依赖于斯坦等式的核估计, 这一估计在面向复杂非线性结构的数据的时候, 其效果有待改进.
● 最后, 本文所提出的两个方法, DARCA 和 ODRCA 方法, 在各个参数设置下均取得了较好的根因识别效果.
这说明了扩散模型对于数据分布得分函数估计这一技术路线的有效性.
100
F1分数 (%) 60
ER 80
40
100
F1分数 (%) 60
SF 80
40
10 20 30 40 50 10 20 30 40 50 10 20 30 40 50
特征数量 特征数量 特征数量
(a) 正态分布 (b) 均匀分布 (c) 拉普拉斯分布
ϵ-Diagnosis Ψ-PC UT-IGSP iSCAN LinearEST
CIRCA MULAN DARCA (本文) ODRCA (本文)
图 3 在平均邻接数量等于 5 的时候, 各个基线方法在仿真数据上的根因识别表现
100
90
F1分数 (%) 60
80
ER 70
50
40
100
90
F1分数 (%) 60
80
SF 70
50
40
10 20 30 40 50 10 20 30 40 50 10 20 30 40 50
特征数量 特征数量 特征数量
(a) 正态分布 (b) 均匀分布 (c) 拉普拉斯分布
ϵ-Diagnosis Ψ-PC UT-IGSP iSCAN LinearEST
CIRCA MULAN DARCA (本文) ODRCA (本文)
图 4 在平均邻接数量等于 10 的时候, 各个基线方法在仿真数据上的根因识别表现

