Page 154 - 《软件学报》2026年第2期
P. 154

王浩天 等: 扩散模型引导的根因分析                                                               633


                 仍处于不稳定、尚待研究的状态, 尽管            KCI 已经是非线性估计中最好的测试工具之一, 但是面对样本量大、结构
                 复杂的数据分布时, 对应的因果发现效果会下降. 这也和本文的主旨相吻合: 基于因果发现的根因分析同样会受到
                 因果发现这一流程本身精度的制约.
                    ● 基于线性结构的      LinearEST  算法表现不太稳定, 并且效果也不是很理想           (平均指标在     50%–60%  摇摆). 这一
                 现象的原因是线性模型的前件假设不满足本节生成的仿真数据. 在模型误识别的情况下, LinearEST                          算法本身的理
                 论基础会不成立.
                    ● 基于非线性统计量构造的         iSCAN  算法表现优于大多数基线方法, 这也验证了本文的动机, 即非线性、不依
                 赖先验因果发现任务的根因分析方法是未来根因分析框架设计的目标之一. 然而, iSCAN                          本身对于数据分布的估
                 计依赖于斯坦等式的核估计, 这一估计在面向复杂非线性结构的数据的时候, 其效果有待改进.
                    ● 最后, 本文所提出的两个方法, DARCA         和  ODRCA  方法, 在各个参数设置下均取得了较好的根因识别效果.
                 这说明了扩散模型对于数据分布得分函数估计这一技术路线的有效性.


                             100
                             F1分数 (%)  60
                         ER   80

                              40
                             100
                             F1分数 (%)  60
                          SF  80

                              40
                                10   20   30  40   50  10  20  30   40   50  10  20  30   40  50
                                       特征数量                  特征数量                  特征数量
                                      (a) 正态分布              (b) 均匀分布            (c) 拉普拉斯分布
                                              ϵ-Diagnosis  Ψ-PC  UT-IGSP  iSCAN  LinearEST
                                              CIRCA   MULAN   DARCA (本文)   ODRCA (本文)
                             图 3 在平均邻接数量等于        5  的时候, 各个基线方法在仿真数据上的根因识别表现


                            100
                            90
                           F1分数 (%)  60
                            80
                        ER  70
                            50
                            40
                            100
                            90
                           F1分数 (%)  60
                            80
                        SF  70
                            50
                            40
                               10   20   30  40   50  10  20   30   40   50  10  20   30   40   50
                                      特征数量                   特征数量                   特征数量
                                     (a) 正态分布               (b) 均匀分布             (c) 拉普拉斯分布
                                              ϵ-Diagnosis  Ψ-PC  UT-IGSP  iSCAN  LinearEST
                                              CIRCA   MULAN   DARCA (本文)   ODRCA (本文)
                            图 4 在平均邻接数量等于         10  的时候, 各个基线方法在仿真数据上的根因识别表现
   149   150   151   152   153   154   155   156   157   158   159