Page 156 - 《软件学报》2026年第2期
P. 156
王浩天 等: 扩散模型引导的根因分析 635
● 相对地, 本文面向 DARCA 内在的优化缺点, 进而提出的优化版本算法 ODRCA 无论是随着特征数量增长
还是样本量增长, 都呈现出较高的运行效率, 其时间成本始终处于最低的状态, 这一分析结果也验证了本文所提出
的 ODRCA 方法, 即直接从一次训练的扩散模型推导剪枝后数据得分函数这一优化策略的有效性.
● 此外, 如表 2、表 3 所示, 我们将 ODRCA 方法在扩散模型预训练阶段的计算开销汇报如下: 由于 ODRCA
的扩散模型只训练一次, 其训练成本较小; 且由于扩散模型训练的时候采用固定大小的 batch size, 因此样本量不
会影响扩散模型的训练时间 (时间步 T = 100); 由于扩散模型训练的时候网络架构 (嵌入层维度) 固定, 因此特征维
度的增加不会特别影响到扩散模型的训练时间.
表 2 扩散模型训练时间随样本数量变化 ( d = 60) (min)
样本数量 n = 100 n = 500 n = 1000 n = 5000 n = 10000
训练时间 2.08 2.11 2.12 2.13 2.13
表 3 扩散模型训练时间随特征维度变化 ( n = 5000) (min)
样本数量 d = 20 d = 40 d = 60 d = 80 d = 100
训练时间 1.6 1.86 2.13 2.14 2.18
● 雅可比矩阵的计算开销分析. 最后, 我们将汇报仿真实验中每次迭代中需要计算雅可比矩阵的时间平均开
销. 如表 4 所示, 可以看到随着特征维度增加, 雅可比矩阵的计算时间也在增长, 然而这样的计算开销是可以接受
的 (尤其在通用的根因分析场景下 d ⩽ 100).
表 4 仿真实验 (ER 图) 在不同特征维度下雅可比矩阵计算时间的变化趋势 (s)
特征维度 d = 50 d = 100 d = 200 d = 500
雅可比计算时间 0.719 2.028 3.273 7.272
4.8 RQ3: 开放环境下的根因分析评测: 真实数据上的结果分析
表 5 和表 6 (加粗数据为最优值) 中的实验结果表明, 在面向真实场景的根因分析任务, 即推荐可能的 Top-K
个根因变量任务上, 所提出的 DARCA 和 ODRCA 方法表现同样十分优越. 这也进一步验证了本文的动机, 即面向
真实复杂数据的时候, 扩散模型可以较好地对得分函数进行估计. 与此同时, 和基于核方法的估计 (iSCAN) 相比,
本文所提出的方法, 即 ODRCA, 同样在运行效率上取得了绝对的优势. 这样验证了本文所提出的无需剪枝, 直接
估计得分函数这一策略的有效性.
表 5 WADI 真实服务系统故障定位的效果比较
方法 Precision@1 (%) Precision@3 (%) Precision@5 (%) Precision@7 (%) Precision@9 (%) Time (min)
ϵ-Diagnosis 15.2 19.4 25.8 36.6 40.1 0.006 1
CIRCA 13.2 14.5 26.1 35.4 55.8 10.1
Ψ-PC 14.3 21.4 35.7 45.2 57.1 >60
MULAN 17.8 25.2 38.5 49.1 53.3 22.3
UT-IGSP 11.2 22.4 31.9 50.4 51.1 1.2
iSCAN 19.2 25.3 28.4 55.6 61.2 >60
LinearEST 10.1 16.3 21.4 32.7 38.2 0.05
DARCA (本文) 21.2 32.7 33.9 58.0 73.1 12.2
ODRCA (本文) 25.8 30.5 34.6 61.2 78.5 5.7
4.9 RQ4: 加性噪声模型 (ANM) 的影响
图 3 和图 4 展示了在开放环境根因推荐的任务下, 各个基线方法在 Top-K 推荐精度指标衡量下的表现对比.
具体来说, K 越大, 对推荐的容错率越高, Top-K 精度表现越好. 此外, 时间这一指标代表了各个基线方法在平均每

