Page 157 - 《软件学报》2026年第2期
P. 157
636 软件学报 2026 年第 37 卷第 2 期
个样本的训练和推理的时间总和. 仿真数据的根因分析表现说明, 当数据生成的机制满足加性噪声假设的时候, 所
提出的方法效果表现较好, 这说明了本文理论和实际表现的一致性. 然而, 真实数据集 WADI 的内在数据生成机
制明显不一定满足加性噪声假设. 与之相对地, 本文所提出的根因识别方法仍然在开放的根因推荐下取得了较好
的表现效果, 而这一实验结果说明了本文所提出的根因分析方法本质上在面对非加性噪声数据的表现中仍然具有
较好的鲁棒性. 这一实验现象也和基于得分函数的因果发现方法鲁棒性最好这一经验性结论 [1] 是一致的. 此外, 与
之相对的, LinearEST 方法在各个设置下的表现较差, 这也从侧面说明, 从线性到非线性的 SCM 假设带来的模型
误识别 (misspecification) 影响比从加性噪声到非加性噪声带来的误识别影响大得多.
表 6 SWaT 真实服务系统故障定位的效果比较 (%)
方法 Precision@1 Precision@3 Precision@5 Precision@7 Precision@9
ϵ-Diagnosis 0.0 1.4 5.8 16.6 20.4
CIRCA 29.6 38.3 53.0 55.4 60.1
Ψ-PC 9.8 27.4 36.1 43.9 52.0
MULAN 17.8 25.2 34.1 44.7 49.3
UT-IGSP 13.4 20.3 25.6 33.8 41.2
iSCAN 20.1 27.3 38.9 45.7 53.1
LinearEST 16.4 24.4 29.8 40.1 48.7
DARCA (本文) 31.2 42.7 55.9 59.2 68.9
ODRCA (本文) 35.2 46.8 56.9 62.7 71.4
5 实验补充和分析
5.1 RQ5: 面向未观测混杂变量的鲁棒性分析
为了检验本文所提出方法在未观测混杂变量下的表现, 我们补充了额外的仿真实验 (ER 图, 高斯噪声, 特征变
⩾ 2 的节点; 进而, 对这些节点按照比
量数 = 50): 首先, 我们在基于结构因果模型数据的时候, 筛选出子节点集合
例 ρ 随机筛选出未观测混杂变量; 最后, 生成整体的数据集, 但是丢掉筛选得到的混杂变量集合, 这样就得到了具
有未观测混杂变量的节点集合; 此外, 本文确保根因变量不在未观测混杂变量中, 否则其无法被定位到. 具体实验
结果如表 7 所示. 未观测混杂变量的比例在 40% 及以下的时候, 所提出 ODRCA 方法的效果具备一定的鲁棒性;
当未观测混杂变量的比例超过 40% 的时候, ODRCA 方法的效果会出现较大幅度的下降.
表 7 未观测混杂比例的影响分析
ρ 0.1 0.2 0.3 0.4 0.5
F1 (%) 93.8 92.1 88.7 85.2 63.4
5.2 RQ6: 扩散模型预训练的消融实验
当前, 扩散模型不能够在任意情况下支持对于数据分布的任意拟合. 例如, 信噪比很低的时候或者预训练数据
量很小的时候, 扩散模型本身的拟合性能都会受到影响. 然而, 相比于之前的工作, 例如 iSCAN 中的核密度估计,
本文通过引入扩散模型已经极大地提升了对数据分布拟合的准确度和拟合过程的效率. 本节将针对扩散模型本身
的性能表现, 以及其是否精准识别了得分函数做进一步的消融实验.
● 得分函数的拟合情况. 在合成数据上, 通过调整数据的信噪比, 我们汇报扩散模型经过训练后对得分函数的
拟合情况 (ER 图, 特征维度 d = 30): 首先, 我们设计了比较扩散模型估计的 s θ (x) 和真实的得分函数 s(x) 之间的差
异的指标 (经验 L2-范数差异):
n ∑
2
L 2 (s) = |s θ (x i )− s(x i )| .
i=1
进而, 我们分别通过对数据集添加加性的高斯噪声和乘性的高斯噪声 (均值为 0, 方差 σ 逐步增大, 原文仿真

