Page 64 - 《软件学报》2026年第4期
P. 64
骆祥峰 等: 基于强-弱互信息掩码学习的可解释动态不完整图异常检测 1505
从图 6(b) 来看, NMI 和 ARI 分数在不同 τ 取值下表现出一定的变化趋势. 其中, NMI 在 τ = 1.0 时最高, 为
39.89%, 其次是 τ = 0.7 (39.64%). ARI 分数则在 τ = 0.7 时达到最高 (26.11%), 相比其他取值更优. 这一趋势表明, τ
设定对模型性能影响显著. 过小或过大的 τ 可能导致信息利用失衡, 从而影响聚类效果. 当 τ = 0.7 时, NMI 和 ARI
均接近最优, 说明该值有助于平衡结构与特征信息, 增强模型稳健性. 这进一步验证了强-弱互信息损失在不同超
参数下的鲁棒性, 并突出了合理调整 τ 以优化性能的重要性.
4.5 可视化分析 (RQ4)
在本节中, 我们使用 t-SNE 选择 3 个关键特征维度, 并为 Yelp 和 DGraphFin 数据集创建多维散点矩阵. 对角
线上的图展示了每个类别的核密度估计, 而非对角线上的图则显示了不同特征维度之间的散点分布.
在图 7 中, 红色点表示异常类别节点, 蓝色点表示正常类别节点. 散点图所示的 3 个维度分别对应特征嵌入中
的第 1–第 3 主成分, 用于展示节点间的分布差异. 如图 7 所示, YelpChi 数据集的可视化结果显示, 在 DIG 条件下,
两个类别之间存在明显的区分. 散点图突出显示了类别之间的分离, 尤其是在第 1 维度上, 类别差异最为显著. 核
密度估计进一步强调了这一点, 在第 1 维度上, 红色和蓝色分布之间的重叠最小, 表明即使在 95% DIG 比率且仅
保留 1/10 的节点和边的情况下, 模型仍能有效地学习类别表示. 而第 2 和第 3 维度的类别分布重叠相对较多.
20
10
维度 1 0
−10
10
维度 2 0 Label
0
l
10
−20
20
10
维度 3
0
−10
−20 0 20 −20 0 20 −10 0 10 20
维度 1 维度 2 维度 3
图 7 EXDIG 在 YelpChi 数据集中 95% DIG 比例下的可视化分析
图 8 中, 红色与蓝色点分别表示异常和正常节点类别. 所绘制的三维散点图对应节点嵌入向量的第 1–第 3 主
成分. 通过该可视化结果可以观察到, 即使在 95% 的动态不完整条件下, 不同类别节点仍呈现出明显的分布差异.
相比之下, 图 8 展示了 DGraphFin 数据集的可视化结果. 尽管该数据集规模更大且复杂度更高, 但模型在 DIG 条
件下仍能保持清晰的类别分离, 即使仅保留 1/300 的节点和边. 散点图显示了明显的聚类现象, 尤其是在第 3 维度
上, 类别之间的分离最为明显. 而在第 1 和第 2 维度上, 类别之间的重叠较多. 核密度估计进一步证实了这一点, 尽

