Page 64 - 《软件学报》2026年第4期
P. 64

骆祥峰 等: 基于强-弱互信息掩码学习的可解释动态不完整图异常检测                                               1505


                    从图  6(b) 来看, NMI 和 ARI 分数在不同     τ 取值下表现出一定的变化趋势. 其中, NMI 在           τ = 1.0 时最高, 为

                 39.89%, 其次是  τ = 0.7 (39.64%). ARI 分数则在  τ = 0.7 时达到最高  (26.11%), 相比其他取值更优. 这一趋势表明,   τ
                 设定对模型性能影响显著. 过小或过大的             τ 可能导致信息利用失衡, 从而影响聚类效果. 当             τ = 0.7 时, NMI 和 ARI
                 均接近最优, 说明该值有助于平衡结构与特征信息, 增强模型稳健性. 这进一步验证了强-弱互信息损失在不同超
                 参数下的鲁棒性, 并突出了合理调整           τ 以优化性能的重要性.
                  4.5   可视化分析  (RQ4)
                    在本节中, 我们使用 t-SNE 选择      3  个关键特征维度, 并为 Yelp 和 DGraphFin 数据集创建多维散点矩阵. 对角
                 线上的图展示了每个类别的核密度估计, 而非对角线上的图则显示了不同特征维度之间的散点分布.
                    在图  7 中, 红色点表示异常类别节点, 蓝色点表示正常类别节点. 散点图所示的                    3  个维度分别对应特征嵌入中
                 的第  1–第  3  主成分, 用于展示节点间的分布差异. 如图         7 所示, YelpChi 数据集的可视化结果显示, 在 DIG 条件下,
                 两个类别之间存在明显的区分. 散点图突出显示了类别之间的分离, 尤其是在第                         1  维度上, 类别差异最为显著. 核
                 密度估计进一步强调了这一点, 在第            1  维度上, 红色和蓝色分布之间的重叠最小, 表明即使在 95% DIG 比率且仅
                 保留 1/10 的节点和边的情况下, 模型仍能有效地学习类别表示. 而第                 2  和第  3  维度的类别分布重叠相对较多.

                               20
                               10
                             维度 1  0


                              −10




                               10
                             维度 2  0                                                      Label
                                                                                            0
                                                                                            l
                               10
                              −20
                               20


                               10
                             维度 3
                                0

                              −10

                                 −20    0     20     −20     0     20    −10  0  10  20
                                        维度 1               维度 2               维度 3
                                   图 7 EXDIG  在  YelpChi 数据集中  95% DIG  比例下的可视化分析

                    图  8 中, 红色与蓝色点分别表示异常和正常节点类别. 所绘制的三维散点图对应节点嵌入向量的第                             1–第  3  主
                 成分. 通过该可视化结果可以观察到, 即使在 95% 的动态不完整条件下, 不同类别节点仍呈现出明显的分布差异.
                 相比之下, 图   8 展示了 DGraphFin 数据集的可视化结果. 尽管该数据集规模更大且复杂度更高, 但模型在                       DIG  条
                 件下仍能保持清晰的类别分离, 即使仅保留 1/300 的节点和边. 散点图显示了明显的聚类现象, 尤其是在第                            3  维度
                 上, 类别之间的分离最为明显. 而在第          1  和第  2  维度上, 类别之间的重叠较多. 核密度估计进一步证实了这一点, 尽
   59   60   61   62   63   64   65   66   67   68   69