Page 390 - 《软件学报》2026年第2期
P. 390

邱天 等: 基于链路聚合的图欺诈检测                                                               869


                    (1) 总体上, 本文所提出的方法在所有数据的两种评估指标                  (AUC、AP) 上都显示出良好的结果, 其中          AP  指
                 标在不同数据集上实现了约          2%–9%  的增幅. 在规模最大、挑战性最高的           T-Social 数据集上, 本文方法在    AP  指标
                 上能比目前最先进的方法高出将近             9%. 其他已有的方法的表现非常不稳定, 如            GCN  在  T-Finance 和  T-Social 数
                 据集上表现较为良好, 但在其余          3  个数据集上的表现就不尽人意, RioGNN        方法在   T-Finance、YelpChi 和  Amazon
                 数据集上表现出色, 但在       Elliptic 和  T-Social 数据集上表现糟糕. 相比之下, 本文方法在各个场景中的表现更加稳
                 定, 充分体现了其强大的泛化性能.
                    (2) 目前的图欺诈检测方法能够实现较高的              AUC  值, 但  AP  值普遍较低. 原因在于欺诈场景数据集中良性样
                 本远多于欺诈样本. 当数据集中正负样本数量极不均衡时, 模型可能更容易被训练成偏向多数类                              (良性样本), 从而
                 导致在   P-R  曲线上表现不佳, 即    AP  值较低. 然而, ROC  曲线对类别分布不敏感, 因此         AUC  值可能仍然很高. 本文
                 方法在提升    AP  值方面非常明显, 说明在保证高召回率的同时, 也实现了高精确率, 有效克服了欺诈场景下正负样
                 本不均衡带来的训练挑战. 这可能得益于本文方法的“全局感知”能力, 可检测到更多隐蔽的欺诈行为.
                    (3) 在处理具有复杂关联特性的图数据时, 传统非               GNN  方法, 尤其是   MLP, 难以达到理想的异常检测效果,
                 其  AUC  和  AP  值普遍较低. 原因在于这些方法仅能利用节点自身的特征, 无法捕捉节点间的关联关系. 欺诈者往
                 往伪装成正常者, 其特征可能与正常者无异或差别甚小, 因此仅凭节点属性区分欺诈与良性行为极具挑战性. 传
                 统  GNN  方法, 如  GCN  和  GAT, 在欺诈检测数据集上亦存在局限. 这些方法通过聚合邻居节点信息来更新节点表
                 示, 从而部分捕捉图的结构特征. 然而, 在处理涉及高阶交互的异常时, 这些方法往往力不从心. 欺诈行为常涉及复
                 杂的交互模式和隐藏的关系链, 可能跨越多个节点和边, 形成高阶图结构. 传统                       GNN  方法主要关注一阶邻居信息,
                 难以有效捕捉这类高阶、非局部的交互模式. 例如, 在社交网络和评论网络数据集中, 尽管传统                                GNN  方法的
                 AUC  和  AP  值较高, 但仍低于一些专为异常检测设计的           GNN  变体. 谱方法和空间方法在本次实验中表现出优势,
                 主要因为它们针对欺诈场景的特性进行设计. 谱方法认为欺诈节点和良性节点处于不同频域, 于是在消息聚合时
                 尽量减少两者间信号的相互干扰, 相比传统              GNN  方法, 可有效避免节点信息的“平滑”现象. 空间方法则考虑邻居
                 节点中可能同时包含欺诈节点和良性节点, 因此应有区分性地进行邻居选择与聚合. 然而, 所有这些方法本质上仅
                 考虑低阶邻居信息, “感受野”有限, 只能在一定范围内有效识别欺诈行为. 面对更加隐蔽复杂、涉及长程链路关联
                 的欺诈行为, 这类“局部感知”的方法将无能为力. 相比之下, 本文方法的感知范围更广, 考虑了欺诈行为的长程关
                 联模式, 能够发现更复杂隐蔽的欺诈行为, 因此在性能上能超越目前先进的图欺诈检测技术.
                  3.6   消融实验
                    本节验证本文方法中的各个部件对于最终性能的影响, 主要涉及的问题如下.
                    (1) 不定长链路采样中, 采样不定长链路是否能获得比采样等长链路更好的效果?
                    (2) 不定长链路采样中, 从随机采样的链路中进一步挑选                Top-K  条高质量链路是否带来了更好的性能?
                    (3) 位置关联的统一链路编码中, 链路节点的位置编码是否必要?
                    (4) 链路信息交互聚合中, 链路间的自注意力模式交互是否必要?
                    针对上述问题, 本文在       T-Social 数据集上进行了多种组合的消融实验, 实验结果如表              4  所示.

                                           表 4 T-Social 数据集上的消融实验结果 (%)

                            不定长链路       Top-K链路筛选      位置编码       链路信息交互        AUC       AP
                               √             √           √            √         99.60    96.01
                               ×             √           √            √         99.53    95.62
                               √             ×           √            √         99.52    95.22
                               √             √           ×            √         99.01    91.06
                               √             √           √            ×         93.35    56.38
                               √             ×           ×            √         98.71    88.77
                               ×             √           ×            √         98.85    89.72
                               ×             ×           √            √         99.51    95.20
                               ×             ×           ×            √         98.88    89.52
                               ×             ×           ×            ×         88.91    43.63
   385   386   387   388   389   390   391   392   393   394   395