Page 391 - 《软件学报》2026年第2期
P. 391

870                                                        软件学报  2026  年第  37  卷第  2  期


                    实验显示, 所有部件均能单独发挥作用. 采样不定长的链路可以提升性能, 因为欺诈链路在长度上也具有多样
                 性. 对初步采样的链路, 根据链路经过节点的总体度中心性进行进一步筛选, 可以获得更多高质量的链路, 有助于
                 后续的链路模式挖掘, 并提升最终性能. 位置编码起到较为重要的作用, 移除节点特征中融入的位置编码将造成约
                 −5%  的  AP  下降. 这可能是因为位置编码标识了特征所处的范围, 起到了去噪的效果. 链路信息交互聚合是本方法
                 的重要步骤, 如果链路间缺乏交互而直接进行聚合, 模型对欺诈行为的检测性能将显著下降, 因为模型未能充分利
                 用所有链路提取共性的欺诈链路模式, 单纯的链路聚合本质也只是一种特殊的局部信息感知. 此外, 本节所涉及部
                 件的任意组合均能实现性能的进一步提升, 并在使用所有部件时达到最优效果.
                  3.7   模型参数影响分析
                    本节充分探讨本文方法受模型参数的影响状况, 具体涉及不定长链路采样中的链路采样个数和链路平均长
                 度, 位置关联的统一链路编码中的链路编码长度和决策树分箱数, 以及链路信息交互聚合中的链路交互层数和注
                 意力头数量. 在    T-Social 数据集上, 模型参数对    AUC  和  AP  指标的影响分析结果如图       2  所示.

                       100                       100                        100
                                      50    150                   10   40                    16   128
                                      80    300                   20   50                    32   256
                       98             100         98              30         98              64   512

                      结果 (%)  96                  96                         96
                                                                             94
                                                  94
                       94
                       92                         92                         92
                       90                         90                         90
                              AUC        AP             AUC         AP             AUC        AP
                               (a) 链路采样个数                 (b) 链路平均长度                 (c) 链路编码长度
                       100                       100                        100
                                       8    64                     1    3                    1    8
                                       16   128                    2    4                    2    16
                                       32   256                                              4
                       98                         98                         98
                      结果 (%)  96                  96                         96

                                                                             94
                       94
                                                  94
                       92                         92                         92
                       90                         90                         90
                              AUC        AP             AUC         AP             AUC        AP
                               (d) 决策树分箱数                 (e) 链路交互层数                 (f) 注意力头数量
                                         图 2 T-Social 数据集上的模型参数影响分析结果

                    实验结果显示, 在不定长链路采样方面, 链路采样个数的增加意味着参与模式交互的链路数增加, 从而使模型
                 能够一次接触更多的欺诈模式, 提高共性模式挖掘的效果, 但也会相应地增加计算开销. 随着链路平均长度的增
                 加, 模型性能通常先上升后下降. 这可能是因为较短的链路只能实现低阶的模式交互, 无法处理欺诈模式的复杂关
                 系和高阶交互, 而过长的链路则可能导致信息冗余, 且链路长度越长, 链路编码后的信息损失越严重. 在位置关联
                 的统一链路编码方面, 链路编码长度存在一个最优值, 链路编码过短, 会造成信息损失严重, 链路编码过长则会导
                 致模型过拟合. 同样, 决策树分箱数对于位置编码的表现也存在一个最优值. 箱数过少会导致位置编码在特征之间
                 缺乏区分度, 而箱数过多则会使位置编码过于细粒度, 无法有效地去除特征噪声. 在链路信息交互聚合方面, 随着
                 链路交互层数的增加, 模型性能会逐渐达到饱和, 无法进一步提升. 这与                     GCN、GAT   等传统图神经网络不同, 本
                 文模型的链路交互层数增加不会使节点特征“平滑”导致性能下降, 而是自然存在一个饱和点. 另外, 注意力头数量
   386   387   388   389   390   391   392   393   394   395   396