Page 127 - 《软件学报》2026年第4期
P. 127

1568                                                       软件学报  2026  年第  37  卷第  4  期


                 均值生成.
                    ● 电子商务评价网络: Amazon: 构建用户-产品关系图, 用于识别受雇撰写虚假产品评论的用户. YelpChi: 识别
                 恶意评论, 基于同一用户的评论关系建图.

                                                 表 1 实验数据集的统计信息

                       类型          数据集     训练    测试   节点数量     边数量    特征维度    平均度    异常数量     异常比例 (%)
                                   Cora     -     √    2 708   5 429   1 433   3.90    150       5.53
                                  CiteSeer  -     √    3 327   4 732   3 703   2.77    150       4.50
                     引用网络
                                   ACM      -     √    16 484  71 980  8 337   8.37    597       3.62
                                  PubMed    √    -     19 717  44 338   500    4.50    600       3.04
                                 BlogCatalog  -   √    5 196   171 743  8 189  66.11   300       5.77
                                   Flickr   √    -     7 575   239 738  12 047  63.30  450       5.94
                                  Facebook  -     √    1 081   55 104   576    50.97    25       2.31
                     社交网络
                                   Weibo    -     √    8 405   407 963  400    48.53   868       10.30
                                   Reddit   -     √    10 984  168 016  64     15.30   366       3.33
                                  Questions  √   -     48 921  153 540  301    3.13    1 460     2.98
                                  Amazon    -     √    10 244  175 608  25     17.18   693       6.76
                  电子商务评价网络
                                  YelpChi   √    -     23 831  49 315   32     2.07    1 217     5.10

                  4.2   评价指标及对比方法
                    在本文, 我们采用常用评价指标           AUROC  和  AUPRC  来评估检测模型的性能       [45,46] . 对于  AUROC (area under
                 the ROC curve, ROC  曲线下面积), 用于衡量模型在不同阈值下区分正负样本的能力, 取值范围为 [0, 1], 值越大表
                 示模型性能越好. ROC     曲线由   TPR (true positive rate) 和  FPR (false positive rate) 构成, 计算方式如下:

                                                             TP
                                                     
                                                     TPR =
                                                     
                                                     
                                                           TP+ FN
                                                                  ,
                                                     
                                                             FP
                                                     
                                                     
                                                     FPR =
                                                     
                                                            FP+TN
                 其中, TP (true positive) 表示正确预测的正样本, FP (false positive) 表示错误预测的正样本, TN (true negative) 表示
                 正确预测的负样本, FN (false negative) 表示错误预测的负样本. 对于         AUPRC (area under the PR curve, PR  曲线下
                 面积), 用于评估模型在正样本         (如异常) 上的精确率-召回率表现, 取值范围为 [0, 1], 值越接近            1  说明模型对正类
                 的识别越精准. PR    曲线由   Precision (精确率) 和  Recall (召回率) 构成, 计算方式如下:

                                                    
                                                               TP
                                                    Precision =
                                                    
                                                    
                                                             TP+ FP
                                                                    .
                                                    
                                                            TP
                                                    
                                                    
                                                    Recall =
                                                    
                                                           TP+ FN
                    为验证所提出方法       GRAD  的有效性, 我们选取以下相关的方法进行比较.
                          [6]
                    ● GCN : 图神经网络领域的基础模型, 通过邻居聚合机制高效处理图结构数据.
                    ● GAT [25] : 创新性地引入注意力机制, 动态调整节点贡献权重, 能根据不同下游任务优化注意力分布以获得更
                 优质的节点表征.
                    ● BGNN [47] : 将梯度提升决策树   (GBDT) 与  GNN  相结合, 专门处理含表格型节点特征的图数据. GBDT              负责
                 特征处理, GNN   则建模图结构信息, 已在多种表格特征图数据上表现优异.
                    ● BWGNN  [16] : 创新之处在于配置频谱/空间局部带通滤波器, 可有效解决异常检测中的“右移现象”, 即谱能量
                 集中分布于高频而非低频区域的特征问题.
                           [48]
                    ● GHRN   : 基于图谱理论的监督式异常检测方法, 指出异质性与图的频率呈正相关. 通过增强高频成分来削
                 减类间连接边, 显著提升异常检测性能.
                                [49]
                    ● DOMINANT    : 关注图异常检测模型设计中网络稀疏性和数据非线性的问题, 结合                     GCN  与深度自编码器,
   122   123   124   125   126   127   128   129   130   131   132