Page 127 - 《软件学报》2026年第4期
P. 127
1568 软件学报 2026 年第 37 卷第 4 期
均值生成.
● 电子商务评价网络: Amazon: 构建用户-产品关系图, 用于识别受雇撰写虚假产品评论的用户. YelpChi: 识别
恶意评论, 基于同一用户的评论关系建图.
表 1 实验数据集的统计信息
类型 数据集 训练 测试 节点数量 边数量 特征维度 平均度 异常数量 异常比例 (%)
Cora - √ 2 708 5 429 1 433 3.90 150 5.53
CiteSeer - √ 3 327 4 732 3 703 2.77 150 4.50
引用网络
ACM - √ 16 484 71 980 8 337 8.37 597 3.62
PubMed √ - 19 717 44 338 500 4.50 600 3.04
BlogCatalog - √ 5 196 171 743 8 189 66.11 300 5.77
Flickr √ - 7 575 239 738 12 047 63.30 450 5.94
Facebook - √ 1 081 55 104 576 50.97 25 2.31
社交网络
Weibo - √ 8 405 407 963 400 48.53 868 10.30
Reddit - √ 10 984 168 016 64 15.30 366 3.33
Questions √ - 48 921 153 540 301 3.13 1 460 2.98
Amazon - √ 10 244 175 608 25 17.18 693 6.76
电子商务评价网络
YelpChi √ - 23 831 49 315 32 2.07 1 217 5.10
4.2 评价指标及对比方法
在本文, 我们采用常用评价指标 AUROC 和 AUPRC 来评估检测模型的性能 [45,46] . 对于 AUROC (area under
the ROC curve, ROC 曲线下面积), 用于衡量模型在不同阈值下区分正负样本的能力, 取值范围为 [0, 1], 值越大表
示模型性能越好. ROC 曲线由 TPR (true positive rate) 和 FPR (false positive rate) 构成, 计算方式如下:
TP
TPR =
TP+ FN
,
FP
FPR =
FP+TN
其中, TP (true positive) 表示正确预测的正样本, FP (false positive) 表示错误预测的正样本, TN (true negative) 表示
正确预测的负样本, FN (false negative) 表示错误预测的负样本. 对于 AUPRC (area under the PR curve, PR 曲线下
面积), 用于评估模型在正样本 (如异常) 上的精确率-召回率表现, 取值范围为 [0, 1], 值越接近 1 说明模型对正类
的识别越精准. PR 曲线由 Precision (精确率) 和 Recall (召回率) 构成, 计算方式如下:
TP
Precision =
TP+ FP
.
TP
Recall =
TP+ FN
为验证所提出方法 GRAD 的有效性, 我们选取以下相关的方法进行比较.
[6]
● GCN : 图神经网络领域的基础模型, 通过邻居聚合机制高效处理图结构数据.
● GAT [25] : 创新性地引入注意力机制, 动态调整节点贡献权重, 能根据不同下游任务优化注意力分布以获得更
优质的节点表征.
● BGNN [47] : 将梯度提升决策树 (GBDT) 与 GNN 相结合, 专门处理含表格型节点特征的图数据. GBDT 负责
特征处理, GNN 则建模图结构信息, 已在多种表格特征图数据上表现优异.
● BWGNN [16] : 创新之处在于配置频谱/空间局部带通滤波器, 可有效解决异常检测中的“右移现象”, 即谱能量
集中分布于高频而非低频区域的特征问题.
[48]
● GHRN : 基于图谱理论的监督式异常检测方法, 指出异质性与图的频率呈正相关. 通过增强高频成分来削
减类间连接边, 显著提升异常检测性能.
[49]
● DOMINANT : 关注图异常检测模型设计中网络稀疏性和数据非线性的问题, 结合 GCN 与深度自编码器,

