Page 81 - 《软件学报》2026年第4期
P. 81

1522                                                       软件学报  2026  年第  37  卷第  4  期


                  4.3   评价指标
                    考虑到图欺诈检测任务中普遍存在的严重类别不平衡问题, 仅依赖准确率作为性能评估指标往往难以全面反
                 映模型在欺诈检测方面的性能           (模型将所有节点预测为正常节点时准确率依然较高). 因此, 本文采用以下                      4  项指
                 标对模型的检测效果进行全面评估.
                    Recall, 即召回率, 衡量模型识别实际欺诈样本的能力, 计算公式表示为:

                                                               TP
                                                      Recall =                                       (30)
                                                            TP+ FN
                 其中,  TP (true positive) 表示真正例,  FN (false negative) 表示假负例, Recall 表示模型能从所有真实欺诈样本中正
                 确识别出的比例.
                    F1-macro 对各类别分别计算      F1 分数并取平均, 适用于类别不平衡的场景. F1 值综合考虑了精确率                 (Precision)
                 与召回率, 定义如下:

                                                                TP
                                                     Precision =                                     (31)
                                                              TP+ FP

                                                         Precision×Recall
                                                   F1 = 2×                                           (32)
                                                         Precision+Recall
                 其中,  FP (false positive) 表示假正例. F1-macro  在计算时对每个类别赋予相同的权重, 不受样本数量的影响, 适合
                 于类别不平衡的任务中.
                    AUC (area under curve) 被定义为  ROC (receiver operating characteristic curve) 曲线下与坐标轴围成的面积,
                 ROC  曲线通过改变分类阈值, 表示真阳性率 (true positive rate, TPR) 和假阳性率 (false positive rate, FPR) 的关系,
                 衡量模型在不同阈值下对正负样本的区分能力.
                    AP (average precision) 通过计算  Precision-Recall (P-R) 曲线下的面积来衡量模型性能, P-R  曲线通过改变分类
                 阈值, 综合评估模型在不同阈值下的精度与召回性能, 有效地衡量误报率, 更准确地反映模型对欺诈节点的识别能力.
                    上述所有评价指标的范围都在           0–100 (以百分数的形式呈现), 值越高表示模型效果越好.
                  4.4   实验设置
                    本文实验在所有数据集上均使用            GraphSAGE [49]  模型作为基础图神经网络框架, 该模型通过有效捕捉节点的
                 局部结构特征表示, 能够适应不同规模和结构的图数据, 在图联邦学习中被广泛使用                          [17,40,42] . 在联邦学习的设置中,
                 客户端与服务端的最大通信轮次设置为               200, 客户端数量为    4, 本地迭代次数为      5. 优化器使用   Adam, 学习率为
                 1E–3, 权重衰减设置为     5E–4. 在本地模型训练阶段, 采用       minibatch  方式进行模型更新, T-Finance 和  Amazon  数据
                 集的批量大小设置为        1 024, 由于  T-Social 数据集数据规模较大, 批量大小设置为        10 240, 以保证训练的收敛效率
                                                                                               {0.1,0.2,0.5,
                 与稳定性. 在超参数设置方面, 采用网格搜索策略确定关键参数的最优取值, 对损失平衡因子                              λ  在
                 1,2,5} 中进行搜索, 权重映射函数中的参数          α 和  β 分别在  {5,6,7,8} 和  {2,3,4,5} 中搜索, 移动更新的动量超参数  m
                 默认设置为    0.1. 此外, 为保证对比结果的一致性和公正性, 所有实验均在同一硬件平台上运行, 实验环境配置为
                 NVIDIA RTX A6000 GPU  和  Intel(R) Xeon(R) Platinum 8260M CPU @ 2.30 GHz, 对所有模型训练过程设置固定随
                 机种子.
                  4.5   实验结果与分析
                    为回答问题     1, 本节对 FedRPDA 的检测性能进行全面评估, 并与多种先进联邦学习方法进行对比, 实验结果
                 如表  2  所示. 接下来, 对实验结果进行详细分析.
                    (1) 总体来看, FedRPDA  在所有数据集和评估指标上均优于现有基线方法, 展现出优异的检测能力与泛化性
                 能. 具体而言, FedRPDA   相较于   FedAvg, 在  T-Finance、T-Social 和  Amazon  数据集上的 F1-macro  分别提升了
                 20.26%、6.72%  和  0.42%, Recall 分别提升了  20.62%、26.09%  和  2.56%, AUC  分别提高了  1.21%、0.95%  和
                 0.34%, AP  分别提高了  3.33%、9.86%  和  2.41%. 可以发现, 虽然一些现有的方法在       Amazon  数据集上可以取得较
                 为不错的效果, 这主要是因为该数据集中欺诈节点所占比例较大, 且数据规模相对较小, 导致在不同客户端的数据
   76   77   78   79   80   81   82   83   84   85   86