Page 388 - 《软件学报》2026年第2期
P. 388

邱天 等: 基于链路聚合的图欺诈检测                                                               867


                 通过分析交易网络中的节点和边, 可以识别出如洗钱等潜在的非法活动, 为金融机构和监管部门提供有力的数据
                 支持. 训练集、验证集、测试集的划分比例分别为                45.86%、18.34%、35.80%, 遵循事务实体时间戳, 符合数据集
                 划分的官方建议.
                    ● T-Finance 数据集最早由   Tang  等人  [17] 发布, 旨在查找金融交易网络中的异常账户. 这些节点是独特的匿名
                 账户, 具有与注册天数、日志活动和交互频率相关的                 10  维特征. 图中的边连接有交易记录的两个账户. 如果节点
                 属于欺诈、洗钱和在线赌博等类别, 人类专家会将节点注释为异常. 训练集、验证集、测试集的划分比例为                                  40%、
                 20%、40%.
                    ● T-Social 数据集同样由   Tang  等人  [17] 发布, 旨在查找社交网络中的异常账户. 它具有与          T-Finance 相同的节
                 点注释和功能, 并且两个节点如果保持好友关系超过                 3  个月则相互连接. T-Social 的规模非常庞大, 拥有       578  万个
                 节点和   1.5  亿条边, 是本文使用的其他数据集的至少           100  倍, 具有很高的挑战性. 训练集、验证集、测试集的划分
                 比例分别为    40%、20%、40%.
                    ● YelpChi 数据集  [41] 是基于  Yelp (美国最大点评网站, 具有较大的顾客群体和社会影响力) 的一个行为图数据
                 集, 数据集中个体特征与图结构化特征以稀疏矩阵的形式进行存储, 涵盖业务、评论、用户信息等. 该数据集被广
                 泛应用于金融风控、欺诈检测、反洗钱等研究任务中. 训练集、验证集、测试集的划分比例分别为                                  40%、20%、
                 40%.
                    ● Amazon  数据集  [42] 是由亚马逊公司提供的大规模电子商务数据集. 与            YelpChi 数据集类似, 这个数据集包含
                 数百万个产品的信息, 涵盖了多个类别和品牌. 它的特点是提供了丰富的商品特征和用户评价, 包含                               24  个产品类
                 别下的超过    1.4  亿条评论和产品元数据. 数据集使用乐器下的评论, 并将用户作为图的节点. 该数据集也被广泛应
                 用于欺诈检测任务的验证. 训练集、验证集、测试集的划分比例分别为                       40%、20%、40%.
                  3.2   基准模型
                    本文将所提方法与非        GNN  模型、传统    GNN  模型、谱方法以及空间方法进行比较.
                    非  GNN  模型仅依据节点自身特征进行欺诈检测, 未考虑节点间复杂的连接关系. 本文选用经典的多层感知
                 机 (MLP) [43] 和随机森林 (RF) [44] 模型作为没有图信息情况下的基础模型.
                    传统  GNN  模型不仅考虑节点自身特征, 还会纳入邻居节点的信息, 通常通过聚合一阶邻居的信息来感知局
                 部连接模式以获取更多有用的信息. 本文选用               GCN [13] 和  GAT [15] 两个经典模型, 它们的区别在于对邻居节点权重
                 的计算方式, GCN    综合考虑入度和出度, 而       GAT  使用注意力机制.
                    另外, 本文方法还与目前先进的谱方法和空间方法进行比较. 谱方法包括                       AMNet [16] 、BWGNN [17] 和  GHRN [18] ,
                                                               2
                 空间方法包括     CARE-GNN [19] 、PC-GNN [20] 、RioGNN [21] 、H -FDetector [22] 和  GDN [23] . 谱方法涉及利用图信号的不
                 同频率成分, 可通过自适应组合多频信号、分析光谱能量分布和利用标签感知边缘指标等手段, 设计特定机制以
                 优化或增强对图上欺诈信息的捕获与处理能力. 空间方法则主要关注节点间的空间关系, 通过利用标签感知相似
                 性度量、强化学习选择邻居、跨关系聚合、引入异构网络和新型信息聚合策略等手段, 提升图神经网络对欺诈行
                 为和关系的检测与识别能力. 这些方法在之前的图欺诈检测工作中表现出了很好的性能.
                  3.3   评价指标
                    考虑到欺诈数据集中正负样本不平衡, 评估指标应同时兼顾精确率                        (precision) 和召回率  (recall), 本文采用
                 AUC  和  AP  两个评价指标来评估反欺诈模型的性能.
                    AUC (area under the curve) 通常指的是  AUC-ROC (area under the receiver operating characteristic curve), 即
                 ROC  曲线下面积. ROC    曲线是通过改变分类阈值, 绘制出真阳性率               (true positive rate, TPR) 与假阳性率  (false
                 positive rate, FPR) 之间的关系曲线.
                    AP (average precision), 即平均精度, 是基于  P-R (precision-recall) 曲线计算得出. P-R  曲线通过改变分类阈值,
                 绘制出精确率     (precision) 与召回率  (recall) 之间的关系. AP  是  P-R  曲线下面的面积, 反映了模型在不同阈值下的
                 平均精度. 欺诈检测数据集的正负样本通常是极度不平衡的, 由于欺诈行为                        (正样本) 往往远少于良性行为         (负样
                 本), 一般模型会对良性行为产生高召回率, 此时             AUC  就会产生过于乐观的分数. P-R        曲线更能准确地反映模型对
   383   384   385   386   387   388   389   390   391   392   393