Page 126 - 《软件学报》2026年第4期
P. 126

张家强 等: 全局与局部残差信息联合感知的可泛化图异常检测                                                   1567



                 初始化模型参数
                 #训练过程:
                 1. for  D i train  ∈ T train  do
                 2.  基于公式   (1)、(2) 对齐特征;

                 3. end
                 4. for epoch in E do:
                 5.  for  D i  ∈ T train  do
                         train
                                              ′
                 6.    获得图数据的节点特征矩阵          X , 邻接矩阵   A, 标签信息  y;
                 7.    for  l in  L do
                          l
                 8.      Z ← 通过公式   (3)、(4) 计算节点在局部视角下的表示;
                 9.      R ← 通过公式   (5)、 (6) 计算节点在局部视角下的残差特征;
                          l
                 10.   end
                 11.     H local ← 将  L 层的残差特征进行按列拼接;
                       H global ← 通过公式  (7)–(11) 计算节点在全局视角下的残差特征;
                 12.
                 13.    H ← 将局部和全局视角下的残差特征进行按列拼接;
                 14.     H k  和  H q ← 划分出查询节点和上下文节点的特征;
                       L ← 通过公式   (15) 计算损失;
                 15.
                 16.   基于梯度下降算法更新模型参数;
                 17.  end
                 18. end
                 #测试过程:
                 1. for  D i test  ∈ T test  do
                 2.  固定模型参数, 执行训练过程中步骤           6–14;
                 3.   s(·) ← 通过公式  (17) 计算异常得分;
                 4. end

                  4   实验分析

                    在本节, 我们给出了基准数据集、度量标准以及与对比方法的介绍, 并设计实验来验证方法的有效性.
                  4.1   实验数据
                    为综合评估, 我们选取了来自多个领域的图数据集, 共                 12  个, 其中包括社交网络、引文网络和电子商务评价
                 网络. 遵循方法    ARC [10] , 在每个领域上的大型数据集训练模型, 在剩余的数据集上进行测试. 具体地, 训练数据集
                 T train  包括: PubMed、Flickr、Questions 和  YelpChi; 测试数据集  T test  包括: Cora、CiteSeer、ACM、BlogCatalog、
                 Facebook、Weibo、Reddit 和  Amazon. 这些数据集选自不同的领域, 以确保提出的模型可学习广泛的异常模式. 同
                 时, 上述数据的多样性可以较好地评估模型适应新的和看不见的图数据的能力. 另外, 在每个数据集中, 正常                               (上下
                 文) 节点数量   n k  设置为  10. 数据集的统计信息如表     1  所示, 详细信息如下.
                    ● 引文网络: Cora、CiteSeer、PubMed、ACM, 节点为论文, 边为引用关系, 节点属性为词袋向量.
                    ● 社交网络: BlogCatalog、Flickr: 节点为用户, 边为关注关系, 节点属性包含用户在社交网络中生成的个性化
                 文本内容, 如博客文章或带有标签描述的共享照片. Facebook: 用户好友关系网络. Weibo: 用户-话题图, 短时密集
                 发帖用户标记为可疑. Reddit: 论坛帖子网络, 被封禁用户被标记为异常节点, 属性为帖子文本向量. Question: 来自
                 问答平台 Yandex Q, 节点为用户, 边表示一年内是否存在问答交互. 节点特征由用户描述文本的 FastText 词向量
   121   122   123   124   125   126   127   128   129   130   131