Page 386 - 《软件学报》2026年第2期
P. 386

邱天 等: 基于链路聚合的图欺诈检测                                                               865


                             ,
                 问题,   y v n  ∈ {0, 1} y v n  = 1 表示节点  v n  为欺诈节点, 否则为良性节点.
                  2.2   不定长链路采样

                                                                                                  J
                    对于给定的一个待测节点, 从其自身出发, 通过随机游走采样                   I  条链路组成  R ∈ N I×J  , 每条链路  R i ∈ N  以该节
                 点为起点, 共包含     J  个按顺序前后相连的节点. 为了进一步丰富链路长度的多样性, 对链路进行随机覆盖的操作.
                 定义一个二值矩阵       M ∈ 1 J×J  ,   M = U−I, 其中  U ∈ 1 J×J  是全  1  的上三角矩阵,  I ∈ 1 J×J   是单位矩阵. 从  M 中随机可重
                 复地采样   I  行, 得到   ˜ M ∈ 1 I×J  , 接着, 通过以下操作获得不同长度的链路   ˜ R ∈ R I×J :

                                                       
                                                        R i,j , if ˜ M i,j = 0
                                                       
                                                       
                                                                                                      (1)
                                                   ˜ R i, j = 
                                                       
                                                         −1,  if ˜ M i,j = 1
                    为了提升采样链路的质量, 需对链路进行进一步筛选. 选用链路所经过节点的度中心性之和作为评估链路重
                 要程度的依据, 从随机采样的         I  条链路中筛选出    Top-K  条最有价值的链路     ˜ R ∈ R K×J :

                                                 ˜ R ∈ R  K×J  = Top-K ↓degree ˜ ∈ R )                (2)
                                                                      I×J
                                                                 (R
                  2.3   位置关联的统一链路编码
                    为了方便后续的链路信息交互, 对采样得到的不同长度的链路进行统一编码和降维, 使其长度相同. 同时, 根
                 据链路节点自身特征进行决策树分箱, 并以此为依据设计位置编码, 将其与链路编码融合, 进一步增强特征.
                                                                       J  . 在不定长链路采样中, 不同长度的链路
                                                                       }
                    对于第   k 条链路   ˜ R k , 其经过的所有节点的特征组成的集合为        {x ˜ R k,j j=1
                 在尾部用标号为−1      的节点进行填充, 标号为−1       的节点对应的特征       x 则用全零填充. 首先将链路节点特征依次进行
                                 ˘
                                     DJ
                 拼接, 得到链路特征     h k ∈ R :

                                                          ∪{    } J
                                                       ˘
                                                       h k =  x ˜ R k,j                               (3)
                                                                 j=1
                                                                                                   C
                 其中,   ∪   是拼接操作, 拼接后的链路特征长度为        D· J. 接着, 对链路特征进行线性映射, 得到嵌入表示            h k ∈ R :

                                                           ˘
                                                       h k = h k ·W+ b                                (4)
                                   C
                 其中,  W ∈ R  DJ×C   和  b ∈ R  分别为可学习的权重和偏置.
                    为了增强每个节点在所有节点当中的位置信息, 本文受到                   Transformer  [39] 中位置编码的启发, 针对欺诈检测任
                 务的特有属性和需求, 设计了一种独特的位置编码方法. 具体地, 引入决策树分箱编码, 它对节点各属性值的范围
                 进行分组. 对于每个属性, 确定组的数量和每组的范围对于最佳欺诈检测至关重要. 以节点标签作为监督, 采用决
                 策树将节点的每个属性分类到不同的叶节点中. 叶子节点的数量对应组的数量, 分割条件值决定每个组的范围. 利
                 用训练好的每个属性的决策树, 将所有分割条件值按升序排序, 然后用于将整个范围划分为若干个互斥的箱                                  (bin).
                                                               {   } J
                                                                                 D
                 每个属性值会有对应的箱号, 于是得到各个节点的位置编码                    x pos  , 其中  x pos  ∈ R , 再对位置编码进行标准化操
                                                                 ˜ R k, j   ˜ R k,j
                                                                    j=1
                 作. 在链路中, 标号为−1    的填充节点对应的位置编码          x pos  同样用全零填充. 随后, 采用与公式      (3) 和  (4) 相同的拼接
                                                       pos  DJ
                 和线性映射操作, 得到链路位置编码的嵌入表示               h  ∈ R :

                                                       k
                                                          ∪ {    } J
                                                      h ˘  pos  =  x pos                              (5)
                                                       k       ˜ R k,j
                                                                 j=1

                                                     h pos  = h ˘  pos ·W pos  + b pos                (6)
                                                      k   k
                                      C
                 其中,  W pos  ∈ R DJ×C   和  b pos  ∈ R  分别为可学习的权重和偏置.
                                                                           C
                    最后, 将链路特征嵌入与位置编码相加, 得到最终的链路嵌入表示                    z k ∈ R :

                                                        z k = h k + h pos                             (7)
                                                                k
                  2.4   链路信息交互聚合
                    在该阶段, 待测节点自身的链路之间会进行信息交互, 以挖掘共性的欺诈模式. 对于待测节点, 首先堆叠该节
                 点出发的所有链路的嵌入, 得到         Z ∈ R K×C :

                                                      Z = [z 1 ;z 2 ;...;z K ]                        (8)
   381   382   383   384   385   386   387   388   389   390   391