Page 386 - 《软件学报》2026年第2期
P. 386
邱天 等: 基于链路聚合的图欺诈检测 865
,
问题, y v n ∈ {0, 1} y v n = 1 表示节点 v n 为欺诈节点, 否则为良性节点.
2.2 不定长链路采样
J
对于给定的一个待测节点, 从其自身出发, 通过随机游走采样 I 条链路组成 R ∈ N I×J , 每条链路 R i ∈ N 以该节
点为起点, 共包含 J 个按顺序前后相连的节点. 为了进一步丰富链路长度的多样性, 对链路进行随机覆盖的操作.
定义一个二值矩阵 M ∈ 1 J×J , M = U−I, 其中 U ∈ 1 J×J 是全 1 的上三角矩阵, I ∈ 1 J×J 是单位矩阵. 从 M 中随机可重
复地采样 I 行, 得到 ˜ M ∈ 1 I×J , 接着, 通过以下操作获得不同长度的链路 ˜ R ∈ R I×J :
R i,j , if ˜ M i,j = 0
(1)
˜ R i, j =
−1, if ˜ M i,j = 1
为了提升采样链路的质量, 需对链路进行进一步筛选. 选用链路所经过节点的度中心性之和作为评估链路重
要程度的依据, 从随机采样的 I 条链路中筛选出 Top-K 条最有价值的链路 ˜ R ∈ R K×J :
˜ R ∈ R K×J = Top-K ↓degree ˜ ∈ R ) (2)
I×J
(R
2.3 位置关联的统一链路编码
为了方便后续的链路信息交互, 对采样得到的不同长度的链路进行统一编码和降维, 使其长度相同. 同时, 根
据链路节点自身特征进行决策树分箱, 并以此为依据设计位置编码, 将其与链路编码融合, 进一步增强特征.
J . 在不定长链路采样中, 不同长度的链路
}
对于第 k 条链路 ˜ R k , 其经过的所有节点的特征组成的集合为 {x ˜ R k,j j=1
在尾部用标号为−1 的节点进行填充, 标号为−1 的节点对应的特征 x 则用全零填充. 首先将链路节点特征依次进行
˘
DJ
拼接, 得到链路特征 h k ∈ R :
∪{ } J
˘
h k = x ˜ R k,j (3)
j=1
C
其中, ∪ 是拼接操作, 拼接后的链路特征长度为 D· J. 接着, 对链路特征进行线性映射, 得到嵌入表示 h k ∈ R :
˘
h k = h k ·W+ b (4)
C
其中, W ∈ R DJ×C 和 b ∈ R 分别为可学习的权重和偏置.
为了增强每个节点在所有节点当中的位置信息, 本文受到 Transformer [39] 中位置编码的启发, 针对欺诈检测任
务的特有属性和需求, 设计了一种独特的位置编码方法. 具体地, 引入决策树分箱编码, 它对节点各属性值的范围
进行分组. 对于每个属性, 确定组的数量和每组的范围对于最佳欺诈检测至关重要. 以节点标签作为监督, 采用决
策树将节点的每个属性分类到不同的叶节点中. 叶子节点的数量对应组的数量, 分割条件值决定每个组的范围. 利
用训练好的每个属性的决策树, 将所有分割条件值按升序排序, 然后用于将整个范围划分为若干个互斥的箱 (bin).
{ } J
D
每个属性值会有对应的箱号, 于是得到各个节点的位置编码 x pos , 其中 x pos ∈ R , 再对位置编码进行标准化操
˜ R k, j ˜ R k,j
j=1
作. 在链路中, 标号为−1 的填充节点对应的位置编码 x pos 同样用全零填充. 随后, 采用与公式 (3) 和 (4) 相同的拼接
pos DJ
和线性映射操作, 得到链路位置编码的嵌入表示 h ∈ R :
k
∪ { } J
h ˘ pos = x pos (5)
k ˜ R k,j
j=1
h pos = h ˘ pos ·W pos + b pos (6)
k k
C
其中, W pos ∈ R DJ×C 和 b pos ∈ R 分别为可学习的权重和偏置.
C
最后, 将链路特征嵌入与位置编码相加, 得到最终的链路嵌入表示 z k ∈ R :
z k = h k + h pos (7)
k
2.4 链路信息交互聚合
在该阶段, 待测节点自身的链路之间会进行信息交互, 以挖掘共性的欺诈模式. 对于待测节点, 首先堆叠该节
点出发的所有链路的嵌入, 得到 Z ∈ R K×C :
Z = [z 1 ;z 2 ;...;z K ] (8)

