Page 255 - 《软件学报》2026年第7期
P. 255

2940                                                       软件学报  2026  年第  37  卷第  7  期


                    为实现可微的二值掩码采样过程, 本文采用              Gumbel-Softmax [47] 技术, 在概率分布   e M 上加入 Gumbel 噪声并通
                                                          M
                 过温度参数    τ 控制采样的平滑度, 进而采样掩码变量  . 之后, 利用另一图神经网络编码器                      GNN G (·) 对原始图  G
                 进行编码, 获得节点特征矩阵         H G . 证据子图的节点表示通过掩码与节点特征逐元素相乘得到, 即                  M ⊙ H G , 对应的
                 互补  (非证据) 节点表示为     (1− M)⊙ H G .
                    任务预测器模块由读出函数           (READOUT  (·)) 和分类器组成. 读出函数对证据子图及其互补节点表示分别进行

                 图级聚合, 生成对应的图表示向量          h r  和  :
                                               h e

                                                   h r = READOUT (M ⊙ H G )                           (3)

                                                              (        )
                                                 h e = READOUT( 1− M)⊙ H G                            (4)
                    随后, 分类器    ϕ(·) 基于证据子图表示     h r  进行标签预测:   ˆ Y r  =  ϕ(h r ), 对应的监督损失定义为:

                                                              [ (  )]
                                                    L r = E (G,Y)∼D ℓ ˆ Y r ,Y                        (5)
                    为鼓励生成的证据子图尽可能简洁, 引入稀疏性正则项, 约束掩码                    M  的平均值接近预设稀疏率        α:


                                                            ∑
                                                             |M|
                                                          1

                                                     L sp =   m i −α                                (6)

                                                         |M|
                                                             i=1
                    综上, 基础图证据提取模型的整体优化目标为:

                                                      L rat = L r +λ sp L                             (7)
                                                                 sp
                 其中,  λ sp  为稀疏性约束的权重系数.
                    在推断阶段, 模型仅依据证据子图表示进行预测.
                  2.3   基础图证据提取方法
                    为提升模型的鲁棒性和泛化能力, 在基础图证据提取模型的框架上, 本文引入一种基于反事实数据增强的方
                 法  CDA-GR (counterfactual data augmentation based graph rationalization). 该方法基于以下假设: 在给定证据子图的
                 条件下, 互补子图与标签相互独立. 基于此, 通过跨样本组合证据表示与互补表示, 构造反事实样本, 提升模型对于
                                                                          {  i  i  } B
                 捷径学习现象的抵抗能力. 具体而言, 考虑一个包含                B 个样本的训练批次       (G ,Y )   及其对应的证据表示和互补
                                                                                i=1
                     {(   )} B                                              j
                                                                                                 i
                       i
                 表示   h ,h i  , 该方法从上述批次中随机选取另一个样本             j , i 的互补表示  , 并将其与对应证据表示        h  相加, 形
                                                                           h e
                       r  e  i=1                                                                 r
                 成反事实样本表示:

                                                             i
                                                        h (i,j)  = h +h  j                            (8)
                                                         e G  r  e
                                                              i
                    构造出的反事实样本对应的标签保持不变, 即               e Y  (i,j)  = Y . 将该反事实表示输入分类器生成预测:

                                                             (   )
                                                        ˆ Y  (i,j)  = ϕ h (i,j)                       (9)
                                                               e G
                    并计算反事实样本的监督损失:

                                                             [ (     )]
                                                  L e = E    ℓ ˆ Y  (i,j) e Y  (i,j)                 (10)
                                                                  ,
                                                          )
                                                       ( G i ,Y i ∼D
                    最终, 模型训练通过结合基础图证据提取损失和反事实增强损失进行联合优化:

                                                                                                     (11)
                                                      L com = L rat +λ e L e
                 其中,  λ e  控制反事实增强损失的权重. 推断时, 无需构造反事实样本, 仍仅利用证据子图表示进行预测.
                  3   互补感知的图证据提取方法
                  3.1   重新审视  CDA-GR  方法
                    如第  2.3  节所述, CDA-GR 方法的有效性建立在一个关键假设之上: 在给定证据子图的条件下, 互补子图与标
                 签之间是条件独立的. 基于该假设, CDA-GR 通过将不同样本的互补表示与证据表示进行组合, 构造多样化的反事
                 实样本, 从而打破原始数据中的虚假关联, 缓解模型对“捷径”特征的依赖, 提升泛化性能.
                    然而, 在实际应用中, 这一独立性假设往往难以严格满足, 进而可能影响反事实增强策略的效果. 具体而言, 回
   250   251   252   253   254   255   256   257   258   259   260