Page 259 - 《软件学报》2026年第7期
P. 259
2944 软件学报 2026 年第 37 卷第 7 期
差异, 符合 OOD 设定, 有助于评估模型的泛化能力. 鉴于本文聚焦于图分类任务, 故未在工业级图数据 (如包含亿
级节点的图) 上开展实验, 因为此类数据集主要用于节点分类而非图分类任务.
2) 基准模型
为验证 CaR 方法的性能优势, 本文选取若干具有代表性的图分类方法作为对比基准模型, 这些方法均以证据
提取为核心, 以提升模型在分布外场景下的泛化能力. 具体如下.
● DIR [10] 提出通过对训练分布进行干预以构造多个干预环境的策略, 从中挖掘任务不变证据, 以提升模型的泛
化能力.
● DisC [22] 提出一种通用的解耦框架, 用于区分因果子结构与偏差子结构. 该方法通过合成反事实样本强化训
练过程, 从而降低因果因素与伪相关因素之间的耦合.
● CAL [11] 基于因果注意力机制, 旨在识别对预测结果具有因果贡献的图结构特征, 同时削弱与标签呈伪相关
关系的信息, 从而缓解“捷径”问题.
● GSAT [20] 引入随机屏蔽机制, 在信息瓶颈理论 [48,49] 指导下, 选择性地保留与标签高度相关的图结构, 从而过
滤掉无关信息.
● DARE [40] 是一种自引导的证据提取方法, 基于解耦机制从输入中提取富含信息的子结构. 本文将其由自然语
言理解任务迁移至图级分类任务.
● Faith-DARE [43] 是 DARE 的扩展版本, 旨在通过缓解捷径依赖来提取更加可靠的证据子图, 其核心思想是将
DARE 识别出的非证据特征视为与预测结果去相关的“环境”因素, 并基于其解耦的互补表示构造反事实样本.
● InterRAT [21] 基于因果干预提出一种证据提取方法, 采用后门调整策略 [50,51] 移除数据中的伪相关性, 挖掘真
实的因果子结构. 本文同样将其从自然语言理解任务扩展至图级分类任务.
● RGDA [23] 提出一套通用于节点级与图级任务的反事实数据增强框架. 在图级分类场景中, RGDA 利用因果
子结构与“捷径”结构合成反事实样本, 提升模型对因果因素的敏感性.
[12]
● C2R 构建了一个协同分类与证据提取框架, 通过融合多环境信息生成忠实的证据, 提升模型的泛化与可
解释能力.
总体来看, DIR、DisC、CAL 与 GSAT 属于基于边划分 (edge-based partitioning) 的方法, 侧重通过边级操作
识别关键子图; 而 DARE、InterRAT、RGDA 与 C2R 属于基于节点划分 (node-based partitioning) 的方法, 更强调
通过节点级别的分离实现证据与非证据结构的解耦.
4.2 实验设置
在所有实验中, 本文在 CaR 及各对比方法中统一采用图同构网络 (graph isomorphism network, GIN) [52] 作为主
干图神经网络结构, 并使用均值池化 (mean pooling) 操作作为读出函数. 默认超参数设置如下: 对比损失的权重参
= 0.5. 隐藏层
数 λ c = 0.1, 反事实监督项的权重 λ e = 1, 稀疏性控制项的权重 λ sp = 1, 各层回声互补表示项的权重 λ e l
维度 d 在 Spurious-Motif 数据集上设置为 32, 在 OGB 数据集上设置为 128.
在训练过程中, 本文在 Spurious-Motif 和 OGB 上均使用 Adam 优化器 [53] , 初始学习率设置为 0.01. 针对不同
数据集的特性设置稀疏性参数 α, 其中 MolHIV 设置为 0.1, MolSIDER、MolBACE 和 MolToxCast 设置为 0.5,
MolBBBP 设置为 0.2, 其余数据集统一设置为 0.4. 在图神经网络的层数设置方面, 对于 OGB 数据集采用 4 层或 5
层消息传递模块, 对于 Spurious-Motif 数据集则统一设为 4 层.
在模型评估阶段, 本文在 Spurious-Motif 数据集上采用准确率 (accuracy, ACC) 作为主要性能指标, 在 OGB 数
据集上使用曲线下面积 (area under curve, AUC) 指标衡量预测效果. 此外, 由于 Spurious-Motif 数据集已经提供人
工标注的真实证据信息, 本文采用 Precision@5 指标评估模型提取的前 5 条证据与真实证据之间的一致性, 从而
全面评估模型的证据提取能力. 为确保实验结果的可靠性与稳定性, 本文在单张 A100 GPU 上对所有模型进行训
练, 并在 5 组不同的随机种子下重复实验. 最终报告的是验证集上取得最优性能的模型在测试集上的平均值与标
准差.

