Page 260 - 《软件学报》2026年第7期
P. 260
岳立楠 等: 面向图分类任务的互补感知证据提取方法 2945
4.3 整体性能表现 (RQ1)
1) 任务预测性能
为系统评估 CaR 在图分类任务中的预测能力, 本文在多个数据集上开展了广泛实验, 结果如表 2 所示. 其中,
加粗表示最优结果. 实验结果表明, CaR 在所有数据集上均取得领先性能. 例如, 在 MolBBBP 数据集上, CaR 相较
于当前最优方法 C2R 提升了 1.09%; 在 Spurious-Motif 数据集 ( b = 0.9) 上, CaR 更是实现了 6.33% 的显著性能增
益. 上述结果充分验证了本文提出的基于对比学习的解耦方法以及引入的回声学习策略在提升模型泛化能力方面
的有效性. 进一步地, 与现有方法相比, Faith-DARE 同样通过解耦机制削弱了互补信息与证据信息之间的相关性,
但其整体性能仍不及本文提出的 CaR 方法. 其主要原因在于, Faith-DARE 并未显式建模图神经网络多层消息传递
过程中证据信息向互补表示逐层渗透的问题. 相比之下, CaR 通过引入回声学习策略, 融合来自不同传播层次的互
补表示, 有效减弱了由深层消息传递引入的干扰, 从而在抑制捷径学习的同时进一步提升了预测性能与解释忠实
性. 此外, 从不同类型对比方法的整体表现来看, 基于节点划分的方法 (如 RGDA 和 C2R) 与基于边划分的方法
(如 DisC 和 CAL) 在预测性能上大致相当, 说明两类方法在增强模型可解释性方面均具有应用潜力. 然而, CaR 在
所有评估任务中始终保持领先, 进一步验证了增强互补表示与标签之间独立性的核心设计理念在构建鲁棒模型方
面的关键作用.
表 2 CaR 及基准模型在合成数据集与真实世界数据集上的性能表现
Spurious-Motif (ACC) OGB-Mol (AUC)
模型
b=0.5 b=0.7 b=0.9 MolHIV MolToxCast MolBBBP MolBACE MolSIDER
DIR 0.3950±0.0471 0.3872±0.0531 0.3768±0.0447 0.6303±0.0607 0.5451±0.0092 0.6460±0.0139 0.7391±0.0282 0.4989±0.0115
DisC 0.4585±0.0660 0.4885±0.1154 0.3859±0.0400 0.7731±0.0101 0.6662±0.0089 0.6963±0.0206 0.8293±0.0171 0.5846±0.0169
CAL 0.4734±0.0681 0.5541±0.0323 0.4474±0.0128 0.7339±0.0077 0.6476±0.0066 0.6582±0.0397 0.7848±0.0107 0.5965±0.0116
GSAT 0.4517±0.0422 0.5567±0.0458 0.4732±0.0367 0.7524±0.0166 0.6174±0.0069 0.6722±0.0197 0.7922±0.0239 0.6041±0.0096
DARE 0.4843±0.1080 0.4002±0.0404 0.4331±0.0631 0.7836±0.0015 0.6677±0.0058 0.6820±0.0246 0.8239±0.0192 0.5921±0.0260
Faith-DARE 0.5382±0.1101 0.5755±0.0919 0.5257±0.1204 0.7915±0.0021 0.6691±0.0039 0.6974±0.0047 0.8293±0.0088 0.61633±0.0010
InterRAT 0.4628±0.0234 0.5182±0.0214 0.4983±0.0523 0.7446±0.0131 0.6531±0.0045 0.6753±0.0034 0.7958±0.0201 0.5821±0.0031
RGDA 0.4251±0.0458 0.5331±0.1509 0.4568±0.0779 0.7714±0.0153 0.6694±0.0043 0.6953±0.0229 0.8187±0.0195 0.5864±0.0052
C2R 0.5203±0.1437 0.5913±0.0413 0.5601±0.0979 0.7919±0.0006 0.6709±0.0052 0.6999±0.0122 0.8143±0.0096 0.6131±0.0117
CaR 0.6793±0.0316 0.6433±0.0707 0.6234±0.0936 0.7985±0.0033 0.6766±0.0023 0.7108±0.0126 0.8372±0.0026 0.6201±0.0021
w/o echo 0.4879±0.0258 0.4143±0.0621 0.4347±0.0797 0.7876±0.0028 0.6686±0.0073 0.6901±0.0147 0.8246±0.0205 0.5993±0.0138
w/o dis 0.5923±0.0997 0.6125±0.0644 0.5957±0.1274 0.7932±0.0035 0.6711±0.0048 0.7046±0.0158 0.8304±0.0048 0.6147±0.0039
在评估任务预测性能的同时, 本文进一步分析了引入对比学习与回声学习机制后所带来的计算开销. 具体而
言, 本文在 MolHIV 数据集上对比了不同方法的训练时间与 GPU 显存占用情况, 并以 RGDA 作为基准方法, 将其
计算成本归一化为 1.00×, 报告其他方法相对于该基准的倍数开销 (例如 1.20×表示训练时间或显存消耗约为
RGDA 的 1.2 倍). 如表 3 所示, 尽管本文方法引入了对比学习约束及多层互补表示的回声融合机制, 但其训练时
间与显存开销仅较基线方法略有增加, 整体仍处于同一数量级范围内. 这表明在获得显著性能提升与解释忠实性
增强的同时, 本文方法仅引入了较为有限的额外计算成本, 具有较好的实际可部署性.
表 3 不同方法在 MolHIV 数据集上的计算开销对比
模型 训练时长 GPU显存占用
RGDA 1.00× 1.00×
DARE 1.05× 1.08×
Faith-DARE 1.54× 1.42×
CaR 1.17× 1.20×
2) 证据提取性能
为验证 CaR 是否能够准确识别对预测具有关键影响的因果证据, 而非依赖伪相关信息 (即“捷径”), 本文在包

