Page 260 - 《软件学报》2026年第7期
P. 260

岳立楠 等: 面向图分类任务的互补感知证据提取方法                                                       2945


                  4.3   整体性能表现  (RQ1)
                    1) 任务预测性能
                    为系统评估     CaR  在图分类任务中的预测能力, 本文在多个数据集上开展了广泛实验, 结果如表                       2  所示. 其中,
                 加粗表示最优结果. 实验结果表明, CaR          在所有数据集上均取得领先性能. 例如, 在            MolBBBP  数据集上, CaR  相较
                 于当前最优方法      C2R  提升了  1.09%; 在  Spurious-Motif 数据集  ( b = 0.9) 上, CaR 更是实现了  6.33%  的显著性能增
                 益. 上述结果充分验证了本文提出的基于对比学习的解耦方法以及引入的回声学习策略在提升模型泛化能力方面

                 的有效性. 进一步地, 与现有方法相比, Faith-DARE         同样通过解耦机制削弱了互补信息与证据信息之间的相关性,
                 但其整体性能仍不及本文提出的           CaR  方法. 其主要原因在于, Faith-DARE    并未显式建模图神经网络多层消息传递
                 过程中证据信息向互补表示逐层渗透的问题. 相比之下, CaR                 通过引入回声学习策略, 融合来自不同传播层次的互
                 补表示, 有效减弱了由深层消息传递引入的干扰, 从而在抑制捷径学习的同时进一步提升了预测性能与解释忠实
                 性. 此外, 从不同类型对比方法的整体表现来看, 基于节点划分的方法                     (如  RGDA  和  C2R) 与基于边划分的方法
                 (如  DisC  和  CAL) 在预测性能上大致相当, 说明两类方法在增强模型可解释性方面均具有应用潜力. 然而, CaR 在
                 所有评估任务中始终保持领先, 进一步验证了增强互补表示与标签之间独立性的核心设计理念在构建鲁棒模型方
                 面的关键作用.

                                  表 2 CaR  及基准模型在合成数据集与真实世界数据集上的性能表现

                                 Spurious-Motif (ACC)                     OGB-Mol (AUC)
                   模型
                            b=0.5     b=0.7     b=0.9    MolHIV   MolToxCast  MolBBBP  MolBACE  MolSIDER
                    DIR  0.3950±0.0471 0.3872±0.0531 0.3768±0.0447 0.6303±0.0607 0.5451±0.0092 0.6460±0.0139 0.7391±0.0282 0.4989±0.0115
                   DisC  0.4585±0.0660 0.4885±0.1154 0.3859±0.0400 0.7731±0.0101 0.6662±0.0089 0.6963±0.0206 0.8293±0.0171 0.5846±0.0169
                   CAL   0.4734±0.0681 0.5541±0.0323 0.4474±0.0128 0.7339±0.0077 0.6476±0.0066 0.6582±0.0397 0.7848±0.0107 0.5965±0.0116
                   GSAT  0.4517±0.0422 0.5567±0.0458 0.4732±0.0367 0.7524±0.0166 0.6174±0.0069 0.6722±0.0197 0.7922±0.0239 0.6041±0.0096
                   DARE  0.4843±0.1080 0.4002±0.0404 0.4331±0.0631 0.7836±0.0015 0.6677±0.0058 0.6820±0.0246 0.8239±0.0192 0.5921±0.0260
                 Faith-DARE 0.5382±0.1101 0.5755±0.0919 0.5257±0.1204 0.7915±0.0021 0.6691±0.0039 0.6974±0.0047 0.8293±0.0088 0.61633±0.0010
                  InterRAT 0.4628±0.0234 0.5182±0.0214 0.4983±0.0523 0.7446±0.0131 0.6531±0.0045 0.6753±0.0034 0.7958±0.0201 0.5821±0.0031
                   RGDA  0.4251±0.0458 0.5331±0.1509 0.4568±0.0779 0.7714±0.0153 0.6694±0.0043 0.6953±0.0229 0.8187±0.0195 0.5864±0.0052
                    C2R  0.5203±0.1437 0.5913±0.0413 0.5601±0.0979 0.7919±0.0006 0.6709±0.0052 0.6999±0.0122 0.8143±0.0096 0.6131±0.0117
                    CaR  0.6793±0.0316 0.6433±0.0707 0.6234±0.0936 0.7985±0.0033 0.6766±0.0023 0.7108±0.0126 0.8372±0.0026 0.6201±0.0021
                  w/o echo  0.4879±0.0258 0.4143±0.0621 0.4347±0.0797 0.7876±0.0028 0.6686±0.0073 0.6901±0.0147 0.8246±0.0205 0.5993±0.0138
                   w/o dis  0.5923±0.0997 0.6125±0.0644 0.5957±0.1274 0.7932±0.0035 0.6711±0.0048 0.7046±0.0158 0.8304±0.0048 0.6147±0.0039

                    在评估任务预测性能的同时, 本文进一步分析了引入对比学习与回声学习机制后所带来的计算开销. 具体而
                 言, 本文在  MolHIV  数据集上对比了不同方法的训练时间与             GPU  显存占用情况, 并以     RGDA  作为基准方法, 将其
                 计算成本归一化为       1.00×, 报告其他方法相对于该基准的倍数开销              (例如  1.20×表示训练时间或显存消耗约为
                 RGDA  的  1.2  倍). 如表  3  所示, 尽管本文方法引入了对比学习约束及多层互补表示的回声融合机制, 但其训练时
                 间与显存开销仅较基线方法略有增加, 整体仍处于同一数量级范围内. 这表明在获得显著性能提升与解释忠实性
                 增强的同时, 本文方法仅引入了较为有限的额外计算成本, 具有较好的实际可部署性.

                                        表 3 不同方法在      MolHIV  数据集上的计算开销对比

                                    模型                   训练时长                  GPU显存占用
                                   RGDA                   1.00×                  1.00×
                                   DARE                   1.05×                  1.08×
                                 Faith-DARE               1.54×                  1.42×
                                    CaR                   1.17×                  1.20×

                    2) 证据提取性能
                    为验证 CaR 是否能够准确识别对预测具有关键影响的因果证据, 而非依赖伪相关信息                           (即“捷径”), 本文在包
   255   256   257   258   259   260   261   262   263   264   265