Page 229 - 《软件学报》2026年第2期
P. 229
708 软件学报 2026 年第 37 卷第 2 期
表 1 节点分类任务数据集的统计信息和参数设置
直推式 归纳式
类别 设置
Cora Citeseer PubMed PPI Reddit
节点数 2 708 3 327 19 717 56 944 232 965
边数 5 429 4 732 44 338 818 716 11 606 919
特征维度 1 433 3 703 500 50 602
统计 节点类别数 7 6 3 121 41
信息
训练集节点数 140 120 60 44 906 153 757
验证集节点数 500 500 500 6 514 23 297
测试集节点数 1 000 1 000 1 000 5 524 55 911
随机屏蔽比例 0.5 0.6 0.75 0.5 0.75
P (公式(1)) 3 3 5 5 5
参数 K (公式(5)) 16 15 19 17 20
设置 λ (公式6) 0.4 0.3 0.5 0.7 0.7
[α,β,γ] (公式(9), (10)) [0.5, 0.5, 0.3] [0.5, 0.5, 0.4] [0.5, 0.5, 0.3] [0.4, 0.6, 0.5] [0.5, 0.5, 0.5]
子图批次大小 32 32 64 128 128
表 2 图分类任务数据集的统计信息和参数设置
类别 设置 IMDB-B IMBD-M PROTEINS COLLAB MUTAG REDDIT-B NCI1
图数量 1 000 1 500 1 113 5 000 188 2 000 4 110
统计 图类别数 2 3 2 3 2 2 2
信息
平均节点数 19.8 13.0 39.1 74.5 17.9 429.7 29.8
随机屏蔽比例 0.5 0.5 0.75 0.75 0.8 0.75 0.25
P (公式(1)) 5 5 5 10 5 5 10
参数 K (公式(5)) 10 6 9 8 8 12 8
设置 λ (公式(6)) 0.5 0.3 0.5 0.6 0.4 0.6 0.7
[α,β,γ] (公式(9), (10)) [0.4, 0.6, 0.3] [0.5, 0.5, 0.5] [0.5, 0.5, 0.3] [0.5, 0.5, 0.5] [0.5, 0.5, 0.5] [0.6, 0.4, 0.3] [0.6, 0.4, 0.3]
子图批次大小 16 16 16 16 32 8 8
3.2 节点分类实验
在直推式学习的背景下, 本文使用了 3 个引文网络数据集进行实验研究: Cora [36] 、Citeseer [37] 和 PubMed [35] . 为
了确保实验设置的一致性, 为验证本文方法在归纳式学习中的性能, 本文进一步采用了蛋白质相互作用 (PPI) 数据
集 [38] , 该数据集包含表示不同人体组织的图. 此外, 为更全面地评估方法的鲁棒性, 本文还引入了一个规模更大的
数据集 Reddit [38] , 该数据集聚焦于社交网络, 并包含了 Reddit 帖子的相关信息.
如表 3 所示, 本文所提出的方法在直推式和归纳式任务中均展现出超越所有现有自监督方法的卓越性能. 在
[21]
众多基线方法中, GraphMAE 作为主要竞争对手, 尽管在生成范式中有所建树, 却忽略了从结构角度对图表示进
[7]
行建模的重要性. 另一基于对比学习的基线方法 GSC 虽然考虑了局部几何结构, 但其视角相对局限. SRM 性能
的提升不仅凸显了建模图表示学习内部关系的重要性, 同时也验证了其必要性. 进一步地, 本文方法利用图内部的
多个内在关系作为监督信号, 相较于监督基线方法, 展现出了更为强大的竞争力. 特别地, 在 PPI 和 Reddit 上的结
果表明, 本文方法在归纳任务中对未见节点和图的泛化能力尤为突出.
表 3 节点分类实验结果 (%)
直推式 归纳式
模型
Cora Citeseer PubMed PPI Reddit
[39]
GCN 81.4±0.6 70.3±0.7 76.8±0.6 51.5±0.6 93.3±0.1
[40]
GAT 83.0±0.7 72.5±0.7 79.0±0.3 97.3±0.2 -

