Page 223 - 《软件学报》2026年第2期
P. 223
702 软件学报 2026 年第 37 卷第 2 期
引入了节点扰动 [7] 机制. 最终, 通过采用一种包含横向连接的重建方案, 本文能够同时建模子图批次和整个图,
从而有效地保留图的结构信息 (图 1). 在模型训练阶段, 本文还实施了节点正则化, 包括平滑性、连通性和稀疏
性约束, 旨在维护重构节点间的一致性. 同时, 这些约束也有助于缓解节点扰动对图的局部几何特征可能产生的
负面影响.
综上所述, 本文的主要贡献体现在以下几个方面.
(1) 开发了一种名为 SRM 的自监督结构关系建模框架, 该框架能够精确地保留图的复杂性并构建其结构粒
度. 本文的模型源于图表示学习的固有结构特性, 设计简洁而新颖.
(2) 在图中实现了两种关系挖掘方案. 首先, 设计了基本分区的子图采样机制, 用于构建训练批次, 使得模型能
够克服图拓扑不平衡的限制, 并学习局部-全局关系以及结构保存的子图间的可分性. 其次, 本文引入了节点正则
化策略, 通过合理挖掘节点相关性关系的平滑性、连通性和稀疏性, 生成紧凑而可靠的图表示.
(3) 通过在 12 个相关数据集上进行实验, 展示了本文方法在节点和图分类任务上的显著性能. 在这些下游任
务中, 本文的模型性能甚至超越了专门的任务特定的全监督模型. 这些深入的实证结果充分验证了本文系统设计
的有效性和优越性.
1 相关工作
1.1 自监督图学习
自监督图学习方法主要分为对比式和生成式两大类.
在对比式方法中, 互信息 (mutual information, MI) 最大化是常见的策略. 众多研究通过从子图中生成负样本来
[9]
估计样本对之间的 MI 最大化 [8] . 例如, Sub-graph Contrast 通过破坏提取的子图结构并应用对比学习来生成负样
本. GCC [10] 则将来自不同图的子图视为负样本, 以学习通用的图结构表示. 此外, 基于扰动的增强策略 (如属性屏
蔽、节点置换或边扰动) 也被广泛应用于推动该领域的进步. GraphCL [11] 和 GRACE [12] 通过扰动生成子图的两
个视图, 将相应节点视为正样本, 其他节点视为负样本. 然而, 一些方法试图通过设计自适应增强策略 (如 AutoGCL [13]
和 DGCL [14,15] ) 来消除手动设计的需要, 但这些方法通常假设提取的子图能够充分捕捉全局图知识, 这在实际情况
中并不总是成立.
生成式方法是将自监督代理任务制定为从特征和结构两个角度进行图数据重建. 图自动编码器 (GAE) [16] 作为
无监督学习模型的代表, 致力于重建图结构. 后续方法大多沿用类似模式, 结合结构重建 [17] 或结构-特征重建的组
合 [18,19] . 另有一些方法则直接舍弃结构信息, 通过重建节点特征来恢复图信息, 例如 EP [20] 和 GraphMAE [21] . 尽管生
成式方法尚未占据主导地位, 但其简单性和通用性为未来的研究提供了广泛的潜力. GraphMAE2 [22] 通过对重构的
[23] [24]
特征添加正则化进一步拓展了遮挡-重建范式. GMAE 通过一个空间匹配模块增强语义捕捉能力. HiG-MAE 使
用层次化策略对不同粒度的图结构进行遮挡. 本文提出了一种生成式方法的探索, 重点关注建模不同图粒度之间
的复杂结构关系, 更好地捕捉和理解图数据的错综复杂性.
1.2 图不平衡学习
图不平衡问题主要可以划分为图类别不平衡和图拓扑不平衡两类, 当前的大部分研究工作主要聚焦于前者.
图类别不平衡主要表现为模型在推断多数类别时表现出显著的优势, 而对于少数类别的识别能力则相对较弱. 为
了应对这一问题, 现有的解决方案主要集中在数据和权重两个方向. 一方面, 通过采样或增加数据的方式, 构建具
有平衡类别数量的数据集; 另一方面, 根据类别的数量差异, 对不同类别的样本权重进行调整. 然而, 这些方法缺乏
对图拓扑结构的深入理解, 因此无法直接解决图拓扑不平衡的问题.
[5]
相较于对图类别不平衡的广泛研究, 图拓扑不平衡问题的探讨仍显不足. ReNode 将图拓扑不平衡学习作为
[6]
图特定不平衡学习的一个关键主题, 并遵循了经典加权方法的范式. 随后, PASTEL 通过标签重新分布的策略, 尝
试缓解图拓扑不平衡问题. 然而, 这些方法聚焦于节点结构的分析, 缺乏对更全面拓扑关系的考虑.

