Page 203 - 《软件学报》2026年第6期
P. 203
2522 软件学报 2026 年第 37 卷第 6 期
对比图中所有图节点的信息.
HGMSim: (1) HGMSim 模型区分函数节点类型, 使用本图异质邻居聚合方法聚合本图邻居信息. (2) 考虑本图
和对比图的跨图间信息聚合, 建模添加跨图边, 其信息聚合基于本文提出的局部点图匹配方法.
消融实验结果如表 5 所示. HGMSim_w/o_cross 模型比 HGMSim_zero 模型在检索类指标上明显提升, 说明
区分函数调用图的异质信息, 能显著提高同家族样本在检索出的样本中排名的位置. HGMSim_GMN 模型比
HGMSim_w/o_cross 模型在所有指标上都有提升, 表明增加跨图间的节点交互, 能更好地度量恶意软件间的相似
性. HGMSim 模型比 HGMSim_GMN 模型指标高, 体现本文所提局部点图匹配方法的优势. 在充分利用函数调用
图中节点异质特性的同时, 仅考虑跨图间同类型函数节点的交互, 降低跨图匹配的计算开销, 同时实现了更好的
性能.
表 5 消融实验结果
模型名 MRR NDCG@10 AUC
HGMSim_zero 0.365 0.288 0.886
HGMSim_w/o_cross 0.482 0.386 0.879
HGMSim_GMN 0.595 0.465 0.898
HGMSim 0.595 0.508 0.919
为了进一步解释跨图交互是如何提升模型检测性能的, 对 installmonster 家族和 fusioncore 家族的样本进行分
析, 其样本 md5 值分别为 eec55f1295d0cce40bbba7be231fdddb 和 6abf24e3aa3e971e6461bcfea35fe950, 这两个样本
中接近 70% 的函数是完全相同的, 其函数调用图结构相似程度很高. 未使用跨图交互的模型并未很好地区分该类
样本. 使用 PCA (主成分分析) 将图神经网络每层嵌入学习后得到的 CG 函数嵌入向量从 128 维降低到 2 维, 然后
使用密度散点图将降维后的 CG 函数嵌入向量进行可视化, 结果如图 6 所示.
HGMSim
第 1 层函数嵌入 第 2 层函数嵌入 第 3 层函数嵌入
HGMSim_w/o_cross
HGMSim_zero
原始函数特征
图 6 函数嵌入可视化图
图 6 由多个小图构成, 每个小图右边是 installmonster 家族样本的密度散点图, 左边是 fusioncore 家族样本的密
度散点图, 粉色表示聚集节点多, 蓝色表明聚集节点少, 即粉色点聚集的区域代表着样本主要信息. 可以看到, 由于
这两个恶意样本 70% 的函数特征向量都是完全相同的, 所以其原始函数特征的粉色区域都聚集在相近的坐标下.
在消融实验中, 未区分异质和跨图语义的 HGMSim_zero 模型 (粉色背景框) 和只区分了本图异质信息的 HGMSim_
w/o_cross 模型 (绿色背景框), 由于相同的图结构和图节点占绝大多数, 因此在整个信息传递的过程中, 两个样本
可视化图像的粉色点聚集区域位置依旧存在着较高的相似性, 并不能很好地区分这类样本. 对于 HGMSim 方法
(蓝色背景框), 在信息传递的过程中增加了跨图间的局部点图匹配, 使得粉色节点分布差异明显增大, 第 3 次函数

