Page 203 - 《软件学报》2026年第6期
P. 203

2522                                                       软件学报  2026  年第  37  卷第  6  期


                 对比图中所有图节点的信息.
                    HGMSim: (1) HGMSim  模型区分函数节点类型, 使用本图异质邻居聚合方法聚合本图邻居信息. (2) 考虑本图
                 和对比图的跨图间信息聚合, 建模添加跨图边, 其信息聚合基于本文提出的局部点图匹配方法.
                    消融实验结果如表       5  所示. HGMSim_w/o_cross 模型比  HGMSim_zero  模型在检索类指标上明显提升, 说明
                 区分函数调用图的异质信息, 能显著提高同家族样本在检索出的样本中排名的位置. HGMSim_GMN                                 模型比
                 HGMSim_w/o_cross 模型在所有指标上都有提升, 表明增加跨图间的节点交互, 能更好地度量恶意软件间的相似
                 性. HGMSim  模型比  HGMSim_GMN   模型指标高, 体现本文所提局部点图匹配方法的优势. 在充分利用函数调用
                 图中节点异质特性的同时, 仅考虑跨图间同类型函数节点的交互, 降低跨图匹配的计算开销, 同时实现了更好的
                 性能.


                                                     表 5 消融实验结果

                                         模型名            MRR       NDCG@10       AUC
                                      HGMSim_zero       0.365       0.288       0.886
                                    HGMSim_w/o_cross    0.482       0.386       0.879
                                      HGMSim_GMN        0.595       0.465       0.898
                                        HGMSim          0.595       0.508       0.919

                    为了进一步解释跨图交互是如何提升模型检测性能的, 对                   installmonster 家族和  fusioncore 家族的样本进行分
                 析, 其样本  md5  值分别为   eec55f1295d0cce40bbba7be231fdddb  和  6abf24e3aa3e971e6461bcfea35fe950, 这两个样本
                 中接近   70%  的函数是完全相同的, 其函数调用图结构相似程度很高. 未使用跨图交互的模型并未很好地区分该类
                 样本. 使用  PCA (主成分分析) 将图神经网络每层嵌入学习后得到的                 CG  函数嵌入向量从     128  维降低到  2  维, 然后
                 使用密度散点图将降维后的          CG  函数嵌入向量进行可视化, 结果如图          6  所示.

                       HGMSim
                                            第 1 层函数嵌入           第 2 层函数嵌入             第 3 层函数嵌入
                       HGMSim_w/o_cross
                       HGMSim_zero











                      原始函数特征





                                                   图 6 函数嵌入可视化图

                    图  6 由多个小图构成, 每个小图右边是         installmonster 家族样本的密度散点图, 左边是      fusioncore 家族样本的密
                 度散点图, 粉色表示聚集节点多, 蓝色表明聚集节点少, 即粉色点聚集的区域代表着样本主要信息. 可以看到, 由于
                 这两个恶意样本      70%  的函数特征向量都是完全相同的, 所以其原始函数特征的粉色区域都聚集在相近的坐标下.
                 在消融实验中, 未区分异质和跨图语义的            HGMSim_zero 模型  (粉色背景框) 和只区分了本图异质信息的            HGMSim_
                 w/o_cross 模型  (绿色背景框), 由于相同的图结构和图节点占绝大多数, 因此在整个信息传递的过程中, 两个样本
                 可视化图像的粉色点聚集区域位置依旧存在着较高的相似性, 并不能很好地区分这类样本. 对于                                HGMSim  方法
                 (蓝色背景框), 在信息传递的过程中增加了跨图间的局部点图匹配, 使得粉色节点分布差异明显增大, 第                              3  次函数
   198   199   200   201   202   203   204   205   206   207   208