Page 201 - 《软件学报》2026年第6期
P. 201

2520                                                       软件学报  2026  年第  37  卷第  6  期


                 生成.
                    TLSH  方法: 无需训练, 无超参数.
                    Siamese_CNNs: mini-batch size: 6, 学习率: 0.000 06, 训练轮次: 2 000.
                    Siamese_GNN: 学习率: 0.001, batch size: 64.
                    RGCN: 学习率: 3E–5, 层数: 2, 嵌入向量维度: 128.
                    MGMN: 学习率: 0.000 5, 嵌入向量维度: 100, dropout: 0.1.
                    HGMSim: 学习率: 3E–5, 层数: 2, 全连接网络层数: 2, 嵌入向量维度: 128.
                  4.1.4    评价指标
                    实验使用的评价指标包括分类指标和检索评价指标.
                    分类指标: 由于恶意软件相似性度量可以判断两个样本是否属于同一家族, 考虑到不同相似性度量模型判断
                 样本对是否属于同一家族的阈值并不相同              [29] , 本文采用  AUC (area under curve) 指标, AUC  被定义为  ROC (receiver
                 operating characteristic) 曲线下的面积, 用于综合衡量模型对于测试集样本在所有可能分类阈值中的性能表现.
                    检索评价指标:
                    (1) 平均倒数排名    MRR (mean reciprocal rank)

                                                         1  ∑     1
                                                   MRR =          (  )                               (12)
                                                         N   p i ∈P f min rk p i
                    对于测试请求图      P = {p 1 , p 2 ,..., p n } 中的每个样本  , 从测试请求图构建与   p i  家族标记相同的样本集合   SF p i  = {sp 1 ,
                                                         p i
                                                                                   {                   }
                                                 {                   }                 gt    gt      gt
                 sp 2 ,..., sp m }, 并获得   p i  的预测排名  rk p i  = rank sp 1  ,rank sp 2 ,...,rank sp m   和真实排名  gt p i  = rank sp 1  ,rank sp 2  ,...,rank sp m  ,
                 使用模型计算整个测试请求图中所有样本和                p i  的相似值, 其中预测排名为     p i  同家族样本相似度在整个测试请求
                 图样本中的排名情况, 真实排名根据目标样本的家族标记构建, 即来自同一家族的样本之间的排名高于来自不同
                 家族的样本的排名,      f min  用于取出集合中最高的排名.
                    (2) 归一化折损累计增益       NDCG (normalized discounted cumulative gain)

                                                           ∑         @k
                                                                DCG p i
                                                 NDCG@k =                                            (13)
                                                                     @k
                                                             p i ∈P IDCG p i
                                       2   −1
                               ∑        f(loc,k)
                 其中,   DCG p i @k =            ,     @k  是样本   p i  返回的前  k  个样本的折扣累计增益,            @k =
                                  loc∈rk p i log (loc+1)  DCG p i                              IDCG p i
                                        2                                                   {
                        2    −1                                                               n, if n < k
                 ∑       f(loc,k)
                                ,      @k 是样本   p i  在理想情况下返回的前   k 个样本的折扣累积增益,       f (n,k) =         .
                   loc∈gt p i log (loc+1)  IDCG p i                                           0, if n ⩾ k
                         2
                  4.2   模型评估
                    为了验证模型性能, 论文通过实验回答以下              3  个问题.
                    RQ1: HGMSim  同基线模型相比, 在多个指标下的性能表现如何? (第              4.2.1  节)
                    RQ2: HGMSim  异质信息语义挖掘和局部点图匹配方法的有效性如何? (第                  4.2.2  节)
                    RQ3: 不同反汇编工具生成图结构的差异对模型性能的影响如何? (第                    4.2.3  节)
                    实验在配备两个      Intel(R) Xeon(R) Silver 4210R CPU (总共  40  个逻辑核心, 运行频率  2.40 GHz), 128 GB  内存,
                 1  块  3090  显卡的服务器上进行. 对于需要使用反汇编工具的基线方法, 本文使用其指定的反汇编工具来进行数据
                 预处理, 如果未指定反汇编工具, 便统一使用业界主流的反汇编工具                    IDA Pro  进行数据处理.
                  4.2.1    模型相似性度量性能对比实验
                    本节将从模型性能和时间复杂度两方面, 将              HGMSim  模型和基线模型进行对比.
                    模型性能对比结果如表         2  和表  3  所示. 可以看到, HGMSim  在全部指标上都高于基于程序序列的              TLSH  和
                 Siamese_CNNs 方法, 表明将恶意样本构建成异质图匹配网络, 能大幅度提升模型的相似性度量性能. HGMSim                         指
                 标优于   RGCN, 表明增加跨图间的信息传递, 能有效提升模型的检索性能. 相对于基于跨图匹配的                           MGMN  方法,
                 HGMSim  在所有指标上都有一定提升, 表明区分图节点的异质性, 有助于模型挖掘恶意软件的语义信息. HGMSim
                 同基于程序图的      Siamese_GNN  相比, 两者在  AUC  分类指标上十分接近, 且明显高于其他基线模型的性能, 表明
   196   197   198   199   200   201   202   203   204   205   206