Page 201 - 《软件学报》2026年第6期
P. 201
2520 软件学报 2026 年第 37 卷第 6 期
生成.
TLSH 方法: 无需训练, 无超参数.
Siamese_CNNs: mini-batch size: 6, 学习率: 0.000 06, 训练轮次: 2 000.
Siamese_GNN: 学习率: 0.001, batch size: 64.
RGCN: 学习率: 3E–5, 层数: 2, 嵌入向量维度: 128.
MGMN: 学习率: 0.000 5, 嵌入向量维度: 100, dropout: 0.1.
HGMSim: 学习率: 3E–5, 层数: 2, 全连接网络层数: 2, 嵌入向量维度: 128.
4.1.4 评价指标
实验使用的评价指标包括分类指标和检索评价指标.
分类指标: 由于恶意软件相似性度量可以判断两个样本是否属于同一家族, 考虑到不同相似性度量模型判断
样本对是否属于同一家族的阈值并不相同 [29] , 本文采用 AUC (area under curve) 指标, AUC 被定义为 ROC (receiver
operating characteristic) 曲线下的面积, 用于综合衡量模型对于测试集样本在所有可能分类阈值中的性能表现.
检索评价指标:
(1) 平均倒数排名 MRR (mean reciprocal rank)
1 ∑ 1
MRR = ( ) (12)
N p i ∈P f min rk p i
对于测试请求图 P = {p 1 , p 2 ,..., p n } 中的每个样本 , 从测试请求图构建与 p i 家族标记相同的样本集合 SF p i = {sp 1 ,
p i
{ }
{ } gt gt gt
sp 2 ,..., sp m }, 并获得 p i 的预测排名 rk p i = rank sp 1 ,rank sp 2 ,...,rank sp m 和真实排名 gt p i = rank sp 1 ,rank sp 2 ,...,rank sp m ,
使用模型计算整个测试请求图中所有样本和 p i 的相似值, 其中预测排名为 p i 同家族样本相似度在整个测试请求
图样本中的排名情况, 真实排名根据目标样本的家族标记构建, 即来自同一家族的样本之间的排名高于来自不同
家族的样本的排名, f min 用于取出集合中最高的排名.
(2) 归一化折损累计增益 NDCG (normalized discounted cumulative gain)
∑ @k
DCG p i
NDCG@k = (13)
@k
p i ∈P IDCG p i
2 −1
∑ f(loc,k)
其中, DCG p i @k = , @k 是样本 p i 返回的前 k 个样本的折扣累计增益, @k =
loc∈rk p i log (loc+1) DCG p i IDCG p i
2 {
2 −1 n, if n < k
∑ f(loc,k)
, @k 是样本 p i 在理想情况下返回的前 k 个样本的折扣累积增益, f (n,k) = .
loc∈gt p i log (loc+1) IDCG p i 0, if n ⩾ k
2
4.2 模型评估
为了验证模型性能, 论文通过实验回答以下 3 个问题.
RQ1: HGMSim 同基线模型相比, 在多个指标下的性能表现如何? (第 4.2.1 节)
RQ2: HGMSim 异质信息语义挖掘和局部点图匹配方法的有效性如何? (第 4.2.2 节)
RQ3: 不同反汇编工具生成图结构的差异对模型性能的影响如何? (第 4.2.3 节)
实验在配备两个 Intel(R) Xeon(R) Silver 4210R CPU (总共 40 个逻辑核心, 运行频率 2.40 GHz), 128 GB 内存,
1 块 3090 显卡的服务器上进行. 对于需要使用反汇编工具的基线方法, 本文使用其指定的反汇编工具来进行数据
预处理, 如果未指定反汇编工具, 便统一使用业界主流的反汇编工具 IDA Pro 进行数据处理.
4.2.1 模型相似性度量性能对比实验
本节将从模型性能和时间复杂度两方面, 将 HGMSim 模型和基线模型进行对比.
模型性能对比结果如表 2 和表 3 所示. 可以看到, HGMSim 在全部指标上都高于基于程序序列的 TLSH 和
Siamese_CNNs 方法, 表明将恶意样本构建成异质图匹配网络, 能大幅度提升模型的相似性度量性能. HGMSim 指
标优于 RGCN, 表明增加跨图间的信息传递, 能有效提升模型的检索性能. 相对于基于跨图匹配的 MGMN 方法,
HGMSim 在所有指标上都有一定提升, 表明区分图节点的异质性, 有助于模型挖掘恶意软件的语义信息. HGMSim
同基于程序图的 Siamese_GNN 相比, 两者在 AUC 分类指标上十分接近, 且明显高于其他基线模型的性能, 表明

