Page 284 - 《软件学报》2026年第4期
P. 284
凌祥 等: RMDroid: 基于多模态融合学习的安卓恶意软件鲁棒检测 1725
y z = 1 代表一般性恶意软件或者对抗性恶意软件. 为此, 在第 2.2 z 的
y z = 0 代表善意软件, 而 节提取待测安卓软件
⃗
⃗
⃗
cfg
api
img
cfg
img
api
多模态特征 ( x z 、 x z 、 x z ) 和第 2.3 节学习到相应的多模态特征向量集 H z = {h z ,h z ,h z } 的基础上, 本文采用
面向多模态信息的特征融合学习方法, 全面融合 z 的多个模态信息, 进一步扩宽和补充安卓恶意软件的深层语义
信息, 从而提升安卓恶意软件检测方法的准确性和鲁棒性.
本质上, 多模态信息融合学习 [66] 的核心是充分地利用样本中多个模态特征之间的互补性, 将多个模态的特征
信息进行融合学习并进一步映射到一个统一的向量空间中, 从而为下游任务提供丰富且稳定的特征表示. 不失一
⃗ (k) k=K , 那么标准的多模态信息融合学习方法可以表示成
般性地, 假设任一样本总共有 K 个模态特征向量 H = {h }
k=1
( )
⃗ (k) k=K
F(H) = Γ {h } , 其中 Γ 代表某种融合方法, 例如, 特征向量拼接、加权求和、线性投影等.
k=1
然而, 尽管多模态信息融合学习方法已经在各类计算机视觉相关任务中表现出极出色的性能, 例如场景理解、
情感分析、语音识别等 [66] , 但是相关研究发现这类方法在单个模态受到对抗攻击时也会引发多模态信息融合学
习方法失效 [67] . 因此, 受到计算机视觉领域中鲁棒融合学习相关工作的启发 [67] , 本文在安卓恶意软件鲁棒检测任
F robust (H), 不仅可以
务中引入面向多模态信息的鲁棒融合学习方法, 提出基于鲁棒融合学习的恶意软件检测方法
准确地识别善意软件和一般性恶意软件, 而且能够识别攻击者生成的对抗性恶意软件. 现有的多模态恶意软件检
测模型主要是通过不同模态的特征冗余提供稳定性, 但受到扰动的特征被融合时对抗性扰动带来的影响仍然不可
Θ 来主动识别可能被扰动的恶意软
避免地引入最终的预测网络中. 针对现有工作的不足, 本文利用异类识别网络
件模态, 从而对该模态对应的特征进行加权处理, 弱化该扰动的模态对最终预测网络的影响, 有效地提高恶意软件
检测的鲁棒性.
如图 2 和公式 (7) 所示, 本文所提出的基于鲁棒融合学习的恶意软件检测方法 F robust (H) 具体由异类识别网络
˜ Γ 共同组成.
Θ 和鲁棒融合预测网络
F robust (H) = ˜ Γ(H;Θ(H)) (7)
(1)
p Θ,z
(a)
(2) 异
p Θ,z
类
识
(3)
img p Θ,z
h z
别
(4) 网
p Θ,z
络
Θ
不一致性概率
S 1
api
h z
S 2 恶意
y z =1
S 3 加权
求和 e z 善意
y z =0
S 4
~
cfg (b) 鲁棒融合预测网络 Γ
h z
F robust 示意图
图 2 基于鲁棒融合学习的安卓恶意软件检测方法
⃗ (k) k=K Θ 会预测每个模态特征可能受到对抗样
这表明, 针对任一样本的多模态特征向量 H = {h } , 异类识别网络
k=1
本攻击的概率; 而鲁棒融合预测网络 ˜ Γ 则会利用异类识别网络 Θ 预测的概率, 降低甚至消除受到对抗攻击的模态
特征对最终恶意软件检测结果的影响, 从而提高其抵御对抗攻击的鲁棒性. 下面将在第 2.4.1 节和第 2.4.2 节分别
介绍异类识别网络 Θ 和鲁棒融合预测网络 ˜ Γ.

