Page 319 - 《软件学报》2026年第7期
P. 319
3004 软件学报 2026 年第 37 卷第 7 期
4.3 对 RQ3 的回答
针对 RQ3, 使用 CAFD (以 RaGAN 为原型, 通过由类激活特征损失和对抗性损失组成的混合损失函数训练,
最小化类激活特征空间中对抗样本与原始样本的距离来消除对抗噪声), APE-GAN (利用融合损失函数使对抗样
本与原始样本流形保持一致, 去除对抗扰动), DISCO (通过编码器和局部隐式函数预测原始图像 RGB 值, 以局部
像素信息输入实现对抗性去除) 这 3 种模型结构作为代理分布模型的选择, 代理模型是指用于学习样本分布规律
并生成新数据 (代理分布样本) 的概率生成模型. 并对待加固模型进行了加固训练, 之后再对加固效果进行比较.
实验的结果如表 7 所示. 使用的指标为 COS 值, 即对攻击成功的样本使用了 JS 散度值来衡量在使用不同代理分
布模型时与原始对抗训练方法加固后模型输出概率的相似性之间的差别. 以此来说明在采用不同代理模型结构后
对模型的决策结果是否有显著性的区别. 对于 MNIST 数据集和 ResNet-20 模型, 模型对攻击成功的样本输出概率
的相似度普遍高于 CIFAR10 数据集和 GoogLeNet 模型下的相似度. 猜测是因为在简单模型和简单数据集上, 模
型的学习空间维度较小, 模型最终行为存在的差异并不大. 而代理模型的选择和数据集存在较大的相关性. 在
MNIST 数据集上 DISCO 表现最优, 而在 CIFAR10 数据集上 CAFD 作为代理模型表现最优. 但基于 APE-GAN 在
两类数据集上表现较为均衡, 整体都有较好的效果. 之后将作为本文默认使用的代理模型结构的选择. 在第 4.1 和
4.2 节则根据代理模型在任务上的适用性动态在三者之间进行择优选择. 进一步分析 COS 指标发现, 不同加固方
法后模型的输出相似性都不太高, 说明本文的方法与一般的对抗训练方法确实对模型的决策行为有明显的差异,
突出本文方法和对抗训练的不同之处.
表 7 PBAT 分别使用 APE-GAN、CAFD 与 DISCO 作为代理分布模型的实验结果
数据集 模型结构 加固方法 测试指标 FGSM PGD AutoPGD DeepFool CW
ACC 87 94.6 94.5 2.2 12.2
APE-GAN+对抗训练
COS 46.6 46.9 45.8 33.4 45.8
ACC 8.9 8.9 8.5 3.0 8.9
ResNet-20 CAFD+对抗训练
COS 64.5 68.3 29.3 47.7 68.6
ACC 93.1 95.5 65.5 21.4 6.4
DISCO+对抗训练
COS 13.5 12.8 33.7 43.6 4.7
MNIST
APE-GAN+对抗训练 ACC 55.2 93.2 93.2 1.9 8.3
COS 45.5 34.2 30.6 30.3 30
ACC 11.4 10.6 8.7 3.1 8.5
GoogLeNet CAFD+对抗训练
COS 57.5 57.6 49.8 30.5 60
ACC 90 94.2 84.8 9.7 8.2
DISCO+对抗训练
COS 21.6 26.5 52.5 45.4 5.5
ACC 34.5 21.9 4.5 15.7 10.3
APE-GAN+对抗训练
COS 16.7 17.7 19.2 24.0 12.0
ACC 48.7 34.9 11.7 14.6 10.0
ResNet-20 CAFD+对抗训练
COS 18.8 19.7 19.4 21.2 12.2
ACC 34.5 26.6 9.2 13.2 10.3
DISCO+对抗训练
COS 16.8 17.1 16.9 18.9 10.6
CIFAR10
APE-GAN+对抗训练 ACC 41.6 29.3 7.7 14.0 10.0
COS 11.7 12.8 11.1 10.9 2.1
ACC 58.9 38.6 7.0 17.4 11.2
GoogLeNet CAFD+对抗训练
COS 18.8 22.6 21.8 24.0 19.5
ACC 30.0 26.1 9.2 16.5 10.3
DISCO+对抗训练
COS 8.0 8.2 8.4 11.2 3.2
通过对结果 ACC 值进行参数检验. 如图 5 所示, 使用 Kruskal-Wallis 检验统计量进行分析发现, 不同加固方
法对于 5 种攻击方法不会表现出显著性 (p>0.05). 但使用 DISCO 和 APE-GAN 作为代理模型时在不同模型和数据
集上都有较好的表现, 加固效果整体更好.

