Page 314 - 《软件学报》2026年第7期
P. 314
杨波 等: PBAT: 基于代理分布的深度学习模型防御加固方法 2999
3.1 研究问题
• RQ1: 从加固后的模型对对抗样本的决策结果的角度, PBAT 与其他的防御方法比较是怎样的?
• RQ2: 从模型所生成的对抗样本质量的角度分析, PBAT 与其他的防御方法比较是怎样的?
• RQ3: 在使用了不同的代理分布模型时, PBAT 方法防御效果如何?
α、 、 ω i (i = 1,2,3) 的设置下, 防御效果变化情况又如何?
• RQ4: 在不同的超参数 λ i
• RQ5: 在目标检测任务领域, PBAT 方法的效果如何?
3.2 数据集及模型
图像分类和目标检测是计算机视觉领域的两个核心任务, 需要算法具备理解图像中不同对象之间关系的能
力. 通过大量数据的训练, 智能模型能够学习到越来越复杂的特征表示. 本文针对这两个核心任务下的典型模型进
行实验, 用以说明方法的普遍有效性.
具体的, 针对分类任务, 将用 MNIST [53] 和 CIFAR10 [54] 这 2 个数据集进行实验. 其中, MNIST 数据集由 70 000
张从 0 到 9 的手写数字的灰度图像组成, 尺寸为 28×28 像素, 其中 60 000 张作为训练集和 10 000 张作为测试集.
不同于 MNIST 手写数据集, CIFAR10 数据集由 10 种类别 (如卡车、飞机、马、青蛙等) 的 60 000 张 32×32 像素
的三通道彩色图像组成, 其中 50 000 张为训练集, 10 000 张为测试集.
[55]
针对目标检测任务, 将在 PASCAL VOC2007 以及 PASCAL VOC2012 上进行, PASCAL VOC2007 中包含 9 963
张标注过的图片, 由训练集、验证集和测试集这 3 部分组成, 共标注出 24 640 个物体. PASCAL VOC2012 中包括
20 类物体, 训练集和验证集中有 11 530 张图片, 共有 27 450 个目标检测标签. 本文后续实验数据将 PASCAL
VOC2007 和 PASCAL VOC2012 中的数据进行合并, 统一分析具体的实验结果.
在模型的选择上, 实验使用了 3 种广泛使用的模型架构: ResNet-20 [56] 、GoogLeNet [57] 和 Faster R-CNN [58] .
3.3 实验配置
所有实验均在 Intel Xeon Processor (Skylake, IBRS) 服务器进行, GPU 为 A100. 其操作系统为 Ubuntu 18.04.6
LTS, 内存为 125 GB. 测试代码使用 Python 语言及 PyTorch 框架实现.
(1) 对抗攻击设置
为了更好地评估 PBAT, 在实验中使用几种对抗攻击算法来对训练后的模型进行攻击, 以对其防御加固效果
进行评测. 实验总共选取了 6 种应用广泛且强度不同的攻击方法: FGSM [59] 、PGD [60] 、AutoPGD [22] 、DeepFool [61] 、
CW [62] 和 DAG [63] .
FGSM 攻击基于对抗样本存在的线性解释, 并利用损失函数、梯度和半径进行计算. 实验中, 使用 ε = 0.31 作
为扰动参数; PGD 攻击使用鞍点公式的迭代攻击来寻找一个强扰动. 设置了攻击参数 ε = 2×8/255, 步长 0.01, 并迭
代 40 次; 对于 AutoPGD 攻击同样设置了 ε = 2×8/255 并迭代了 40 次; DeepFool 攻击是一种迭代攻击并能找到一
个输入的最小扰动, 选取最后的扰动向量所乘的一个常数 (1+overshoot) 中的 overshoot 为 0.02 并设置最大迭代次
数为 40 次; 随后, CW 攻击作为最强大的攻击之一, 使用了 3 种不同的向量规范 (L 0 ,L 2 ,L ∞ ). 使用平滑裁剪梯度下
L 2 攻击规范的 CW 8/255, 迭代 20 次. 最后, DAG
降方法并显示低失真 攻击, 设置其对每层查找迭代的学习率为
作为针对目标检测模型的特殊攻击方法. 通过在多源的任务上进行约束达到攻击效果, 使模型在分类和定位上决
策错误. 实验将在设置该攻击扰动迭代 50 次且强度参数 γ = 0.2 上开展.
(2) 评测指标
为了解决实验前所提出的问题, 针对问题的需要从不同角度考虑多种用于评测的指标来评估 PBAT 的性能,
并在每个数据集的测试集中采样了 1 000 张样本作为测试时的评估对象.
具体评测指标与说明如表 1 所示. 使用 ACC/ACC_CCAT 和 ACTC 指标来回答 RQ1; 使用 ALDp 指标来回
答 RQ2; 使用 ACC 和 COS 指标来回答 RQ3 和 RQ4; 使用 AP 指标来回答 RQ5.
几种评测指标中, 最基础的衡量标准是希望模型的精度 ACC/AP 能够始终保持较高水平. 进一步的, ACTC 作
为用来观察模型对攻击成功样本的分类置信度的指标. 可以通过该指标, 将目光锁定到被模型分类错误的样本当

