Page 314 - 《软件学报》2026年第7期
P. 314

杨波 等: PBAT: 基于代理分布的深度学习模型防御加固方法                                                 2999


                  3.1   研究问题
                    • RQ1: 从加固后的模型对对抗样本的决策结果的角度, PBAT               与其他的防御方法比较是怎样的?
                    • RQ2: 从模型所生成的对抗样本质量的角度分析, PBAT             与其他的防御方法比较是怎样的?
                    • RQ3: 在使用了不同的代理分布模型时, PBAT          方法防御效果如何?
                                       α、 、  ω i (i = 1,2,3) 的设置下, 防御效果变化情况又如何?
                    • RQ4: 在不同的超参数        λ i
                    • RQ5: 在目标检测任务领域, PBAT      方法的效果如何?
                  3.2   数据集及模型

                    图像分类和目标检测是计算机视觉领域的两个核心任务, 需要算法具备理解图像中不同对象之间关系的能
                 力. 通过大量数据的训练, 智能模型能够学习到越来越复杂的特征表示. 本文针对这两个核心任务下的典型模型进
                 行实验, 用以说明方法的普遍有效性.
                    具体的, 针对分类任务, 将用        MNIST [53] 和  CIFAR10 [54] 这  2  个数据集进行实验. 其中, MNIST  数据集由  70 000
                 张从  0  到  9  的手写数字的灰度图像组成, 尺寸为        28×28  像素, 其中  60 000  张作为训练集和  10 000  张作为测试集.
                 不同于   MNIST  手写数据集, CIFAR10  数据集由    10  种类别  (如卡车、飞机、马、青蛙等) 的         60 000  张  32×32  像素
                 的三通道彩色图像组成, 其中         50 000  张为训练集, 10 000  张为测试集.
                                                                        [55]
                    针对目标检测任务, 将在       PASCAL VOC2007 以及  PASCAL VOC2012 上进行, PASCAL VOC2007 中包含     9 963
                 张标注过的图片, 由训练集、验证集和测试集这               3  部分组成, 共标注出     24 640  个物体. PASCAL VOC2012  中包括
                 20  类物体, 训练集和验证集中有        11 530  张图片, 共有  27 450  个目标检测标签. 本文后续实验数据将           PASCAL
                 VOC2007  和  PASCAL VOC2012  中的数据进行合并, 统一分析具体的实验结果.
                    在模型的选择上, 实验使用了         3  种广泛使用的模型架构: ResNet-20    [56] 、GoogLeNet [57] 和  Faster R-CNN [58] .

                  3.3   实验配置
                    所有实验均在      Intel Xeon Processor (Skylake, IBRS) 服务器进行, GPU  为  A100. 其操作系统为  Ubuntu 18.04.6
                 LTS, 内存为 125 GB. 测试代码使用    Python  语言及  PyTorch  框架实现.
                    (1) 对抗攻击设置
                    为了更好地评估       PBAT, 在实验中使用几种对抗攻击算法来对训练后的模型进行攻击, 以对其防御加固效果
                 进行评测. 实验总共选取了        6  种应用广泛且强度不同的攻击方法: FGSM          [59] 、PGD [60] 、AutoPGD [22] 、DeepFool [61] 、
                 CW [62] 和  DAG [63] .
                    FGSM  攻击基于对抗样本存在的线性解释, 并利用损失函数、梯度和半径进行计算. 实验中, 使用                           ε = 0.31 作
                 为扰动参数; PGD    攻击使用鞍点公式的迭代攻击来寻找一个强扰动. 设置了攻击参数                     ε = 2×8/255, 步长  0.01, 并迭
                 代  40  次; 对于  AutoPGD  攻击同样设置了  ε = 2×8/255 并迭代了  40  次; DeepFool 攻击是一种迭代攻击并能找到一
                 个输入的最小扰动, 选取最后的扰动向量所乘的一个常数                   (1+overshoot) 中的  overshoot 为  0.02  并设置最大迭代次
                 数为  40  次; 随后, CW  攻击作为最强大的攻击之一, 使用了          3  种不同的向量规范     (L 0 ,L 2 ,L ∞ ). 使用平滑裁剪梯度下
                                  L 2  攻击规范的  CW                                 8/255, 迭代  20  次. 最后, DAG
                 降方法并显示低失真                       攻击, 设置其对每层查找迭代的学习率为
                 作为针对目标检测模型的特殊攻击方法. 通过在多源的任务上进行约束达到攻击效果, 使模型在分类和定位上决
                 策错误. 实验将在设置该攻击扰动迭代            50  次且强度参数   γ = 0.2 上开展.
                    (2) 评测指标
                    为了解决实验前所提出的问题, 针对问题的需要从不同角度考虑多种用于评测的指标来评估                                PBAT  的性能,
                 并在每个数据集的测试集中采样了            1 000  张样本作为测试时的评估对象.
                    具体评测指标与说明如表          1  所示. 使用  ACC/ACC_CCAT  和  ACTC  指标来回答   RQ1; 使用  ALDp  指标来回
                 答  RQ2; 使用  ACC  和  COS  指标来回答  RQ3  和  RQ4; 使用  AP  指标来回答  RQ5.
                    几种评测指标中, 最基础的衡量标准是希望模型的精度                  ACC/AP  能够始终保持较高水平. 进一步的, ACTC         作
                 为用来观察模型对攻击成功样本的分类置信度的指标. 可以通过该指标, 将目光锁定到被模型分类错误的样本当
   309   310   311   312   313   314   315   316   317   318   319