Page 318 - 《软件学报》2026年第7期
P. 318

杨波 等: PBAT: 基于代理分布的深度学习模型防御加固方法                                                 3003


                 标预测值的变化范围更大. 模型在错误类别同样拥有更大的置信度水平, 更能反映模型的决策边界波动大, 容易产
                 生极端值. 而   TRADES  方法对不同类型的攻击的普遍防御性能则逊色于本文的方法. PBAT                     加固后的模型能更好
                 地防御对抗攻击, 整体性能最好.

                              表 5 对于   RQ1, 使用  GoogLeNet 模型在不同数据集下的       ACTC  指标实验结果

                    数据集           加固方法           FGSM         PGD       AutoPGD     DeepFool     CW
                                PAT (对抗训练)       0.057 59   0.164 09    0.220 58     0.405 43   0.129 74
                                   ATLD          0.042 20   0.040 17    0.049 15     0.210 41   0.042 06
                    MNIST
                                  TRADES        0.011 917   0.270 894   0.311 74     0.442 10   0.129 35
                                   PBAT          0.095 13   0.109 418   0.097 32     0.474 15   0.269 66
                                PAT (对抗训练)       0.105 81   0.099 28    0.129 53     0.361 50   0.073 59
                                   ATLD          0.093 99   0.091 66    0.117 32     0.188 97   0.087 85
                    CIFAR10
                                  TRADES         0.096 65   0.102 22    0.079 12     0.101 59   0.202 24
                                   PBAT          0.116 25   0.096 99    0.125 73    0.356 575   0.059 42

                    综合来看, PBAT    方法在不同模型      (ResNet-20  和  GoogLeNet) 和数据集  (MNIST  和  CIFAR10) 上, 通过在各种
                 攻击下提高分类准确率        (ACC)、提升正确分类类别的平均预测置信度               (ACTC) 以及展现出良好的平均防御效果,
                 充分证明了其能够有效改善决策边界, 使模型的决策边界更趋向于理想的鲁棒决策边界, 增强了模型对多种攻击
                 的防御能力.
                  4.2   对  RQ2 的回答

                    针对  RQ2, 从对抗样本失真度角度设计实验, 结果如表              6  所示. 3  个指标结果值分别代表     L 0 、  L 2  和  L ∞  失真度.
                 L 0 、 L 2  距离用于衡量对抗样本与原始样本在特征空间的差异, 反映视觉欺骗性和细微改变程度, 距离越小表明对
                 抗样本越接近原始样本, 越易绕过图像识别系统检测;                 L ∞  值则体现最大扰动幅度, 在目标模型鲁棒性较强时, 需增

                 大  L ∞  值以确保对抗样本成功攻击; ALDp      指标直观量化输入扰动程度, 数值越大代表扰动越强, 间接反映模型鲁
                 棒性水平.

                              表 6 使用   ResNet-20  模型在  MNIST  和  CIFAR10  数据集下的  ALDp  指标结果

                  数据集     方法        FGSM            PGD          AutoPGD       DeepFool         CW
                          PAT   (0.996 71, 0.953 72,  (0.996 67, 0.953 74,  (0.968 70, 0.926 96,  (0.999 99, 0.099 49,
                        (对抗训练)       1.0)           1.0)         0.971 55)     0.645 79)     (1.0, 1.0, 1.0)
                                (0.998 77, 0.963 46,  (0.998 84, 0.963 46  (0.887 49, 0.856 76,  (0.999 97, 0.262 21,
                         ATLD                                                                (1.0, 1.0, 1.0)
                                     1.0)           1.0)         0.888 40)     2.075 90)
                  MNIST
                                (0.995 42, 0.975 12,  (0.708 45, 0.071 70,  (0.781 42, 0.065 77,  (0.999 50, 0.002 77,  (0.258 59, 1.0,
                         CCAT
                                     1.0)         0.031 37)      0.030 68)     0.002 44)      0.992 84)
                                (0.997 21, 0.962 26,  (0.997 63, 0.961 10,  (0.974 31, 0.935 94,  (1.0, 0.106 96,
                         PBAT                                                                (1.0, 1.0, 1.0)
                                     1.0)           1.0)         0.976 37)     0.666 20)
                          PAT     (1.0, 0.776 85,  (1.0, 0.765 14,  (0.841 71, 0.633 49,  (0.999 96, 0.020 92,
                        (对抗训练)      2.166 94)     2.165 27)      1.819 52)     0.180 30)   (1.0, 1.0, 2.484 44)
                                (0.996 00, 0.741 81,  (0.996 48, 0.734 84,  (0.753 78, 0.547 104, (0.999 994, 0.066 13,  (1.0, 1.0,
                         ATLD
                                    0.909 31)     0.910 05)      0.691 60)     0.259 67)      0.963 46)
                 CIFAR10
                                (0.993 84, 0.062 85,  (0.997 20, 0.045 54,  (0.889 02, 0.119 88,  (0.999 32, 0.000 89,  (0.997 61, 1.0,
                         CCAT
                                    0.031 37)     0.031 37)      0.088 99)     0.003 08)      0.940 446)
                                  (1.0, 0.785 68,  (1.0, 0.775 87,  (0.669 31, 0.502 71,  (0.999 99, 0.024 48,
                         PBAT                                                              (1.0, 1.0, 2.502 50)
                                    2.179 47)     2.166 81)      1.447 45)     0.220 13)

                    实验数据表明, 相较于原始对抗训练            (PAT) 方法, PBAT  生成的对抗样本在     ALDp  指标上显著提升. 这一结果
                 意味着   PBAT  生成的对抗样本需施加更强扰动才能突破模型防御, 揭示了                   PAT  的关键差异, 即, 传统对抗训练模
                 型防御边界脆弱, 易被轻微扰动突破; 而           PBAT  需施加更强扰动才能成功攻击模型. 结合             RQ1  中  PBAT  在分类准
                 确率  (ACC) 和正确类别置信度      (ACTC) 上的优势, 双重验证了相较于        PAT  的核心改进, 实现了训练范式升级.
   313   314   315   316   317   318   319   320   321   322   323