Page 316 - 《软件学报》2026年第7期
P. 316

杨波 等: PBAT: 基于代理分布的深度学习模型防御加固方法                                                 3001


                 技术复杂度和与实验环境的适配性上选择了与                PBAT  更具可比性的    4  种方法.
                    ⑤ PBAT  默认使用   λ 1 : λ 2 : λ 3 =1:1:2 的固定权重比例分配样本损失,   α = 0.5、ω 1 = 2、ω 2 = 0.7 以及  ω 3 = 0.3 的
                 超参数设置, 以平衡模型对原始精度和对抗鲁棒性的学习. 在                 MNIST  的实验中, 引入公式     (14) 的动态权重调节机制.

                  4   实验结果与分析
                    为了回答提出的       5  个问题, 开展了两大类实验, 分别是基于分类模型的加固实验和基于目标检测模型的加固
                 实验, 结果在第     4.1–4.4  节中展示. 后续实验结果表格中的第          1  行表示测试使用的     5  种攻击方法, 加固方法中,
                 PAT  代表使用了标准     PGD  攻击生成对抗样本的对抗训练方法, ATLD、CCAT             和  TRADES  作为对比多种加固防
                 御实现角度所复现的其他方法. PBAT           则为本文提出的使用代理分布模型利用新数据改进的对抗训练加固方法;
                 所使用的测试指标说明请参考表            1  中的内容. 特别地, CCAT   方法拒绝对抗样本角度来实现防御的特性, 将不再针
                 对该方法在对抗攻击下的分类准确率             (ACC) 做出评测, 而是使用对抗样本拒绝率作为评价指标. 即上文中提到的
                 单独设置的    (ACC_CCAT), 并不计入最终比较. 后续表格中用加粗表示最优结果.
                    基于目标检测模型的加固实验结果将在第               4.5  节介绍, 相关表格的训练方法列中, PBAT        为本文提出的使用代
                 理分布模型利用新数据改进的对抗训练加固方法; 由于目标检测不同于分类任务, 每张样本不存在唯一一个类别
                 标签. 因此在实验时, 选择了训练时无需提供标签的               APE-GAN  和  DISCO  去噪模型作为代理分布模型的选择. 第         1
                 行表示采用的传统对抗训练方法加固的模型在对抗样本上对模型的检测精度指标                               AP  性能指标. 未将   ATLD、
                 CCAT  和  TRADES  方法纳入对比, 主要是因为这       3  种方法在目标检测任务上存在适用性问题.
                  4.1   对于  RQ1  的回答
                    从表  2  所示的使用   ResNet-20  模型在  MNIST  数据集下的  ACC  指标实验结果可知, PBAT      方法展现出了显著
                 优势. 在面对   FGSM  攻击时, PBAT  的分类准确率在几种对比方法中最高, 与原始的               PAT  对抗训练方法相比, 优势
                 明显. 这表明   PBAT  能够更精准地将样本分类到正确类别, 意味着其决策边界在该攻击场景下更靠近真实的类别
                 划分边界. 虽然在     PGD  攻击下未达最高鲁棒分类精度, 但考虑到            PGD  攻击在简单数据集上易引发鲁棒过拟合现
                 象, PBAT  未过度偏向该攻击且仍保持较高准确率, 说明它能合理调整决策边界, 避免因特定攻击导致决策边界过
                 度扭曲. 同时, 在训练未涉及的        DeepFool 攻击下, PBAT  的鲁棒性提高, 这意味着模型的决策边界具有更好的泛化
                 性, 能够适应多种攻击场景, 而不是局限于训练时的攻击类型. 这种在不同攻击下的良好表现, 充分体现了                                PBAT
                 可以有效改善决策边界, 更具适应性. 在更为复杂的               CIFAR10  数据集上, PBAT  方法依旧表现出色. 在各项攻击下,
                 PBAT  的指标均优于对抗训练方法. 虽然在           AutoPGD  和  DeepFool 攻击下, PBAT  的  ACC  值略低于  TRADES  方
                 法, 这可能是由于     AutoPGD  有一个动态调整步长的机制, 可以根据目标模型的特点和攻击需求选择合适的范数,
                 增加了攻击的灵活性和有效性. 当损失函数出现振荡时, 会将步长缩小. 这种自适应的步长调整能让攻击在不同阶
                 段都能更有效地探索对抗样本空间. 且支持不同范数, 根据不同的范数类型采取不同的对抗样本生成方式. 此外,
                 AutoPGD  会进行多次重启攻击每次重启都会重新初始化对抗样本, 增加了找到有效对抗样本的概率. 这种多轮重
                 启策略可以在不同的初始条件下探索对抗样本空间, 避免陷入局部最优解. 而                        PBAT  防御方法采用的是固定步长
                 和固定范式, 没有考虑到多次重启攻击的情况, 难以适应                 AutoPGD  这种动态的攻击节奏, 导致在攻击过程中无法
                 及时应对. 但综合多种攻击下的整体防御性能, PBAT              方法最优. 尤其是面对       CW  攻击时, TRADES  加固后的模型
                 无法防御实验所设置的攻击, 这是因为            TRADES  方法是在    L ∞  约束下进行加固, 而   CW  攻击设定在    L 2  约束下, 两
                 种约束衡量的扰动类型和程度不同, 针对一种约束训练的模型难以有效防御另一种约束下的攻击, 这也反映出
                 TRADES  方法在面对未知攻击时存在缺陷. 这些指标变化充分说明, PBAT                 方法在复杂数据集上同样适用, 相较于
                 原始对抗训练, PBAT     训练后的模型决策边界得到有效调节. 在训练中加入代理分布样本后, 加固模型的分类边界
                 更接近理想的鲁棒决策边界, 不会因攻击类型的变化而出现大幅波动, 增强了模型防御多种类型攻击的能力.
                    从表  3  中的  ACTC  指标结果可见, PAT   下的加固模型在遭受几种攻击后, 对攻击成功样本的正确类别置信度
                 较低. 而采用   PBAT  方法训练的模型, 该指标大多有一定程度的提高, PBAT               能提升该指标, 说明模型在决策时对
   311   312   313   314   315   316   317   318   319   320   321