Page 34 - 《软件学报》2026年第4期
P. 34

翟浩杰 等: 基于自适应策略优化的鲁棒泛化权衡学习                                                       1475


                                                                                          y
                 战. 通常, 这种扰动的不可察觉性可转化为对扰动大小                L p  范数的  ε 上界限制. 令  x 表示原样本,   表示其真实标签,
                 δ 表示添加到    x 上的扰动,   f(·,w) 表示神经网络模型,    w 表示网络参数,    L 为损失函数, 于是针对样本        x 的对抗样本
                 集合可以表示为:

                                             A(x) = {x+δ| f(x+δ,w) , f(x,w),||δ|| p ⩽ ε}              (2)
                  1.1   对抗攻击
                    一般情况下, 获取对抗样本的任何方法均可称为对抗攻击. 结合上述对抗样本和扰动限制的概念, 对抗攻击从
                 数学上可以被建模为一个优化问题:

                                                maxL( f(x+δ,w),y), s.t. ||δ|| p ⩽ ε                   (3)
                                                  δ
                 即在扰动   δ 的   L p  范数的  ε 上界约束下, 最大化网络输出对于真实标签的损失, 记           x adv = x+δ 为对抗样本. 针对特定
                                                                                              x 的单个通道
                 分类任务, 扰动    δ 的  L p  范数约束会根据   p 的不同取值具有不同的特殊意义, 例如在图像分类中, 样本
                 通常被建模为数学概念上的矩阵, 常使用             L 0 、 L 2  和  L ∞  这  3  种特殊的矩阵范数对其进行约束, 其中  L 0  范数限制图
                 像中可修改的像素数量,        L 2  范数限制图像中像素值的平均变化,         L ∞  范数限制图像中所有像素值的最大变化.
                    经典对抗攻击方法依据其核心策略可分为               3  大类: 基于梯度信息的攻击、基于函数优化的攻击以及自适应集
                 成攻击, 各类方法在扰动生成机制和应用场景上具有显著差异.
                                                                                      L ∞  范数约束下的攻击为
                    1) 基于梯度信息的攻击. 此类方法利用模型对样本的梯度信息直接构造对抗扰动. 以
                 例, Goodfellow  等人  [13] 提出的快速梯度符号法  FGSM (fast gradient sign method) 是奠基性工作, 通过单步计算损失
                 函数对输入样本的梯度符号生成扰动, 具有高效性但攻击精度有限. 后续研究通过迭代优化改进攻击效果, 如基本
                 迭代法   BIM (basic iterative method) [14] 将  FGSM  扩展为多步小步长更新; 动量迭代法  MIM (momentum iterative
                 method)  [15] 引入动量项以加速收敛并规避局部最优; Madry       等人  [6] 提出的投影梯度下降法      PGD (projected gradient
                 descent) 进一步结合随机初始化和迭代投影机制, 在对抗训练中被广泛用作强基准攻击. 此类方法依赖一阶梯度信
                 息, 计算效率高且在白盒设定下表现优异.
                    2) 基于函数优化的攻击. 此类方法将对抗样本生成问题建模为带约束的最优化问题, 通过数值优化算法求解
                 最优扰动. 典型代表是       Carlini 等人  [16] 提出的  C&W  攻击, 通过设计替代损失函数    (如  DLR  损失) 并采用  Adam  等

                 优化器, 在  L 2  范数约束下最小化扰动幅度的同时确保模型对扰动样本分类错误. C&W                     攻击能够生成视觉不可察
                                                                         L 0 、   L ∞  等多种范数约束, 但因需要
                 觉的对抗样本, 且对部分防御策略具有强穿透性. 其优化目标可灵活适配                          L 2  和
                 多次前向传播和梯度计算, 时间成本较高.
                    3) 自适应集成攻击. 为全面评估模型鲁棒性, 集成多种攻击策略的自适应方法逐渐成为主流. Croce 等人                           [17] 提
                 出的自动攻击     AA (autoattack) 是此类方法的典范, 整合了     3  种白盒攻击技术与      1  种黑盒攻击技术. 其中, APGD-
                 CE  和  APGD-DLR  分别基于交叉熵损失和      DLR  损失实现自适应步长调整的白盒          PGD  攻击; 快速适应性边界 (fast
                 adaptive boundary, FAB) 攻击  [18] 通过逼近决策边界生成跨范数约束的对抗样本; square attack   [19] 则以黑盒方式利用
                 随机局部搜索探索模型脆弱区域. AA           攻击通过自动调度不同攻击策略, 有效规避单一攻击的盲区, 成为当前鲁棒
                 性评估的标准工具集.
                    对抗攻击方法从初期的单步梯度优化发展到多策略协同优化, 逐步形成了层次化的技术体系. 基于梯度的方
                 法聚焦效率与白盒场景的强攻击性, 基于优化的方法追求扰动最小化与防御穿透性, 而自适应集成攻击则通过策
                 略融合实现全面的鲁棒性评估.
                  1.2   对抗防御
                    主流的对抗防御方法主要分为           4  类: 对抗训练、输入预处理、模型结构优化和对抗样本检测. 其中, 对抗训练
                 通过将对抗样本注入训练过程, 迫使模型在扰动下保持正确预测, 被广泛证明是提升模型鲁棒性最有效的方法, 其
                 核心在于通过极小极大优化实现风险上界的最小化. 相比之下, 输入预处理                       (如去噪、随机化) 易被自适应攻击绕
                 过, 模型结构优化     (如防御层、梯度掩码) 存在泛化局限, 而对抗样本检测则面临误判率和攻击演进的挑战. 本文
   29   30   31   32   33   34   35   36   37   38   39