Page 35 - 《软件学报》2026年第4期
P. 35

1476                                                       软件学报  2026  年第  37  卷第  4  期


                 重点探讨对抗训练的理论机制与优化策略, 分析其在不同攻击场景下的有效性边界.
                  1.2.1    对抗训练
                    对抗训练作为提升深度模型鲁棒性的关键性防御手段, 其核心机理在于通过构造对抗样本并将其纳入训练过
                 程, 使模型在面对分布偏移扰动或恶意攻击时保持稳定. 该方法的理论框架可追溯至                           Goodfellow  等人  [13] 提出的
                 FGSM  对抗样本生成策略, 通过将对抗样本引入训练集, 首次验证了该策略对模型鲁棒性的提升效果. Madry 等人                           [6]
                 进一步建立了标准对抗训练          PGD-AT  的理论体系, 提出将      PGD  攻击作为对抗样本生成基准, 并形式化定义了公
                 式  (1) 中的双层优化问题. 该鞍点问题的求解范式成为后续对抗训练研究的理论基础, 特别是面对基于一阶梯度
                 信息的攻击方法具有普适性防御效果.
                    通过对损失函数进行改进, 标准对抗训练进一步衍生出若干更有效的对抗训练方法. 例如, Zhang                           等人  [7] 通过
                 推导对抗样本预测误差上界, 提出          TRADES (tradeoff-inspired adversarial defense via surrogate-loss minimization) 方
                 法. 该方法引入    KL  散度作为损失函数正则项, 建立如下优化问题:

                                         minE (x,y)∼D [L CE ( f(x,w),y)+β· KL(p(x,w) ∥ p(x adv ,w))]  (4)
                                          w
                 其中,  L CE  表示交叉熵损失,   p(x,w) 和   p(x adv ,w) 分别表示干净样本  x 和对抗样本  x adv  在网络   f (·,w) 中的输出概率
                 分布,  β 为平衡系数. 该框架在保持干净样本准确率的同时, 显式约束对抗样本与原始样本输出分布的差异, 实现
                 鲁棒性与准确性的平衡优化. Wang          等人  [8] 提出的  MART (misclassification aware adversarial training) 方法在
                 TRADES  基础上引入误分类感知机制, 通过动态调整正则项权重, 重点增强模型对困难样本                          (即原本分类错误的
                 样本) 的防御能力. 其优化问题建立为:

                                   minE (x,y)∼D [L BCE ( f(x adv ,w),y)+λ· KL(p(x,w) ∥ p(x adv ,w))·(1− p y (x))]  (5)
                                    w
                                                                        y
                 其中,  L BCE  表示二元交叉熵损失,   λ 为调节因子,    p y (x) 表示样本  x 在类别   上的预测概率. 该方法通过      (1− p y (x)) 项
                 实现样本的自适应加权, 强化对容易误分类样本的鲁棒性约束.
                    此外, Wu  等人  [20] 通过对神经网络的权重进行扰动, 提出了一种通用的对抗训练增强方法                    AWP.
                  1.2.2    自适应对抗训练
                    传统对抗训练通过固定扰动预算提升模型鲁棒性, 但难以平衡干净准确率与抗攻击能力. 近年来, 许多研究探
                 索了自适应对抗训练       AAT (adaptive adversarial training) 方法, 通过灵活调整对抗扰动进一步提高模型的鲁棒性和
                 泛化能力. 核心创新主要从以下几个方面展开.
                    1) 扰动半径动态调整. 针对固定扰动预算导致的过拟合或欠拟合问题, 学者们提出了数据驱动的动态调整策
                 略. Qian  等人  [21] 提出分组自适应对抗训练    (GAAT), 根据样本   logit 最大值划分数据组, 通过二分搜索为每组分配
                 最优扰动半径, 实现了细粒度鲁棒性和准确率的权衡. Wang                 等人  [22] 提出特征敏感调整    (WAPAT), 引入特征变化
                 权重动态调节扰动步长, 缩短对抗样本与分类边界的距离. Yu                  等人  [23] 提出强度渐进策略    (SAAT), 设计对抗损失
                 约束机制, 使扰动预算随训练进程动态增长, 逐步提升模型鲁棒性. Yang 等人                       [10] 研究了数据自适应对抗训练
                 (DAAT), 通过校准网络动态调整每个样本的扰动大小, 以降低对抗训练对干净准确率的影响.
                    2) 多扰动鲁棒性增强. 为应对多样化攻击类型              (如  L 0 、L 2 、L ∞ ), Xiao  等人  [24] 提出平滑加权方法  (ASW-AT),
                 通过稳定性分析优化风险边界, 在多种范数约束下平衡扰动效果. Wang                    等人  [25] 提出鲁棒模式连接    (RMC), 通过构
                 建多扰动联合优化框架, 结合自免疫机制             (SRMC) 降低计算复杂度, 显著提升了模型面对跨范数攻击的防御能力.
                    3) 训练效率优化. 针对对抗训练的高计算成本, Huang            等人  [26] 提出自适应步长   (ATAS), 通过实例级步长调整
                 加速单步对抗训练, 有效缓解灾难性过拟合. Ma 等人              [27] 提出参数自由的自适应边界防御         (SMD), 通过梯度感知的
                 边界扩展策略, 无需超参数调优即可实现高效鲁棒训练.
                    4) 特定领域的权衡方案. Guo      等人  [28] 结合历史梯度攻击    (HGAA) 与域适应训练     (DAAT), 在工业软传感器场
                 景中针对鲁棒准确率与干净准确率实现协调. 此外, Hardy               等人  [29] 通过理论分析证明了自适应训练不会显著增加
                 系统补救成本, 为其在关键领域的部署提供了依据.
                    然而, 值得注意的是, 上述方法无法解决鲁棒性与干净准确率的权衡困境, 其核心难点在于, 当模型训练到一
   30   31   32   33   34   35   36   37   38   39   40