Page 35 - 《软件学报》2026年第4期
P. 35
1476 软件学报 2026 年第 37 卷第 4 期
重点探讨对抗训练的理论机制与优化策略, 分析其在不同攻击场景下的有效性边界.
1.2.1 对抗训练
对抗训练作为提升深度模型鲁棒性的关键性防御手段, 其核心机理在于通过构造对抗样本并将其纳入训练过
程, 使模型在面对分布偏移扰动或恶意攻击时保持稳定. 该方法的理论框架可追溯至 Goodfellow 等人 [13] 提出的
FGSM 对抗样本生成策略, 通过将对抗样本引入训练集, 首次验证了该策略对模型鲁棒性的提升效果. Madry 等人 [6]
进一步建立了标准对抗训练 PGD-AT 的理论体系, 提出将 PGD 攻击作为对抗样本生成基准, 并形式化定义了公
式 (1) 中的双层优化问题. 该鞍点问题的求解范式成为后续对抗训练研究的理论基础, 特别是面对基于一阶梯度
信息的攻击方法具有普适性防御效果.
通过对损失函数进行改进, 标准对抗训练进一步衍生出若干更有效的对抗训练方法. 例如, Zhang 等人 [7] 通过
推导对抗样本预测误差上界, 提出 TRADES (tradeoff-inspired adversarial defense via surrogate-loss minimization) 方
法. 该方法引入 KL 散度作为损失函数正则项, 建立如下优化问题:
minE (x,y)∼D [L CE ( f(x,w),y)+β· KL(p(x,w) ∥ p(x adv ,w))] (4)
w
其中, L CE 表示交叉熵损失, p(x,w) 和 p(x adv ,w) 分别表示干净样本 x 和对抗样本 x adv 在网络 f (·,w) 中的输出概率
分布, β 为平衡系数. 该框架在保持干净样本准确率的同时, 显式约束对抗样本与原始样本输出分布的差异, 实现
鲁棒性与准确性的平衡优化. Wang 等人 [8] 提出的 MART (misclassification aware adversarial training) 方法在
TRADES 基础上引入误分类感知机制, 通过动态调整正则项权重, 重点增强模型对困难样本 (即原本分类错误的
样本) 的防御能力. 其优化问题建立为:
minE (x,y)∼D [L BCE ( f(x adv ,w),y)+λ· KL(p(x,w) ∥ p(x adv ,w))·(1− p y (x))] (5)
w
y
其中, L BCE 表示二元交叉熵损失, λ 为调节因子, p y (x) 表示样本 x 在类别 上的预测概率. 该方法通过 (1− p y (x)) 项
实现样本的自适应加权, 强化对容易误分类样本的鲁棒性约束.
此外, Wu 等人 [20] 通过对神经网络的权重进行扰动, 提出了一种通用的对抗训练增强方法 AWP.
1.2.2 自适应对抗训练
传统对抗训练通过固定扰动预算提升模型鲁棒性, 但难以平衡干净准确率与抗攻击能力. 近年来, 许多研究探
索了自适应对抗训练 AAT (adaptive adversarial training) 方法, 通过灵活调整对抗扰动进一步提高模型的鲁棒性和
泛化能力. 核心创新主要从以下几个方面展开.
1) 扰动半径动态调整. 针对固定扰动预算导致的过拟合或欠拟合问题, 学者们提出了数据驱动的动态调整策
略. Qian 等人 [21] 提出分组自适应对抗训练 (GAAT), 根据样本 logit 最大值划分数据组, 通过二分搜索为每组分配
最优扰动半径, 实现了细粒度鲁棒性和准确率的权衡. Wang 等人 [22] 提出特征敏感调整 (WAPAT), 引入特征变化
权重动态调节扰动步长, 缩短对抗样本与分类边界的距离. Yu 等人 [23] 提出强度渐进策略 (SAAT), 设计对抗损失
约束机制, 使扰动预算随训练进程动态增长, 逐步提升模型鲁棒性. Yang 等人 [10] 研究了数据自适应对抗训练
(DAAT), 通过校准网络动态调整每个样本的扰动大小, 以降低对抗训练对干净准确率的影响.
2) 多扰动鲁棒性增强. 为应对多样化攻击类型 (如 L 0 、L 2 、L ∞ ), Xiao 等人 [24] 提出平滑加权方法 (ASW-AT),
通过稳定性分析优化风险边界, 在多种范数约束下平衡扰动效果. Wang 等人 [25] 提出鲁棒模式连接 (RMC), 通过构
建多扰动联合优化框架, 结合自免疫机制 (SRMC) 降低计算复杂度, 显著提升了模型面对跨范数攻击的防御能力.
3) 训练效率优化. 针对对抗训练的高计算成本, Huang 等人 [26] 提出自适应步长 (ATAS), 通过实例级步长调整
加速单步对抗训练, 有效缓解灾难性过拟合. Ma 等人 [27] 提出参数自由的自适应边界防御 (SMD), 通过梯度感知的
边界扩展策略, 无需超参数调优即可实现高效鲁棒训练.
4) 特定领域的权衡方案. Guo 等人 [28] 结合历史梯度攻击 (HGAA) 与域适应训练 (DAAT), 在工业软传感器场
景中针对鲁棒准确率与干净准确率实现协调. 此外, Hardy 等人 [29] 通过理论分析证明了自适应训练不会显著增加
系统补救成本, 为其在关键领域的部署提供了依据.
然而, 值得注意的是, 上述方法无法解决鲁棒性与干净准确率的权衡困境, 其核心难点在于, 当模型训练到一

