Page 308 - 《软件学报》2026年第7期
P. 308
杨波 等: PBAT: 基于代理分布的深度学习模型防御加固方法 2993
鉴别器的对抗训练学习数据分布, 在防御加固中, GAN 可学习对抗样本和原始样本分布规律, 生成多样性数据, 辅
助对抗训练优化模型性能, 减少模型对对抗样本的敏感性, 提升鲁棒性.
1.3 智能模型的鲁棒性
现实世界中攻击的普遍存在以及其对模型性能的损害要求我们训练出更牢固、高鲁棒性的智能模型以改善
智能模型的脆弱性. 输入中的扰动噪声不会使本能做出正确决策的模型因为这类微小的扰动而决策错误. 即使模
型判断错误, 也希望是在可接受范围内的. 以分类模型为例, 鲁棒模型应该满足公式 (4): 对于所有 ||δ|| p ⩽ R, 模型 f
L p 范数对
均能将样本 x 判断为其所在正确类别, 其中 R 是对扰动的限制范围, 扰动将噪声添加到样本 x, 通常利用
其大小进行约束; c A 是样本所属类别.
(4)
f(x+δ) = c A
(1) 基于对抗训练的防御
针对对抗攻击这类特殊的扰动, 已经得到广泛证明效果最好的防御方法是利用攻击样本的对抗训练 (adver-
sarial training), 这类方法是通过优化一个训练用的最小最大化公式 (见公式 (5)), 重新训练模型参数, 实现针对模
型的加固, 提高模型抵御攻击的能力. 公式 (5) 中 x 表示从数据集 D 中采样得到的原始样本, ε 表示在扰动空间 Ω
θ
n
.
,
上的扰动强度, 一般取很小的值. y 表示样本标签类且 x ∈ R y ∈ R L(·) 表示训练模型参数 是所使用的损失函数
θ ∈ R . 该公式的内部最大化部分产生用于加固的对抗样本, 而外部的最小化部分是用来训练模型最小化和对抗样
m
本之间的损失, 拟合出鲁棒决策边界.
minE (x,y)∼D [maxL(x+ε,y;θ)] (5)
θ ε∈Ω
许多研究都在优化对抗训练上展开, Xie 等人 [39] 认为训练使用的 ReLU 激活函数由于其非平滑的性质, 显著
削弱了对抗性训练的效果. 从而提出了平滑对抗训练 SAT 方法, 即用平滑近似函数来代替 ReLU 函数来加强对抗
训练. Maini 等人 [40] 使用最陡梯度下降的对抗性训练方法, 将不同的扰动模型合并到一个统一的模型中, 用来解决
寻找内部优化问题. 通过在每个预测的最陡梯度下降中最大化所有扰动模型的最坏损失来创建一个单一的对抗扰
动, 以更好地实现鲁棒优化目标. Chen 等人 [41] 利用预训练扩散模型构建生成式分类器, 它净化对抗噪声的方式是
将扩散模型直接转化为生成式分类器进行分类决策, 最大的特点是无需针对特定对抗攻击开展训练. 侧重于构建
生成式分类器实现通用的对抗防御. 而 Sui 等人 [42] 则是通过生成对抗图像和对抗语义来增加对抗样本的多样性,
其侧重点在于挖掘图像语义层面的信息. 本文未将这两种方法纳入对比, 首先, 从研究重点来看, PBAT 专注于利
用样本分布差异生成多样性样本改进对抗训练, 平滑决策边界. 研究重点的差异使得在相同实验条件下对比时, 难
以精准突出 PBAT 在其核心改进方向上的优势. 结果难以直接反映 PBAT 在传统对抗训练框架下对样本利用和决
策边界优化的独特价值. 此外, 将这两种方法纳入对比, 需要对现有实验流程, 计算资源和数据处理方式进行大幅
调整, 会极大增加实验的复杂性和不确定性. 相比之下, 本研究中已选取的对比方法, 在技术复杂度以及实验环境
适配性上与 PBAT 更具可比性. 最后, 考虑对比结果的可解释性, 在得出明确且有价值的研究结论的基础上选择了
对比方法.
(2) 基于去噪的防御
一些方法使用去噪技术来消除或减少输入数据中的对抗噪声, 从而提高模型的鲁棒性和安全性. Jin 等人 [43] 提
出使用 GAN 作为纯化模型提出了 APE-GAN 方法. 该方法在一个对抗性的环境下进行训练, 设计融合损失函数使
对抗样本与原始样本流形保持高度一致. Zhou 等人 [19] 提出了一种自监督的对抗性训练机制来消除类激活特征空
间中的对抗性噪声——CAFD 去噪器, 该去噪器以 RaGAN [44] 为原型, 利用一个类激活特征损失和一个对抗性损失
组成的混合损失函数, 再进行训练而得到. 然后, 通过最小化类激活特征空间中对抗性样本和原始样本之间的距
离, 来实现消除对抗性噪声的效果. 最近, Ho 等人 [20] 提出了一种通过局部流形投影消除对抗性扰动的具有局部隐
式函数的方法 DISCO. 该方法通过编码器和局部隐式函数实现对查询位置的原始图像 RGB 值的预测. 训练好的
模型以局部的像素信息作为输入实现对抗性去除. 利用概率生成模型作为净化模型往往难以完全去除对抗噪声,

