Page 305 - 《软件学报》2026年第7期
P. 305

2990                                                       软件学报  2026  年第  37  卷第  7  期


                 dataset for object detection tasks. The experimental results demonstrate that PBAT outperforms four representative methods.
                 Key words:  deep learning model; model reinforcement; model defense; adversarial network
                                                           [1]
                    近年来, 深度神经网络       (deep neural network, DNN) 在各种机器学习任务中表现出了显著的性能, 通过在例如
                 图像分类   [2] 、人脸识别  [3] 、目标识别  [4] 和自然语言处理   [4] 等应用领域使用深度学习模型, 获得了接近甚至超过人
                 类的表现, 在一定程度上改变了人们的日常生活.
                    然而, 深度学习模型存在安全隐患. 与之关联的应用一旦发生安全事故, 可能造成重大经济损失. 例如: 自动无
                 人驾驶汽车    [5] 、恶意软件检测   [6] 、医疗健康  [7] 等领域, 恶意设计的噪声可能避开人眼察觉, 却严重影响深度学习模
                 型性能. 如  Szegedy  等人  [8] 在图像分类领域发现, 在原始样本上添加轻微扰动, 就能使基于深度学习模型的图像分
                 类系统输出错误结果. 这种微小扰动还可能被不法分子利用, 带来严重安全后果                        [9,10] .
                    针对对抗性噪声提升深度学习模型鲁棒性的方法中, 对抗训练表现较好且备受关注. 对抗训练通过在模型训
                 练过程中添加对抗样本, 使模型学习对抗样本所在分布, 增强对输入数据变化的抵抗能力. 图                           1(a) 用平面样例直观
                 地展示了标准训练下非鲁棒模型的分类边界                (实线) 和对抗训练后鲁棒模型的分类边界             (虚线) 的表现差异. 其中
                 五角星和圆形表示待区分的两类样本, 红色样本点为对抗样本. 可以发现, 非鲁棒决策边界下的模型错误地分类了
                 对抗样本, 而对抗训练后, 获得了鲁棒决策边界              (虚线) 的模型虽然能正确分类对抗样本, 但在对抗样本方向上产
                 生的对原始决策边界较大程度的推动, 也影响了模型原先学习到的数据中的重要判别性特征.








                                             (a) 标准对抗训练            (b) PBAT
                                             图 1 标准训练和对抗训练结果对比示例

                    在此基础上, 衍生出许多基于对抗训练             [11–13] 的防御方法. 但对抗训练也存在问题, 例如, 导致模型在标准训练
                 模型输入空间的对抗性方向决策边际过度增加                [14] , 许多研究已经证明, 原始样本所在分布和对应的对抗样本所在
                 分布截然不同     [15–17] , 最终加固后的模型会在原始数据集上的精度下降, 损失大量原始泛化性能. 研究进一步关注到
                 模型鲁棒性和精度的权衡. 随着生成模型的发展, 一些研究选择尝试利用生成对抗网络                             (generative adversarial
                 network, GAN) 或扩散模型直接消除对抗性噪声, 达到不损害鲁棒模型的原始精度的目的                     [18–21] . 但净化模型的训练
                 过程往往容易出现模式崩溃, 可能无法有效去除对抗性噪声, 甚至引入新噪声, 模型最终的鲁棒性表现通常落后于
                 对抗训练方法     [22] . 研究中使用的对比方法    ATLD (adversarial training with latent distribution) [23] 从原始样本中诱发出
                 潜在表示, 利用流形信息产生对抗性扰动进行训练, 并借助具有流形变换的推理方法                        (IMT) 增强泛化性. CCAT (confi-
                 dence-calibrated adversarial training) 方法  [24] 通过初始扰动和多次迭代的  PGD  攻击进行训练, 侧重于推测拒绝对抗
                 样本的行为. TRADES (trade-off between robustness and accuracy) 方法  [12] 则聚焦于调节精度和鲁棒性之间的平衡,
                 通过调整优化目标来训练鲁棒模型. 这些方法虽然在一定程度上增强了鲁棒性和泛化能力, 但没能从样本多样性
                 角度重复利用对抗样本, 在实际应用场景仍然有改进空间.
                    本文利用对抗训练提高模型对抗鲁棒性方面的优势, 借助概率生成模型分析对抗样本与原始样本之间的分布
                 差异, 从而生成多样性对抗训练数据, 改善模型的鲁棒性. 为了说明这一新方法对模型决策边界产生的变化, 图                               1(b)
                 展示了这种训练后模型更理想的决策边界               (渐变色曲线). 这条新的决策边界避免了先前在对抗样本方向上边界过
                 度敏感的变化, 同时保留了模型的鲁棒性. 实现从图               1(a) 到图  1(b) 的调整效果, 关键是通过引入新数据         (粉色), 来
                 帮助原始样本和对抗样本分布之间完成差异过渡. 考虑到概率生成模型在机器学习和人工智能领域的关键作用,
                 本文聚焦于利用其学习样本分布规律的能力, 构建一种基于样本分布规律的多样性数据构造方法, 以服务于模型
                 的鲁棒训练.
   300   301   302   303   304   305   306   307   308   309   310