Page 32 - 《软件学报》2026年第4期
P. 32

翟浩杰 等: 基于自适应策略优化的鲁棒泛化权衡学习                                                       1473


                 patterns  to  generate  adversarial  examples  (AEs),  leading  to  insufficient  sample  diversity,  limited  generalization  capabilities,  and  difficulties
                 in  achieving  an  effective  balance  between  robustness  and  clean  accuracy.  More  crucially,  existing  adversarial  training  frameworks  lack
                 adaptive  control  over  the  training  process,  resulting  in  the  robust  overfitting  phenomenon.  To  address  these  challenges,  an  evolutionary
                 optimization-based  adaptive  adversarial  training  framework  is  proposed,  named  trade-off  robustness  and  generalization  via  adaptive  strategy
                 optimization  (TRG-ASO).  It  innovatively  integrates  a  genetic  algorithm  into  adversarial  training  and  achieves  progressive  complexity
                 escalation  in  AE  generation  through  dynamic  adjustment  of  attack  strategies  across  different  training  phases.  This  mechanism  not  only
                 enhances  sample  diversity  but  also  effectively  suppresses  overfitting  risks  through  early  stopping  enabled  by  strategy  optimization  records.
                 Experiments  on  CIFAR  series  datasets  demonstrate  that,  compared  with  traditional  adversarial  training  methods,  the  proposed  TRG-ASO
                 framework  maintains  baseline  classification  performance  while  improving  robustness  against  multiple  attack  paradigms  and  accelerating
                 training  convergence.  This  study  provides  new  insights  into  the  robustness-generalization  trade-off  in  adversarial  training,  offering
                 significant practical value for building trustworthy deep learning systems.
                 Key words:  robustness; adaptive strategy optimization; trade-off learning; adversarial training; evolutionary optimization
                    近年来, 深度学习技术在计算机视觉            [1] 、自然语言处理   [2,3] 、生成式人工智能   [4] 等领域取得了突破性进展, 并
                 在众多任务中展现出远超人类水平的性能. 然而, 深度学习的实际部署面临一个根本性挑战: 模型面对对抗攻击的
                 脆弱性.
                    研究表明    [5] , 在输入空间对样本添加人类视觉系统难以察觉的细微扰动, 会使深度神经网络以高置信度产生
                 误分类, 这种扰动后的样本被称为对抗样本, 不仅阻碍了深度学习的实际部署与规模化应用, 更对系统可信性构成
                 了严峻挑战. 在安全关键型应用场景中, 此类漏洞可能引发严重后果. 例如, 在人脸识别系统中, 攻击者可通过生成
                 视觉不可区分的对抗样本冒充授权用户以非法获取敏感信息或实施财产欺诈; 在自动驾驶场景中, 针对车载感知
                 模块的对抗攻击可能引发交通标志误识别或障碍物漏检, 进而造成严重交通事故. 因此, 提升深度模型的对抗鲁棒
                 性具有重要意义, 已成为可信人工智能领域的核心研究课题之一. 其目标在于实现双重优化: 一方面维持模型在原
                 始数据分布上的泛化性能, 即对干净样本保持高分类准确率; 另一方面增强模型对对抗扰动的免疫能力, 即在对抗
                 攻击下仍能保持稳定决策.
                    对抗训练    [6−8] 是提升深度模型对抗鲁棒性最行之有效的方式, 其核心思想是利用各种对抗攻击产生对抗样本,
                 将对抗样本添加到原始数据集中, 一起或者单独使用进行模型训练. Madry                     等人  [6] 将对抗训练形式化地表述为一
                 个双层优化问题, 准确描述为以下极小极大化公式:

                                                 minE (x,y)∼D [maxL( f(x+δ,w),y)]                     (1)
                                                  w       δ∈Ω
                 其中,  L 是损失函数,   δ 是添加在样本     x 上的扰动,   是样本   x 的真实标记,    Ω 是扰动范围,   w 是神经网络的参数. 数
                                                       y
                                     δ 的鞍点问题, 并且    Madry  等人  [6] 证明了可通过内外层问题的交替优化寻找到鞍点. 然
                 学上, 这是一个关于      w 和
                 而, 实际应用表明, 对抗训练在提升模型鲁棒性的同时会显著降低其在干净样本上的泛化性能, 当模型训练到一定
                 程度时, 鲁棒性与干净准确率似乎会出现不可避免的冲突, 此问题称为                      robustness-generalization dilemma. 为缓解
                 此问题, 对抗训练涌现出多种改进策略以平衡模型在干净样本和对抗样本上的性能, 这些研究主要围绕自适应扰
                 动调整和训练效率优化展开. 关于自适应扰动调整, Wu                等人  [9] 提出了一种无需搜索的自适应扰动半径框架, 通过
                 理论分析证明了其对自然泛化性能和鲁棒性的双重提升; 类似地, Yang                    等人  [10] 引入数据自适应扰动大小      (DAAT),
                 利用校准网络动态调整扰动范围, 减少对干净准确率的负面影响. 在训练效率与过拟合控制方面, Yu                              等人  [11] 提出
                 了基于损失平稳条件        (LSC) 的权重扰动策略, 避免对抗训练中的鲁棒过拟合; Wang              等人  [12] 进一步提出可持续自
                 进化对抗训练     (SSEAT), 通过对抗数据回放和一致性正则化缓解持续学习中的灾难性遗忘等.
                    尽管上述方法在特定任务中表现优异, 但仍存在明显的局限性. 例如, 自适应扰动策略的计算开销较高, 且部
                 分方法需要设计额外的群组划分规则, 增加了实现复杂度; 相应的优化策略是针对特定数据集而制定的, 泛化能力
                 存疑等. 与此同时, 多数方法在应对鲁棒过拟合问题上效果仍旧不理想, 即: 在对抗训练中后期, 模型在干净样本上
                 的准确率继续提升或保持稳定, 但在对抗样本上的准确率却开始下降. 此外, 对抗样本的生成质量严重依赖攻击策
                 略的选择, 然而, 现有对抗训练方法大多采用固定的攻击策略, 限制了训练的灵活性和自适应调节能力. 图                               1(a) 和
                 图  1(b) 揭示了传统对抗训练采用固定攻击策略在训练初期和后期所面临的局限性. 具体而言, 在训练初期, 由于
   27   28   29   30   31   32   33   34   35   36   37