Page 138 - 《软件学报》2026年第4期
P. 138

陇盛 等: 基于动量加速和任务均衡的目标检测对抗训练方法                                                    1579


                 人  [28] 提出了基于对抗感知卷积的      RobustDet 模型, 利用对抗图像鉴别器      (adversarial image discriminator, AID) 为干
                 净样本和对抗样本生成不同的权重, 从而引导对抗感知卷积核自适应地学习鲁棒特征. RobustDet 还利用一致性特
                 征重建   (consistent features with reconstruction, CFR) 将对抗图像重建为干净样本, 以进一步增强鲁棒性. RobustDet
                 使用免费对抗训练模式, 在训练速度、干净样本准确性和对抗样本鲁棒性几项指标上, 已经成为目前最先进的基
                 于对抗训练的鲁棒目标检测器.
                  2   动量加速和任务均衡的目标检测对抗训练方法

                  2.1   基于  NAG  动量的对抗训练速度提升
                    受到快速对抗训练方法在图像分类任务上加速效果显著的启发, 本文通过节省鲁棒优化问题中内层最大化过
                 程的开销, 以提升目标检测模型对抗训练速度, 同时为了避免                   FGSM  算法容易导致的灾难性过拟合问题, 我们不
                 是极端地选择单步对抗样本生成方式, 而是探索能以更少的迭代次数实现与                         PGD-K  相同或更高鲁棒精度的算法.
                 因此, 我们聚焦于收敛速率具有数量级提升的              NAG [29,39] , 其关键迭代步骤如下:

                                                          ( )
                                                          ′
                                                 θ k = ϑ k −η k F ϑ k
                                                
                                                
                                                
                                                      (   √     )
                                                
                                                     1
                                                             2
                                                a k+1 =  1+  4a +1                                   (6)
                                                             k
                                                     2
                                                
                                                
                                                
                                                
                                                
                                                 ϑ k+1 = θ k +(a k −1)(θ k −θ k−1 )/a k+1
                                  ,
                 其中,  k ∈ [0,K] a 0 = 1 θ −1 = ϑ 0 ϑ 0  为模型初始权重,  F (θ) = L( f θ (x,y)) F (θ) = ∇ θ L( f θ (x,y)) η k = 2 η k−1 i ,   是使
                                         ,
                             ,
                                                                                         ,
                                                                        ,
                                                                                               −i
                                                                           ′

                  ( )   (          ( ))       
  ( ) 
 
 2                                  
  ( )
                             −i
                                                                                ,
                                                ′
                                                                                              ′
                                  ′
                                                                                                    ′
                 F ϑ k − F ϑ k −2 η k−1 F ϑ k ⩾ 2 −i−1 η k−1 
F ϑ k 
  成立的最小正整数, 且对任意  z , ϑ 0 η −1 = ∥ϑ 0 −z∥/
F ϑ 0 − F (z)
.
                                                                2
                 NAG  在光滑凸情形下能达到一阶算法的最优收敛速度                O(1/K ), 如引理  1  所示.
                    假设  1.                  ∃L F > 0, 使得:
                          F  是光滑目标函数, 即
                                             ∥F (a)− F (b)∥ ⩽ L F ∥a− b∥,  ∀a, b ∈ R .
                                                                           d
                                               ′
                                                     ′
                    引理  1 [29] . 令假设  1  成立,   K   由公式  (6) 产生,   ∗
                                        {θ k } k=0        θ  为   F (θ) 最优解. 若  F  为凸函数, 那么下式成立:
                                                                     ∗ 2
                                                              4L F ∥ϑ 0 −θ ∥
                                                 F (θ K )− F (θ ) ⩽                                   (7)
                                                          ∗
                                                                (K +2) 2
                    在  NAG  基础上, 本文初始化干净样本        x 作为优化对象, 提出了      NAG  在对抗训练中生成对抗样本         x k  的变体算
                 法     NAG adv .
                                                   {                           }
                                         
                                                                      1      2
                                                            ′
                                          x k = argmin F (x k )+⟨F (x k ),z− x k ⟩+  ∥z− x k ∥
                                         
                                         
                                         
                                                                     2η k
                                              z∈S x
                                         
                                         
                                              1  (  √    )                                           (8)
                                         
                                                       2
                                          a k+1 =  1+  4a +1
                                         
                                                      k
                                         
                                              2
                                         
                                         
                                                      (      )
                                         
                                          x k+1 = x k +(a k −1) x k − x k−1 /a k+1
                                    ,
                          ,
                                                       ,
                                                          ′
                 其中,  ∀k ⩾ 0 x −1 = x 0 = x F (x) = −L( f θ (x,{b i , c i })) F (x) = −∇ x L( f θ (x,{b i , c i })).
                                                             2
                    根据引理    1, 不难发现公式    (8) 中  NAG ad 能以  O(1/K ) 的速率在光滑凸环境中收敛到公式         (4) 最大化问题的
                                                   v
                 最优点, 相比之下     PGD  较慢, 只能达到    O(1/K). 为进一步分析非凸环境收敛性以及便于算法实现, 我们给出了
                 NAG ad 的两种等价形式, 如定理      1  和定理  2  所示.
                      v
                                                         )
                    定理      σ k+1 ≡ 1/a k+1 z k ≡ σ −1  ( x k − x k−1 (1−σ k ) S x = R , NAG ad 可等价转换为公式  (9):
                                                                d
                                                                       v
                                      ,
                                                          ,
                        1. 令               k
                                                   
                                                    x k = (1−σ k ) x k−1 +σ k z k−1
                                                   
                                                   
                                                   
                                                            −1  ′
                                                    z k = z k−1 −σ η k F (x k )                      (9)
                                                            k
                                                   
                                                   
                                                   
                                                    x k = (1−σ k ) x k−1 +σ k z k
                 其中,  ∀k ⩾ 1. 定理  1  的详细证明见附录  A.
                    由于公式    (9) 与文献  [40] 中算法  1  等价, 我们介绍如下引理进一步证明收敛性.
                                                                                                       ]
                    引理  2 . 令假设   1 成立,   x  为   F (x) 最优解. 设   α k = 2/k +1 β k ≡ 1/2L F , 若对  ∀k ⩾ 1 满足  λ k ∈ β k ,(1+(α k /4))β k ,
                         [40]
                                                                                          [
                                        ∗
                                                                 ,
   133   134   135   136   137   138   139   140   141   142   143