Page 40 - 《软件学报》2026年第4期
P. 40

翟浩杰 等: 基于自适应策略优化的鲁棒泛化权衡学习                                                       1481



                              ∑
                                        a +
                 12.       F 1 (a) = −  L( f(x ,w ),y)/|D |;
                                           ′
                                                 ′
                                 x∈D ′  adv
                              ∑
                 13.        F 2 (a) = −  L( f(x,w ),y)/|D |;
                                          ′
                                               ′
                                 x∈D ′
                 14.       F(a) = αF 1 (a)+βF 2 (a);
                 15.  End For
                 16.    P ← 根据适应度  F(a) 大小排序选出前     M  个策略, 并通过锦标赛选择补全种群规模            n;
                       ′
                 17.    P ← 采用交叉和变异算子生成新的策略并添加到              P , 扩大种群规模为    2n;
                       ′′
                                                              ′
                                ′′
                 18.  For each  a ∈ P  do
                 19.    F(a) ← 依据步骤  6–14  计算适应度;
                 20.  End For
                 21.   t = t +1;
                 22.    P t ← 根据适应度  F(a) 大小排序选出  P  ′′   中前  n 个策略;
                 23. End While
                 24.  a = argmaxF(a).
                    ∗
                        a∈P t
                  3.3   TRG-ASO  算法描述
                  3.3.1    训练框架
                    我们沿用标准对抗训练范式, 采用内外层交替优化来设计                    TRG-ASO  算法, 创新点在于对内层优化问题的阶
                                        K  个训练周期利用算法      2                            a , 使得现阶段的神经
                                                                                        ∗
                 段性自适应策略搜索, 即每隔                             寻找适合于现阶段的最优攻击策略
                     f(·,w) 根据干净样本生成的对抗样本, 对于其鲁棒性和干净准确率的进一步提升仍具有效性. 本质上, 将公式                          (1)
                 网络
                 的损失函数替换为代理损失, 优化问题表示为:

                                                      1  N ∑
                                                  min     L CE ( f(x a ∗  ,w),y i )                  (11)
                                                   w N          i,adv
                                                        i=1
                 其中,  x a ∗  = x i +δ(x i ,a ) 表示利用攻击策略   a  攻击样本  x i  产生的对抗样本,  δ(·) 表示一个产生扰动的操作. TRG-ASO
                                 ∗
                                                  ∗
                      i,adv
                 的伪代码如算法      3.
                 算法  3. 基于自适应策略优化的鲁棒泛化权衡学习 (TRG-ASO).
                                      N                                                        n, 攻击策略
                                                                                     T
                                                          E
                 输入: 训练数据    D = {(x i ,y i )} , 损失函数  L, 训练周期  , 学习率  η, 批次大小   B, 进化代数  , 种群大小
                                      i=1
                                                                   K
                                          F
                 空间  A = S ε ×S α ×S I , 适应度函数  , 精英保留数   M, 交替优化频次  , 平衡系数  α 和   β, 适应度阈值  l;
                 输出: 神经网络    f(·,w).
                 1. 随机初始化神经网络      f(·,w);
                                                              ′
                 2. 从训练数据   D = {(x i ,y i )} N   中随机采样用于评估的数据  D = {(x,y)};
                                     i=1
                 3.  F(a) = 0;
                 4. For epoch = 0 to E–1 do
                     //阶段性自适应策略优化
                              K  == 0
                 5.  If epoch mod
                                                          ′
                            ∗
                       ∗
                 6.     a ,F(a ) = ASO( T,n,A,F, M, f(·,w),L,η,α,β,D );
                           ∗
                 7.   If |  F(a )−F(a) < l
                                   |
                 8.    Early stop;
                 9.   End If
                 10.     F(a) = F(a );
                               ∗
   35   36   37   38   39   40   41   42   43   44   45