Page 40 - 《软件学报》2026年第4期
P. 40
翟浩杰 等: 基于自适应策略优化的鲁棒泛化权衡学习 1481
∑
a +
12. F 1 (a) = − L( f(x ,w ),y)/|D |;
′
′
x∈D ′ adv
∑
13. F 2 (a) = − L( f(x,w ),y)/|D |;
′
′
x∈D ′
14. F(a) = αF 1 (a)+βF 2 (a);
15. End For
16. P ← 根据适应度 F(a) 大小排序选出前 M 个策略, 并通过锦标赛选择补全种群规模 n;
′
17. P ← 采用交叉和变异算子生成新的策略并添加到 P , 扩大种群规模为 2n;
′′
′
′′
18. For each a ∈ P do
19. F(a) ← 依据步骤 6–14 计算适应度;
20. End For
21. t = t +1;
22. P t ← 根据适应度 F(a) 大小排序选出 P ′′ 中前 n 个策略;
23. End While
24. a = argmaxF(a).
∗
a∈P t
3.3 TRG-ASO 算法描述
3.3.1 训练框架
我们沿用标准对抗训练范式, 采用内外层交替优化来设计 TRG-ASO 算法, 创新点在于对内层优化问题的阶
K 个训练周期利用算法 2 a , 使得现阶段的神经
∗
段性自适应策略搜索, 即每隔 寻找适合于现阶段的最优攻击策略
f(·,w) 根据干净样本生成的对抗样本, 对于其鲁棒性和干净准确率的进一步提升仍具有效性. 本质上, 将公式 (1)
网络
的损失函数替换为代理损失, 优化问题表示为:
1 N ∑
min L CE ( f(x a ∗ ,w),y i ) (11)
w N i,adv
i=1
其中, x a ∗ = x i +δ(x i ,a ) 表示利用攻击策略 a 攻击样本 x i 产生的对抗样本, δ(·) 表示一个产生扰动的操作. TRG-ASO
∗
∗
i,adv
的伪代码如算法 3.
算法 3. 基于自适应策略优化的鲁棒泛化权衡学习 (TRG-ASO).
N n, 攻击策略
T
E
输入: 训练数据 D = {(x i ,y i )} , 损失函数 L, 训练周期 , 学习率 η, 批次大小 B, 进化代数 , 种群大小
i=1
K
F
空间 A = S ε ×S α ×S I , 适应度函数 , 精英保留数 M, 交替优化频次 , 平衡系数 α 和 β, 适应度阈值 l;
输出: 神经网络 f(·,w).
1. 随机初始化神经网络 f(·,w);
′
2. 从训练数据 D = {(x i ,y i )} N 中随机采样用于评估的数据 D = {(x,y)};
i=1
3. F(a) = 0;
4. For epoch = 0 to E–1 do
//阶段性自适应策略优化
K == 0
5. If epoch mod
′
∗
∗
6. a ,F(a ) = ASO( T,n,A,F, M, f(·,w),L,η,α,β,D );
∗
7. If | F(a )−F(a) < l
|
8. Early stop;
9. End If
10. F(a) = F(a );
∗

