Page 137 - 《软件学报》2026年第4期
P. 137
1578 软件学报 2026 年第 37 卷第 4 期
而达到鲁棒性提升的目的, 以免疫今后可能遭遇的对抗攻击. 对抗训练方法最早在图像分类任务上出现, 随后逐渐
发展到目标检测中, 下面分别从这两方面阐述相关工作.
1.1 图像分类对抗训练
Goodfellow 等人 [3] 最早提出利用 FGSM 生成对抗样本参与训练来提升模型鲁棒性, 计算公式如下:
x = x+ϵ ·sign(∇ x L( f θ (x,y))) (1)
ϵ
ϵ
其中, y 是 x 的真实标签, L 代表损失函数, 是扰动强度, 选取不当可能会导致模型过拟合于 FGSM 生成的对抗
样本. 因此, Madry 等人 [5] 提出通过求解 min-max 鞍点问题来搜索最优的对抗样本和鲁棒模型.
[ ]
( ( ))
min E (x,y)∼D maxL f θ x,y (2)
θ x∈S x
其中, D 表示训练数据分布, S x = {z | ∥z− x∥ ⩽ ϵ}. FGSM 可以看作是对内部最大化问题的一个近似求解, 更好的方
法是在内层采用多步的 PGD, 为外层最小化损失优化模型提供数据支撑. PGD 迭代公式如下:
( ( ( ( ))))
x k +ϵ ·sign ∇ x L f θ x k ,y (3)
x 0 = x, x k+1 = P S x
其中, P S x 表示投影算子, 将输入投影到可行域 S x .
尽管基于 PGD 的对抗训练方法能够在很大程度上提升模型的鲁棒性, 但是不可避免地带来了巨额的计算开
销. 基于 PGD-K 的标准对抗训练方法每次模型迭代所需梯度计算次数为 O(M(K+1)), M 是样本数量. 而传统训练
方法仅需 O(M), 也就是说对抗训练方法的复杂度是传统训练方法的 K+1 倍. 为解决计算效率的问题, Shafahi 等人 [35]
提出免费对抗训练, 通过循环利用更新模型参数时计算的梯度信息来消除生成对抗样本的开销, 即在一次反向传
播中同时计算损失相对于模型参数和输入图像的梯度, 免费对抗训练每次模型迭代所需梯度计算次数为 O(MN),
为了抵消小批量循环的额外计算成本, 将迭代总数降低为原来的 1/N, 因此实际训练总时长远小于 T 次迭代的标
准对抗训练. 尽管这样的方式减少了计算量, 但在实际中仍然比同等轮次的传统训练方式慢. 为此 Wong 等人 [36] 重
新审视了基于 FGSM 的对抗训练鲁棒性不足的原因, 提出结合随机初始化和 FGSM 的快速对抗训练方法, 该方法
在得到与免费对抗训练方法同等精度模型的情况下, 将训练时长从 10 h 缩短到了 6 min, 证明了从节省内层最大
化问题计算开销的角度来加速对抗训练成效显著. 随后也衍生出一些新的快速对抗训练方法, 以进一步克服
FGSM 面临的灾难性过拟合问题 [37,38] .
1.2 目标检测对抗训练
ˆ [ x y ]
区别于图像分类, 目标检测模型需要输出干净图像 x 中目标的边界框 b i = p , p ,w i ,h i 及其预测类别概率 ˆ c i =
i
i
[ ]
bg 1 C x y
i
i
ˆ c , ˆc ,..., ˆc , 其中 p 和 p 是第 个目标的左上角坐标值, w i 和 h i 是第 个目标的宽和高, C 为类别总数, bg 代表
i i i i i
背景. Zhang 等人 [26] 最早将目标检测对抗训练形式化描述为如下鲁棒优化问题:
[ ]
( ( ))
max L f θ x,y (4)
min E (x,{b i ,c i })∼D
θ x∈S loc ∪S cls
i
其中, y = {b i , c i } 代表 x 中第 个目标的真实边界框和类别, 总损失由定位任务损失 (通常为 Smooth L 1 损失) 和分
类任务损失 (通常为交叉熵损失) 组成, 即 L = L loc +L cls S loc 和 S cls 分别表示在这两个损失上生成对抗样本的任务域.
.
{ } { }
( ( )) ( ( ))
S loc ≜ x argmaxL loc f θ x,{b i } , S cls ≜ x argmaxL cls f θ x,{c i } (5)
x∈S x x∈S x
S x 上训练模型, 实践证明这种训练方
直接将图像分类对抗训练方法迁移到目标检测, 等价于在任务无关的域
式会因为不同任务之间存在的冲突而导致模型鲁棒性受限. 因此提出基于多任务域 S loc ∪S cls 的对抗训练方法 MTD,
在避免任务之间的互相干扰的同时, 分别从定位和分类损失引导的对抗样本中获取最大收益. 为了提高计算效率,
MTD 采用 FGSM 近似求解符合任务域对抗样本, 在此基础上, Chen 等人 [27] 进一步考虑了给定图像中某一特定类
别的目标数量大于其他类别的情况, 提出了类加权的对抗训练方法 CWAT. 与以往的防御方法相比, CWAT 不仅
能够平衡各类的影响, 而且能够有效、均匀地提高训练模型对所有目标类的对抗鲁棒性. 然而这些方法都存在一
个共性问题——目标检测模型对干净样本的准确性和对抗样本的鲁棒性之间的权衡. 为了缓解这个问题, Dong 等

