Page 34 - 《软件学报》2026年第4期
P. 34
翟浩杰 等: 基于自适应策略优化的鲁棒泛化权衡学习 1475
y
战. 通常, 这种扰动的不可察觉性可转化为对扰动大小 L p 范数的 ε 上界限制. 令 x 表示原样本, 表示其真实标签,
δ 表示添加到 x 上的扰动, f(·,w) 表示神经网络模型, w 表示网络参数, L 为损失函数, 于是针对样本 x 的对抗样本
集合可以表示为:
A(x) = {x+δ| f(x+δ,w) , f(x,w),||δ|| p ⩽ ε} (2)
1.1 对抗攻击
一般情况下, 获取对抗样本的任何方法均可称为对抗攻击. 结合上述对抗样本和扰动限制的概念, 对抗攻击从
数学上可以被建模为一个优化问题:
maxL( f(x+δ,w),y), s.t. ||δ|| p ⩽ ε (3)
δ
即在扰动 δ 的 L p 范数的 ε 上界约束下, 最大化网络输出对于真实标签的损失, 记 x adv = x+δ 为对抗样本. 针对特定
x 的单个通道
分类任务, 扰动 δ 的 L p 范数约束会根据 p 的不同取值具有不同的特殊意义, 例如在图像分类中, 样本
通常被建模为数学概念上的矩阵, 常使用 L 0 、 L 2 和 L ∞ 这 3 种特殊的矩阵范数对其进行约束, 其中 L 0 范数限制图
像中可修改的像素数量, L 2 范数限制图像中像素值的平均变化, L ∞ 范数限制图像中所有像素值的最大变化.
经典对抗攻击方法依据其核心策略可分为 3 大类: 基于梯度信息的攻击、基于函数优化的攻击以及自适应集
成攻击, 各类方法在扰动生成机制和应用场景上具有显著差异.
L ∞ 范数约束下的攻击为
1) 基于梯度信息的攻击. 此类方法利用模型对样本的梯度信息直接构造对抗扰动. 以
例, Goodfellow 等人 [13] 提出的快速梯度符号法 FGSM (fast gradient sign method) 是奠基性工作, 通过单步计算损失
函数对输入样本的梯度符号生成扰动, 具有高效性但攻击精度有限. 后续研究通过迭代优化改进攻击效果, 如基本
迭代法 BIM (basic iterative method) [14] 将 FGSM 扩展为多步小步长更新; 动量迭代法 MIM (momentum iterative
method) [15] 引入动量项以加速收敛并规避局部最优; Madry 等人 [6] 提出的投影梯度下降法 PGD (projected gradient
descent) 进一步结合随机初始化和迭代投影机制, 在对抗训练中被广泛用作强基准攻击. 此类方法依赖一阶梯度信
息, 计算效率高且在白盒设定下表现优异.
2) 基于函数优化的攻击. 此类方法将对抗样本生成问题建模为带约束的最优化问题, 通过数值优化算法求解
最优扰动. 典型代表是 Carlini 等人 [16] 提出的 C&W 攻击, 通过设计替代损失函数 (如 DLR 损失) 并采用 Adam 等
优化器, 在 L 2 范数约束下最小化扰动幅度的同时确保模型对扰动样本分类错误. C&W 攻击能够生成视觉不可察
L 0 、 L ∞ 等多种范数约束, 但因需要
觉的对抗样本, 且对部分防御策略具有强穿透性. 其优化目标可灵活适配 L 2 和
多次前向传播和梯度计算, 时间成本较高.
3) 自适应集成攻击. 为全面评估模型鲁棒性, 集成多种攻击策略的自适应方法逐渐成为主流. Croce 等人 [17] 提
出的自动攻击 AA (autoattack) 是此类方法的典范, 整合了 3 种白盒攻击技术与 1 种黑盒攻击技术. 其中, APGD-
CE 和 APGD-DLR 分别基于交叉熵损失和 DLR 损失实现自适应步长调整的白盒 PGD 攻击; 快速适应性边界 (fast
adaptive boundary, FAB) 攻击 [18] 通过逼近决策边界生成跨范数约束的对抗样本; square attack [19] 则以黑盒方式利用
随机局部搜索探索模型脆弱区域. AA 攻击通过自动调度不同攻击策略, 有效规避单一攻击的盲区, 成为当前鲁棒
性评估的标准工具集.
对抗攻击方法从初期的单步梯度优化发展到多策略协同优化, 逐步形成了层次化的技术体系. 基于梯度的方
法聚焦效率与白盒场景的强攻击性, 基于优化的方法追求扰动最小化与防御穿透性, 而自适应集成攻击则通过策
略融合实现全面的鲁棒性评估.
1.2 对抗防御
主流的对抗防御方法主要分为 4 类: 对抗训练、输入预处理、模型结构优化和对抗样本检测. 其中, 对抗训练
通过将对抗样本注入训练过程, 迫使模型在扰动下保持正确预测, 被广泛证明是提升模型鲁棒性最有效的方法, 其
核心在于通过极小极大优化实现风险上界的最小化. 相比之下, 输入预处理 (如去噪、随机化) 易被自适应攻击绕
过, 模型结构优化 (如防御层、梯度掩码) 存在泛化局限, 而对抗样本检测则面临误判率和攻击演进的挑战. 本文

