Page 315 - 《软件学报》2026年第7期
P. 315
3000 软件学报 2026 年第 37 卷第 7 期
中, 通过观察模型对这些无法决策正确样本的正确类别所在的置信度水平变化, 来判断模型最终的决策边界是否
趋于理想化——实现了更好加固效果的模型应该减少之前对错误类别过高置信度的情况, 提升对正确类别的置信
度. 我们可以认为, 使用更优的加固方法所加固后的模型, 其 ACTC 指标应该能有所提高, 因为它代表着模型对正
确类别的分类置信度情况. 其次, 使用 ALDp 指标作为对攻击后样本失真度的评价, 可以作为评测所采用的攻击强
度的直观数值表现. 通过该指标来观察对模型施加在 L p 约束下的攻击后, 不同攻击作用在样本上的扰动效果. 较
大的指标值说明对应的攻击扰动范围较广, 以突出本文方法在面对强攻击下防御的有效性.
表 1 评测指标与说明
对应问题 评测指标 指标说明
RQ5 AP 目标检测平均精准度
ACC 分类准确率
针对CCAT拒绝对抗样本检测防御方法分类拒绝的样本百分比
ACC_CCAT
RQ1、RQ3、RQ4 (ACC_CCAT=拒绝的对抗样本数/总样本数)
正确分类类别的平均预测置信度 (攻击成功的样本,
ACTC
ACTC=样本正确的类模型给出的预测值之和/攻击成功个数)
RQ2 ALDp 样本平均L p 失真度 (L 0 ,L 2 ,L ∞ )
RQ3、RQ4 COS JS散度来衡量两个比较模型对攻击成功的样本输出概率的相似性
ACC_CCAT 将不参与几组 ACC 的比较中, 因为 CCAT 方法本身拒绝检测的性质使得该比较将不能公平展
示模型自身的防御加固效果. 我们在本文中引用此指标仅作为对拒绝检测方法实际效果的表示, 以便说明该方法
存在的缺陷.
(3) 比较方法及参数设置
为了进行对比分析, 复现了 4 种不同角度的防御方法. 分别为原始对抗训练的方法、ATLD (adversarial
training with latent distribution) 方法、CCAT (confidence-calibrated adversarial training) 方法以及 TRADES (trade-
off between robustness and accuracy) 方法. 在实验分析中还将通过图像化展示检测结果的方式来表现本文方法的
有效性. 用来对比的加固方法以及 PBAT 方法的参数设置具体情况如下.
① 原始对抗训练 (projection-based adversarial training, PAT) 方法采用投影梯度下降 (projected gradient
descent, PGD) 攻击生成对抗样本. 设定 PGD 攻击强度 ε = 16/255, 步长为 0.01, 迭代次数 40 次, 训练时将对抗样
本与原始样本按 1:1 的比例混合, 以增强模型对对抗扰动的适应性. 针对目标检测模型, 选用经典的 DAG 攻击算
法, 通过 50 次迭代生成对抗样本, 模拟真实攻击场景下的模型挑战.
② ATLD (adversarial training with latent distribution) 方法聚焦底层流形对抗训练, 通过诱发原始样本的潜在
表示生成对抗扰动. 为探究其核心训练机制效果, 实验仅采用底层流形对抗训练后的模型作为对比对象, 暂不应用
流形变换推理方法 (inference with manifold transformation, IMT). 辨别器深度设为 28, 加宽系数为 10; 攻击强度
ε = 8.0/255×4, 迭代步数 num_steps=2, 步长 step_size = 8.0/255×2, 确保在统一条件下对比其与本文方法的差异.
③ CCAT (confidence-calibrated adversarial training) 方法着重于对抗样本的拒绝推测, 训练时采用初始扰动
ε =0.3、40 次迭代的 PGD 攻击. 测试环节以 99% 真阳性率 (TPR) 下的分类准确率为核心指标. 鉴于其与本文非鲁
棒模型再训练的思路存在本质区别, 在对比分析中作为参考方法, 辅助剖析不同防御策略的技术特点.
④ TRADES (trade-off between robustness and accuracy) 方法设定扰动步长为 40, ε = 0.3, 并在 L ∞ 范数约束下
开展训练. 该设置有助于验证其在权衡模型性能时的效果, 与本文方法形成多维度对比, 凸显研究创新点的优势.
而 RDC (robust diffusion classifier) 利用预训练扩散模型构建生成式分类器, 净化对抗噪声是将扩散模型直接转化
为生成式分类器进行分类决策, 不需要针对特定的对抗攻击进行训练. ISDAT (image-semantic dual adversarial
training framework) 通过生成对抗图像和对抗语义来增加对抗样本多样性侧重于挖掘图像语义层面的信息. 由于
本文核心在于借助概率模型学习对抗样本和原始样本的分布规律, 生成兼具两者特性的多样性样本, 以此改进对
抗训练过程, 实现决策边界的平滑优化, 提升模型的鲁棒性与精度. 这种差异使本文未对这两种方法进行对比, 从

