Page 354 - 《软件学报》2026年第7期
P. 354
陈家源 等: 说话人信息引导的高性能音频对抗攻击 3039
本文对比了多种攻击方法, 包括 4 种从图像领域迁移至音频领域的经典对抗攻击方法, 即 FGSM [41] 、PGD [42] 、
CW2 [43] 和 CWinf [43] , 以及 6 种音频对抗攻击方法, 分别为 Inaudible [12] 、SirenAttack [44] 、FakeBob [10] 、Kenansville [45] 、
[19] [46]
QFA2SR 和 SMACK . 其中, SirenAttack、FakeBob 和 SMACK 均属于基于查询的黑盒算法. 本文所提出
的 SIAttack 在实验中的参数设置如下: 均匀分布系数 p = 0.05、最大迭代次数 N = 1000、学习率 lr = 0.001、两个
κ
损失函数系数 λ 1 = 1 和 λ 2 = 0.1、扰动阈值 ε = 0.084. 置信度 的设定与目标模型的阈值有关, 当目标模型为
IV_PLDA 和 XV_PLDA 时, κ = 3; 其余情况下, κ = 0.1. CW2、FakeBob 和 SirenAttack 的置信度设置与此相同. 另
外, 为了验证不同扰动载体对攻击性能的影响, 我们还同时生成了在内容信息上添加扰动的对抗音频. 后文使用
SIAttack-c 和 SIAttack-s 分别表示在内容信息和说话人信息添加扰动的对抗音频.
3.2 白盒场景下的攻击性能
在白盒测试环境中, 所有攻击方法均可利用目标模型提供的完整梯度信息进行扰动优化. 表 4 展示了各方法
在 LS 数据集上的攻击性能结果.
表 4 LS 数据集下基于迁移方法在白盒场景的攻击性能
成功率 (%)
Attack IV_PLDA XV_PLDA ECAPA ResNet SNR (dB) PESQ Time (s)
OSI-u OSI-t OSI-u OSI-t OSI-u OSI-t OSI-u OSI-t
FGSM 75.2 30.1 84.6 28.5 86.5 24.0 71.5 26.0 32.5 2.5 0.04
PGD 100.0 98.5 100.0 100.0 100.0 99.4 99.7 99.6 36.1 3.1 3.0
CW2 100.0 96.3 100.0 100.0 95.3 86.0 82.5 75.0 51.3 4.2 79.6
CWinf 100.0 100.0 100.0 100.0 100.0 87.0 99.8 85.0 34.2 2.8 3.2
Inaudible 100.0 91.0 98.2 92.1 95.0 65.5 96.6 85.2 36.1 4.1 85.5
Kenansville 75.6 - 72.6 - 56.2 - 64.5 - 10.1 1.4 2.0
QFA2SR 100.0 100.0 100.0 100.0 100.0 100.0 100.0 100.0 25.7 2.8 12.2
SIAttack-c 100.0 100.0 100.0 100.0 100.0 100.0 100.0 100.0 25.5 4.1 10.4
SIAttack-s 100.0 100.0 100.0 100.0 100.0 100.0 100.0 100.0 24.3 4.1 10.2
注: 加粗数据表示最优结果
根据表 4 所示的攻击成功率结果, 可以观察到不同攻击方法在性能上呈现出显著差异. 由于模型架构的不同,
针对 IV_PLDA 和 XV_PLDA 模型的攻击成功率高, 而对 ECAPA 和 ResNet 模型的攻击则较为困难. 此外, 受任务
难度影响, 大多数方法在 OSI-u (无目标攻击) 任务中表现较好, 而在更具挑战性的 OSI-t (有目标攻击) 任务中成功
率普遍偏低. 需要说明的是, Kenansville 方法仅适用于无目标攻击. 值得关注的是, 在多数实验设置下, QFA2SR、
SIAttack-c 和 SIAttack-s 这 3 种方法均实现了 100% 的攻击成功率, 这主要得益于其采用了更强的攻击策略并引
入了更大的扰动幅度. 在扰动设置方面, FGSM、PGD 和 CWinf 等常规攻击方法将扰动阈值设定为 0.02, QFA2SR
未设置类似阈值, SIAttack 的扰动阈值则为 0.086. 通过 SNR 指标可以进一步量化不同方法引入的扰动大小: CW2
具有最高的 SNR 值, 表明其产生的扰动最小; 而 QFA2SR 和 SIAttack 的 SNR 值较低, 说明它们引入了相对较大
的扰动.
在音频质量方面, QFA2SR 由于引入了较大的扰动, 其 PESQ 得分较低, 表明所生成的对抗音频的听觉质量受
到明显影响. 相比之下, SIAttack 取得了更高的 PESQ 评分, 反映出其生成的对抗音频具有更优的听觉保真度. 这
一优势主要源于 SIAttack 在内容信息和说话人信息等高维语义空间中施加扰动, 其扰动本身带有语义一致性; 而
传统方法多直接在原始波形上添加类似于高频噪声的扰动, 这种非语义的干扰方式更容易损害音频的听觉自然
度. 需要指出的是, 尽管 CW2 在 SNR 和 PESQ 两项客观指标上均表现最佳, 但这并不完全等同于其在人耳听感中
具备最优的音频质量, 相关主观听觉测试结果将在第 3.5 节中进一步讨论.
在计算效率方面, FGSM 表现最佳, 每个对抗音频仅需一次迭代即可生成, 平均耗时仅为 0.04 s. 相比之下,
CW2 与 Inaudible 等方法由于采用二分搜索等优化策略, 所需迭代次数较多, 生成时间显著延长. PGD 方法需进行
100 次迭代, 平均耗时为 3.0 s; 而 SIAttack 平均需要 300 次迭代 (详见第 4.3 节), 平均生成时间达到 10.3 s. 这一方

