Page 359 - 《软件学报》2026年第7期
P. 359
3044 软件学报 2026 年第 37 卷第 7 期
表 10 在部署防御措施时, 各种方法在 OSI-t 任务上的攻击成功率 (%)
Attack None QT AT AS MS DS LPF MP3-C FeCo-d VAE PWG
Clean 0.0 3.8 3.8 2.3 5.2 1.7 2.4 3.8 6.2 10.2 9.8
FGSM 12.0 3.3 3.2 9.3 7.9 9.7 9.7 9.9 3.9 2.9 2.9
PGD 40.7 16.8 13.3 20.8 31.2 39.3 40.3 40.3 40.3 16.7 16.7
CW2 43.7 12.6 12.2 2.8 17.0 18.2 13.3 1.6 2.1 12.5 12.5
CWinf 45.3 18.8 15.0 23.5 35.0 44.3 45.2 45.2 3.5 18.7 18.7
Inaudible 41.1 12.6 12.3 2.8 17.2 18.5 13.5 1.6 2.2 12.6 12.6
QFA2SR 90.7 81.4 80.5 83.2 79.4 71.8 89.8 80.8 61.9 42.7 45.6
SirenAttack 65.4 1.0 0.5 3.7 11.0 31.8 9.2 4.3 3.1 5.3 4.2
FakeBob 76.2 3.8 4.3 6.0 12.6 35.5 11.8 3.8 4.2 3.8 3.2
SMACK 82.5 57.5 66.2 74.6 69.5 71.3 75.7 72.2 70.3 47.3 47.3
SIAttack-c 86.0 47.8 73.3 78.1 75.5 60.7 79.5 85.4 83.2 52.9 51.4
SIAttack-s 94.5 54.1 88.1 93.9 82.5 89.0 95.4 93.5 85.3 79.9 77.9
注: 加粗数据表示最优结果
从防御机制的角度分析, QT、AT、AS、MS 和 DS 等方法主要通过平滑处理、下采样或噪声注入等方法, 旨
在抑制或掩盖对抗音频中的高频扰动成分. 由于这类处理对低强度扰动较为敏感, 它们在应对 FGSM、CW2、
Inaudible 和 FakeBob 等扰动幅度相对较小的攻击时表现出较好的防御效果. 然而, 对于 PGD、QFA2SR 等扰动强
度更高的攻击方法, 此类防御的效果有限, 攻击成功率未出现显著下降. 相比之下, FeCo-d、VAE 与 PWG 等防御
手段聚焦于特征域处理, 通过特征压缩或基于高维表示的重建操作以去除噪声干扰. 在此类更复杂的防御机制下,
大多数攻击方法的成功率均出现明显降低, 反映出特征层级防御对多种对抗扰动具有更广泛的抑制能力.
从攻击方法的设计原理来看, SMACK、Kenansville 和 SIAttack 等方法均未直接在原始音频波形上添加扰动,
而是分别通过调整音频韵律、修改频谱特征, 或针对内容信息与说话人信息等高维语义特征施加扰动来实现攻
击. 由于这类扰动并不表现为传统的高频噪声形式, 使得它们能够有效规避多数以滤除高频对抗噪声为主要目标
的防御机制. 因此, 在面临多种防御措施时, 这些方法仍能维持较高的攻击成功率, 表现出更强的鲁棒性.
与现有攻击方法相比, SIAttack 在 OSI-u 与 OSI-t 两种任务设定以及多种防御环境下均展现出更优的攻击性
能及更低的效能损失. 然而需要指出的是, 在 OSI-t 任务中面对量化 (QT) 防御时, SIAttack 的鲁棒性出现明显下
降. 这一现象主要源于 QT 方法通过量化操作改变了音频信号的原始特征分布, 而 OSI-t 任务对文本相关特征的稳
定性要求较高, 量化所引入的分布偏移可能破坏对抗音频中关键语义特征的完整性, 从而削弱了攻击效果. 此外,
实验结果显示 SIAttack-s 在面对 VAE 与 PWG 等基于重建的防御方法时, 比 SIAttack-c 表现出更强的鲁棒性, 这
可能是因为说话人信息的扰动在 VAE 和 PWG 防御过程中更难被捕捉和消除.
总体而言, 通过对多种防御环境下各攻击方法的成功率进行综合评估与比较, 可以得出结论: SIAttack-s 在面
对各类防御措施时均展现出更高的鲁棒性. 这表明该方法对不同攻击场景与防御机制具备更强的适应性与抗干扰
能力, 能够以更稳定和有效的方式实现其攻击目标.
4 讨 论
p 对迁移性的影响
4.1 均匀分布参数
在第 3 节的实验中, 均匀分布参数被设置为 p = 0.05. 为测试均匀分布参数 p 对 SIAttack 生成的对抗音频的迁
移性的影响, 本节将 p 设置为 0、0.001、0.01、0.05、0.1 和 0.5 这 6 个数值, 其余设置不变. 在不同 p 设置下, 首
先使用 XV_PLDA、ECAPA 和 ResNet 这 3 个替代模型生成对抗音频, 然后将这些对抗音频迁移至 IV_PLDA 模
型并测试其攻击成功率.
表 11 展示了不同 p 设置下迁移性的变化情况. 可知, p 的设置对 SIAttack-c 和 SIAttack-s 的迁移性均有影响.
当 p = 0 时, 对抗音频的攻击成功率分别为 80.3% 和 89.3%. 在合理范围内增大 p 值有助于提升迁移成功率, 这是

