Page 356 - 《软件学报》2026年第7期
P. 356
陈家源 等: 说话人信息引导的高性能音频对抗攻击 3041
表 7 VT 数据集下各方法在黑盒场景的攻击性能
成功率 (%)
Attack IV_PLDA XV_PLDA ECAPA ResNet SNR (dB) PESQ Time (s)
OSI-u OSI-t OSI-u OSI-t OSI-u OSI-t OSI-u OSI-t
FGSM 44.5 0.0 31.0 0.0 10.5 0.8 15.9 1.5 31.4 2.4 1.5
PGD 82.2 35.2 72.2 33.7 55.8 25.2 64.7 29.2 35.3 3.1 5.1
CW2 80.7 37.9 74.0 36.6 58.2 28.0 66.3 32.8 51.0 4.2 207.5
CWinf 79.6 39.1 72.2 36.7 57.3 29.9 64.7 32.4 33.2 2.9 10.5
Inaudible 78.3 35.6 69.3 34.3 53.7 26.4 61.4 30.7 36.9 4.1 256.8
Kenansville 69.9 - 64.8 - 49.8 - 57.1 - 9.6 1.2 11.2
QFA2SR 94.1 88.7 93.9 87.5 76.1 54.7 87.4 70.9 25.1 2.8 16.1
SirenAttack 78.8 63.9 76.0 61.0 59.3 47.3 67.6 53.5 31.1 2.8 228.4
FakeBob 94.8 75.0 89.2 71.1 70.5 56.7 79.9 62.3 32.0 2.9 156.3
SMACK 96.3 81.5 91.2 76.9 71.3 60.5 81.9 69.3 - - 295.1
SIAttack-c 88.4 84.3 87.2 80.0 77.2 57.5 81.3 68.3 25.5 4.1 15.7
SIAttack-s 98.4 93.5 96.4 92.4 88.7 64.0 91.7 77.1 25.9 4.1 15.2
注: 加粗数据表示最优结果
在攻击成功率方面, 与白盒场景相比, 大多数基于迁移的方法在黑盒攻击中表现有所下降. 而基于查询的黑盒
攻击方法则普遍取得更高的成功率. 此外, OSI-u 与 OSI-t 任务间的难度差异更为突出, 多数方法在 OSI-t 上的成功
率仅为 OSI-u 的一半左右. 不同目标模型的攻击难度也存在明显差异, 其中对 ECAPA 和 ResNet 的攻击成功率显
著低于其他模型. 值得关注的是, SIAttack-c 与 SIAttack-s 在黑盒环境下仍保持了较高的攻击成功率, 显著优于其
他对比方法. 这表明在音频的高维语义特征 (如内容与说话人信息) 上施加扰动, 相较于直接在原始波形上添加噪
声, 能够产生迁移性更好的对抗音频. 同时, SIAttack-s 相比 SIAttack-c 在成功率上约有 10% 的提升, 说明在说话
人信息层面引入扰动具有更强的通用性.
在音频质量方面, 基于查询的攻击方法所生成的对抗音频在 SNR 和 PESQ 指标上普遍偏低 (注: SMACK 方
法因修改了音频的音律结构, 导致对抗音频与原始音频长度不一致, 无法有效计算 SNR 和 PESQ). 相比之下, SIAttack
的表现更优, 反映出其生成的对抗音频在保持听觉质量方面具有明显优势.
在计算效率上, 基于迁移的方法因采用模型集成策略, 生成时间有所增加; 而基于查询的方法耗时更为显著,
例如 SMACK 平均需 258 s 才能生成一个对抗音频. 这主要是由于在黑盒设置下, 攻击者无法获取模型内部信息,
只能依赖多次查询和反馈逐步调整攻击策略, 这一迭代过程自然比直接利用模型梯度的迁移攻击更为耗时. 相较
之下, SIAttack 平均仅需 15 s 即可生成一个对抗音频, 展现出更高的生成效率.
3.4 针对商业模型的攻击测试
为更全面地评估各攻击方法在实际应用中的有效性, 本文进一步测试了所有方法针对 3 种主流商业说话人识
别 API 的攻击效果, 包括腾讯语音识别 (Tencent) 、科大讯飞声纹识别 (iFlytek) 及云知声声纹识别 (Unisound). 与
这些商业 API 的交互均通过 HTTP POST 请求实现. 考虑商业服务通常按调用次数计费, 为控制实验成本, 本研究
仅使用 LS 数据集进行评估. 具体而言, 注册阶段采用 LS enrol 中的所有音频样本, 测试阶段则从 LS OS 中随机抽取
I
l
100 条音频作为测试样本. 为确保基于迁移的攻击方法达到最佳性能, 实验将其替代模型扩展为全部 4 个开源模
型 (IV_PLDA、XV_PLDA、ECAPA 和 ResNet), 以充分利用集成模型的迁移优势. 详细攻击结果汇总于表 8.
在攻击成功率方面, SIAttack-s 在 Tencent 和 iFlytek 两个商业 API 上表现最佳, 其在 OSI-t 任务中的攻击成功
率分别比 QFA2SR 高出 8% 和 17%. 然而, 在对 Unisound API 的攻击中, QFA2SR 取得了最高成功率, 这一差异可
能源于不同商业模型在结构设计与防御机制上的区别.
从计算效率角度分析, 基于查询的攻击方法在商业 API 测试中耗时显著增加, 以 SMACK 为例, 其平均生成
时间从 258 s 延长至 452 s. 这主要受到两方面因素影响: 一是 HTTP 请求本身存在的网络延迟, 二是商业 API 对

