Page 360 - 《软件学报》2026年第7期
P. 360
陈家源 等: 说话人信息引导的高性能音频对抗攻击 3045
p > 0.05 时, 继
因为适度引入随机性有助于避免对抗音频在优化过程中陷入局部最优, 从而增强其泛化能力. 而在
续增加 p 值反而导致迁移性能下降, 说明过强的扰动干扰会增加对抗音频的生成难度, 削弱其有效性.
表 11 不同 p 设置下的迁移性 (%)
Attack p=0 p=0.001 p=0.01 p=0.05 p=0.1 p=0.5
SIAttack-c 80.3 81.2 83.6 86.0 84.25 80.24
SIAttack-s 89.3 90.2 92.2 94.5 91.3 88.7
4.2 扰动阈值 ε 对音频隐蔽性的影响
在第 3 节的实验中, 阈值 ε 的大小根据第 2.5 节提出的阈值评估算法确定. 本节将评估阈值 ε 设置的有效性:
ε (由阈值评估算法确定) 和不设置阈值 (即阈值无穷大) 两种情况下, 生成相对应的对抗音频,
1) 分别在设置阈值
并从中挑选 6 名说话人的音频 (说话人编号分别为 P226、P227、P228、P229、P230 和 P232); 2) 向 50 名测试者
提供一个未知音频 (来自以上的 6 名说话人的对抗音频或干净音频), 及 8 个参考音频 (来自以上 6 名说话人以及
2 名干扰说话人的干净音频), 并让测试者从参考音频中找出与未知音频声音最相似的音频.
表 12 展示了测试者对给定的未知音频判断正确的比例, Clean 表示当提供的未知音频为干净音频时, 测试者
判断正确的比例. 例如, 当提供的未知音频为说话人编号为 P229 的干净音频时, 78% 的测试者认为提供的音频的
声音与参考音频中 P229 的声音相同, 而剩下的 22% 的测试者则做出其他判断. SIAttack-s (无阈值) 和 SIAttack-s
(有阈值) 分别展示了在没有设置阈值和使用扰动阈值算法设置阈值时, 生成的音频被测试者判断正确的比例. 由
表 12 可见, SIAttack-s (有阈值) 生成的音频的正确识别率与 Clean 音频的差别在 4% 之内, 说明这些音频与 Clean
音频在听觉上相差不大. 相比之下, SIAttack-s (无阈值) 生成的音频的正确识别率较低, 说明此类音频与 Clean 音
频在听觉上存在较大差异. 以上实验结果证明了扰动阈值评估算法的有效性.
表 12 测试者对给定的音频的说话人判断正确的比例 (%)
未知音频 P226 P227 P228 P229 P230 P232
Clean 68 68 76 78 80 50
SIAttack-s (无阈值) 生成的音频 56 58 66 68 68 48
SIAttack-s (有阈值) 生成的音频 66 66 76 76 78 50
注: P226、P228、P232为男性说话者; P228、P229、P230为女性说话者
4.3 不同置信度设置下的攻击效率
在第 3 节的实验中, 置信度设置为 κ = 3/0.1 (即在对 IV_PLDA 和 XV_PLDA 模型的攻击时设置为 3, 对其余
模型攻击时设置为 0.1). 本节为测试不同置信度对攻击效果的影响, 分别将 κ 设置为 0/0.0、3/0.1 和 5/0.3. 随后, 在
黑盒设置下, 针对不同迭代步数的情况, 对 SIAttack-s 在 4 个目标模型的 OSI-t 任务进行攻击效率测试. 图 4 展示
了不同置信度下的攻击效率.
100 100 100
80
80
80
攻击成功率 (%) 60 攻击成功率 (%) 60 攻击成功率 (%) 60
40
40
40
XV_PLDA
XV_PLDA
XV_PLDA
20 IV_PLDA 20 IV_PLDA 20 IV_PLDA
ECAPA
ECAPA
ECAPA
ResNet ResNet ResNet
0 0 0
0 10 20 50 100200300500 1 000 0 10 20 50 100200300500 1 000 0 10 20 50 100200300500 1 000
最大迭代步数 N 最大迭代步数 N 最大迭代步数 N
(a) κ=0/0.0 (b) κ=3/0.1 (c) κ=5/0.3
图 4 不同置信度下的攻击效率

