Page 357 - 《软件学报》2026年第7期
P. 357
3042 软件学报 2026 年第 37 卷第 7 期
单位时间内的请求次数设有严格限制. 相比之下, SIAttack 的平均耗时仅为 17 s, 充分体现了基于迁移的攻击方法
在真实场景下的效率优势.
表 8 各方法在商业模型 API 上的攻击性能
成功率 (%)
Attack Tencent iFlytek Unisound SNR (dB) PESQ Time (s)
OSI-u OSI-t OSI-u OSI-t OSI-u OSI-t
FGSM 7 1 10 2 13 3 33.5 2.5 1.7
PGD 26 13 33 20 78 37 38.3 3.0 6.5
CW2 27 14 37 12 82 37 50.8 4.2 276.6
CWinf 26 14 35 12 80 42 34.0 2.8 12.1
Inaudible 26 13 31 19 76 37 35.2 4.1 294.0
Kenansville 21 0 37 0 74 0 9.5 1.4 13.6
QFA2SR 52 23 79 49 93 85 23.0 2.3 19.7
SirenAttack 16 4 53 15 73 26 32.7 2.3 393.8
FakeBob 36 10 58 17 79 36 29.0 2.1 224.0
SMACK 40 12 43 24 58 37 - - 452.6
SIAttack-c 58 22 79 52 86 73 25.7 4.1 17.8
SIAttack-s 63 31 82 66 90 83 25.9 4.1 17.2
注: 加粗数据表示最优结果
3.5 人类听觉测试
隐蔽性是对抗音频的另一关键属性, 为评估各方法在此方面的表现, 本节开展了人类听觉测试. 测试样本选自
第 3.4 节用于攻击商业 API 的对抗音频, 以及每种方法针对同一条原始音频所生成的对抗版本. 基于这些样本, 本
文设计了 3 种对比实验, 并通过问卷调查平台 [48] 发放了 50 份有效问卷以收集主观听感评价.
实验 1: 判断给定音频是否不含噪声. 本实验向测试者提供一个未知音频 (任意攻击方法的生成对抗音频, 或
是一个干净音频 Clean), 并让测试者判断给定的音频是否不含噪声, 结果如图 3(a) 所示, 其展示了测试者认为提
供的音频不含噪声的比例. 作为参考基准, 全部参与者 (100%) 均认为 Clean 音频不含任何可察觉噪声. 其他方法
生成的对抗音频在感知评价上呈现明显差异: 具体而言, 分别有 84% 和 88% 的测试者认为 Inaudible 和 SMACK
方法生成的音频不含噪声. 这归因于 Inaudible 采用了基于心理声学模型的掩蔽策略, 而 SMACK 通过对音频韵
律进行结构性修改以生成对抗音频, 两者均能有效维持较好的听觉质量. 相比之下, QFA2SR 方法仅有 30% 的听
感通过率, 说明其在追求高迁移性的过程中显著牺牲了音频质量. Kenansville 方法表现最不理想, 因其在信号处
理过程中过度削减频段内容, 导致音频失真严重. 值得关注的是, SIAttack-c 与 SIAttack-s 分别获得 90% 和 88%
的“无噪声”判断率, 显著优于多数对比方法, 反映出本文所提方法能够在实现对抗性的同时, 更好地维持音频的
自然听感.
100 100 100 100 100 96 96 96 94 98 96
88 90 88 94 92 92 86 88
84 84
80 78 80 80
比例 (%) 60 44 比例 (%) 60 44 50 60 58 比例 (%) 60 50
40
40
40
32
24 30 24 34 22 24 26 24 24 30
20 20 16 20
8
4
0 0 0
Kenansville
SIAttack-c
SirenAttack
Kenansville
SIAttack-c
Kenansville
Clean FGSM PGD CW2 CWinf Inaudible QFA2SR FakeBob SMACK SIAttack-s Clean FGSM PGD CW2 CWinf Inaudible QFA2SR SirenAttack FakeBob SMACK SIAttack-s Clean FGSM PGD CW2 CWinf Inaudible QFA2SR SirenAttack FakeBob SMACK SIAttack-c SIAttack-s
(a) 实验 1: 测试者认为给定音频 (b) 实验 2: 测试者认为给定音频与 (c) 实验 3: 测试者认为给定音频与
不含噪声的比例 干净音频相同的比例 干净音频的说话人相同的比例
图 3 人类听觉测试

