Page 360 - 《软件学报》2026年第7期
P. 360

陈家源 等: 说话人信息引导的高性能音频对抗攻击                                                        3045


                                                                                             p > 0.05 时, 继
                 因为适度引入随机性有助于避免对抗音频在优化过程中陷入局部最优, 从而增强其泛化能力. 而在
                 续增加   p 值反而导致迁移性能下降, 说明过强的扰动干扰会增加对抗音频的生成难度, 削弱其有效性.

                                               表 11 不同   p 设置下的迁移性 (%)

                             Attack     p=0      p=0.001   p=0.01    p=0.05     p=0.1    p=0.5
                            SIAttack-c  80.3      81.2      83.6      86.0      84.25    80.24
                            SIAttack-s  89.3      90.2      92.2      94.5      91.3     88.7

                  4.2   扰动阈值  ε 对音频隐蔽性的影响
                    在第  3  节的实验中, 阈值    ε 的大小根据第     2.5  节提出的阈值评估算法确定. 本节将评估阈值             ε 设置的有效性:
                                ε (由阈值评估算法确定) 和不设置阈值           (即阈值无穷大) 两种情况下, 生成相对应的对抗音频,
                 1) 分别在设置阈值
                 并从中挑选    6  名说话人的音频 (说话人编号分别为          P226、P227、P228、P229、P230   和  P232); 2) 向  50  名测试者
                 提供一个未知音频 (来自以上的          6  名说话人的对抗音频或干净音频), 及          8  个参考音频 (来自以上     6  名说话人以及
                 2  名干扰说话人的干净音频), 并让测试者从参考音频中找出与未知音频声音最相似的音频.
                    表  12  展示了测试者对给定的未知音频判断正确的比例, Clean              表示当提供的未知音频为干净音频时, 测试者
                 判断正确的比例. 例如, 当提供的未知音频为说话人编号为                  P229  的干净音频时, 78%  的测试者认为提供的音频的
                 声音与参考音频中       P229  的声音相同, 而剩下的     22%  的测试者则做出其他判断. SIAttack-s (无阈值) 和      SIAttack-s
                 (有阈值) 分别展示了在没有设置阈值和使用扰动阈值算法设置阈值时, 生成的音频被测试者判断正确的比例. 由
                 表  12  可见, SIAttack-s (有阈值) 生成的音频的正确识别率与      Clean  音频的差别在   4%  之内, 说明这些音频与      Clean
                 音频在听觉上相差不大. 相比之下, SIAttack-s (无阈值) 生成的音频的正确识别率较低, 说明此类音频与                        Clean  音
                 频在听觉上存在较大差异. 以上实验结果证明了扰动阈值评估算法的有效性.

                                      表 12 测试者对给定的音频的说话人判断正确的比例 (%)

                                   未知音频              P226    P227   P228   P229    P230   P232
                                     Clean            68      68     76     78      80     50
                            SIAttack-s (无阈值) 生成的音频    56      58     66     68      68     48
                            SIAttack-s (有阈值) 生成的音频    66      66     76     76      78     50
                          注: P226、P228、P232为男性说话者; P228、P229、P230为女性说话者

                  4.3   不同置信度设置下的攻击效率
                    在第  3  节的实验中, 置信度设置为       κ = 3/0.1 (即在对  IV_PLDA  和  XV_PLDA  模型的攻击时设置为    3, 对其余
                 模型攻击时设置为       0.1). 本节为测试不同置信度对攻击效果的影响, 分别将              κ 设置为  0/0.0、3/0.1  和  5/0.3. 随后, 在
                 黑盒设置下, 针对不同迭代步数的情况, 对            SIAttack-s 在  4  个目标模型的  OSI-t 任务进行攻击效率测试. 图     4  展示
                 了不同置信度下的攻击效率.

                   100                           100                          100
                                                 80
                                                                               80
                    80
                  攻击成功率 (%)  60                 攻击成功率 (%)  60                攻击成功率 (%)  60
                                                                               40
                    40
                                                 40
                                                                                               XV_PLDA
                                                                  XV_PLDA
                                    XV_PLDA
                    20              IV_PLDA      20               IV_PLDA      20              IV_PLDA
                                                                                               ECAPA
                                                                  ECAPA
                                    ECAPA
                                    ResNet                        ResNet                       ResNet
                     0                            0                             0
                       0 10 20 50 100200300500 1 000  0 10 20 50 100200300500 1 000  0 10 20 50 100200300500 1 000
                             最大迭代步数 N                     最大迭代步数 N                     最大迭代步数 N
                             (a) κ=0/0.0                   (b) κ=3/0.1                   (c) κ=5/0.3
                                                图 4 不同置信度下的攻击效率
   355   356   357   358   359   360   361   362   363   364