Page 358 - 《软件学报》2026年第7期
P. 358

陈家源 等: 说话人信息引导的高性能音频对抗攻击                                                        3043


                    实验  2: 判断给定的两个音频是否相同. 参与者同时听取一个未知音频 (与实验                      1  来源相同) 及其对应的干净
                 音频, 并判断两者是否为同一段音频. 结果如图              3(b) 所示, 实验结果展示了被测试者认为未知音频与干净音频相
                 同的比例. 作为参考基准, 当两个完全相同的干净音频进行比较时, 有                    84%  的参与者认为它们相同. 在其他方法生
                 成的对抗音频中, Inaudible 表现最佳, 有     50%  的测试者认为其与干净音频相同; 而 SMACK 方法仅有              30%  的测试
                 者判断为相同, 这主要源于其对音频韵律的修改导致语速和时长产生可感知变化, 从而容易被识别出差异. QFA2SR
                 的表现相对较弱, 仅有      26%  的参与者认为其与原始音频相同. 相比之下, SIAttack-c 和 SIAttack-s 分别获得了           60%
                 和  52%  的测试中判断为相同, 显著优于其他对比方法. 这一结果表明, 本文方法生成的对抗音频在听觉层面与原
                 始音频保持了较高相似性, 具备更优的隐蔽能力.
                    实验  3: 判断给定的两个音频的说话人是否相同. 参与者同时听取两个音频样本, 并需判断它们是否由同一说
                 话人录制. 本实验旨在验证在说话人信息层面添加扰动是否会影响人类对说话人身份的感知. 实验结果如图                                   3(c)
                 所示. 作为参考基准, 当参与者聆听两个未经扰动的干净音频时, 100%                  的测试者正确判断其为同一说话人. 对于大
                 多数攻击方法, 尽管在音频中引入了不同程度的扰动, 仍有约                   90%  的参与者认为说话人相同, 表明人类听觉对身
                 份特征的感知具有一定鲁棒性. 约          10%  的判断差异可能源于噪声干扰对听感造成的细微影响. Kenansville 方法的
                 表现相对较低, 这很可能与其较差的音频质量有关, 失真程度较高导致说话人辨识困难. 相比之下, SIAttack-c 和
                 SIAttack-s 分别获得了  98%  和  96%  的说话人相同判断率, 显著优于其他对比方法. 这一结果说明, 无论是对内容
                 信息还是说话人信息施加扰动, SIAttack         均能有效维持原始说话人的听觉身份特征, 未对人类的说话人辨识产生
                 实质性干扰, 体现出其在保持音频身份特征方面的优越鲁棒性.
                    综合上述    3  项人类听觉实验结果可以看出, 与         QFA2SR  方法相比, SIAttack  所生成的对抗音频在保持高迁移
                 性的同时, 具备更为优越的听觉质量. 此外, 相较于             Inaudible、SMACK  等专注于提升隐蔽性的方法, SIAttack      在维
                 持与原始音频的全局相似度方面表现更加出色, 实现了攻击性能与隐蔽性之间的平衡.
                  3.6   防御性分析
                    本节将对各种攻击方法生成的音频在存在各种防御措施时的攻击性能进行评估. 在本节实验中, 考虑了                                 10  种
                 较为常见的防御措施, 具体如下: 4         种时域防御方法, 分别为量化         (quantization, QT)、音频扰动  (audio turbulence,
                 AT)、平均平滑     (average smoothing, AS) 以及中值平滑  (median smoothing, MS); 2  种频域防御方法, 即降采样
                 (down sampling, DS) 和低通滤波  (low pass filter, LPF); 1  种音频压缩方法: MP3-C; 3  种特征域防御方法, 分别是特
                 征压缩   (feature compression, FeCo-d) [32] 、变分自编码器防御  (variational autoencoder defense, VAE) [49] 以及并行波
                 形生成   (parallel waveGAN, PWG) [49] . 在本次实验中, 测试音频选取自表  6  设置下的对抗音频. 表     9  和表  10  则分别
                 呈现了在部署各类防御措施时, 不同方法所生成的对抗音频在                    OSI-u  和  OSI-t 两个任务上的攻击成功率. 其中, 表
                 中的“None”表示未采取任何防御措施.

                                  表 9 在部署防御措施时, 各种方法在          OSI-u  任务上的攻击成功率 (%)

                    Attack    None   QT     AT    AS    MS     DS    LPF   MP3-C    FeCo-d  VAE    PWG
                     Clean     0.0   3.8    3.8   2.3    5.2   1.7   2.4     3.8     6.2     4.2    5.8
                    FGSM      55.7   15.4  14.8   42.7  36.3   44.6  44.6   45.3     18.1   13.2   13.2
                     PGD      85.7   35.4  28.3   44.3  66.2   83.6  85.7   85.7     85.7   35.4   35.4
                     CW2      87.7   25.2  24.6   5.6   34.4   36.9  26.9    3.2     4.3    25.2   25.2
                    CWinf     85.6   35.4  28.3   44.3  66.2   83.6  85.3   85.3     3.9    35.4   35.4
                   Inaudible  82.5   25.2  24.6   5.6   34.4   36.9  26.9    3.2     4.4    25.2   25.2
                   Kenansville  76.3  37.3  34.6  57.7  42.1   66.7  66.7   66.3     64.3   53.2   53.2
                   QFA2SR     100.0  85.7  89.5   88.5  89.3   92.4  93.5   89.3     80.7   65.3   63.4
                   SirenAttack  80.4  11.3  0.6   14.5  13.5   39.1  11.3   45.3     12.6   14.7   12.8
                   FakeBob    96.0   14.8  15.4   17.5  15.8   44.4  14.8   53.8     15.3   14.8   13.5
                    SMACK     100.0  67.8  66.5   88.3  82.2   84.3  89.5   85.4     83.2   67.8   67.8
                   SIAttack-c  100.0  88.9  88.0  87.1  85.8   85.5  86.5   85.4     83.2   78.9   71.9
                   SIAttack-s  100.0  98.2  99.0  97.8  98.8   98.4  99.0   97.5     91.3   85.9   83.9
                 注: 加粗数据表示最优结果
   353   354   355   356   357   358   359   360   361   362   363