Page 357 - 《软件学报》2026年第7期
P. 357

3042                                                       软件学报  2026  年第  37  卷第  7  期


                 单位时间内的请求次数设有严格限制. 相比之下, SIAttack 的平均耗时仅为                  17 s, 充分体现了基于迁移的攻击方法
                 在真实场景下的效率优势.

                                            表 8 各方法在商业模型       API 上的攻击性能

                                                 成功率 (%)
                    Attack        Tencent         iFlytek        Unisound     SNR (dB)   PESQ    Time (s)
                               OSI-u   OSI-t   OSI-u   OSI-t   OSI-u   OSI-t
                    FGSM        7       1       10      2       13      3       33.5      2.5      1.7
                     PGD        26     13       33      20      78      37      38.3      3.0      6.5
                     CW2        27     14       37      12      82      37      50.8      4.2     276.6
                    CWinf       26     14       35      12      80      42      34.0      2.8     12.1
                    Inaudible   26     13       31      19      76      37      35.2      4.1     294.0
                   Kenansville  21      0       37      0       74      0       9.5       1.4     13.6
                    QFA2SR      52     23       79      49      93      85      23.0      2.3     19.7
                   SirenAttack  16      4       53      15      73      26      32.7      2.3     393.8
                    FakeBob     36     10       58      17      79      36      29.0      2.1     224.0
                    SMACK       40     12       43      24      58      37       -        -       452.6
                   SIAttack-c   58     22       79      52      86      73      25.7      4.1     17.8
                   SIAttack-s   63     31       82      66      90      83      25.9      4.1     17.2
                 注: 加粗数据表示最优结果

                  3.5   人类听觉测试
                    隐蔽性是对抗音频的另一关键属性, 为评估各方法在此方面的表现, 本节开展了人类听觉测试. 测试样本选自
                 第  3.4  节用于攻击商业   API 的对抗音频, 以及每种方法针对同一条原始音频所生成的对抗版本. 基于这些样本, 本
                 文设计了   3  种对比实验, 并通过问卷调查平台         [48] 发放了  50  份有效问卷以收集主观听感评价.
                    实验  1: 判断给定音频是否不含噪声. 本实验向测试者提供一个未知音频 (任意攻击方法的生成对抗音频, 或
                 是一个干净音频      Clean), 并让测试者判断给定的音频是否不含噪声, 结果如图                3(a) 所示, 其展示了测试者认为提
                 供的音频不含噪声的比例. 作为参考基准, 全部参与者 (100%) 均认为                 Clean  音频不含任何可察觉噪声. 其他方法
                 生成的对抗音频在感知评价上呈现明显差异: 具体而言, 分别有                    84%  和  88%  的测试者认为  Inaudible 和  SMACK
                 方法生成的音频不含噪声. 这归因于            Inaudible 采用了基于心理声学模型的掩蔽策略, 而           SMACK  通过对音频韵
                 律进行结构性修改以生成对抗音频, 两者均能有效维持较好的听觉质量. 相比之下, QFA2SR                          方法仅有    30%  的听
                 感通过率, 说明其在追求高迁移性的过程中显著牺牲了音频质量. Kenansville 方法表现最不理想, 因其在信号处
                 理过程中过度削减频段内容, 导致音频失真严重. 值得关注的是, SIAttack-c 与 SIAttack-s 分别获得                  90%  和  88%
                 的“无噪声”判断率, 显著优于多数对比方法, 反映出本文所提方法能够在实现对抗性的同时, 更好地维持音频的
                 自然听感.

                    100  100                    100                          100  100  96  96   96 94  98 96
                                        88 90  88                                  94 92  92  86 88
                                84                  84
                     80      78                  80                           80
                   比例 (%)  60  44               比例 (%)  60  44  50     60  58  比例 (%)  60  50
                     40
                                                                              40
                                                 40
                         32
                              24   30  24  34         22  24    26  24 24  30
                     20                          20        16                 20
                                                               8
                                  4
                     0                            0                            0
                                                            Kenansville
                                                                     SIAttack-c
                                   SirenAttack
                                                                                         Kenansville
                                        SIAttack-c
                                Kenansville
                       Clean  FGSM  PGD  CW2 CWinf Inaudible  QFA2SR  FakeBob SMACK SIAttack-s  Clean FGSM  PGD  CW2 CWinf Inaudible  QFA2SR SirenAttack FakeBob SMACK  SIAttack-s  Clean FGSM  PGD  CW2 CWinf Inaudible  QFA2SR SirenAttack FakeBob SMACK SIAttack-c SIAttack-s
                        (a) 实验 1: 测试者认为给定音频         (b) 实验 2: 测试者认为给定音频与         (c) 实验 3: 测试者认为给定音频与
                             不含噪声的比例                    干净音频相同的比例                 干净音频的说话人相同的比例
                                                     图 3 人类听觉测试
   352   353   354   355   356   357   358   359   360   361   362