Page 353 - 《软件学报》2026年第7期
P. 353

3038                                                       软件学报  2026  年第  37  卷第  7  期



                    5) 输出此时扰动阈值      ε i .
                  3   实验分析

                    本节对   SIAttack  及多种代表性的对抗攻击方法进行全面评估, 设计了               5  项实验: 1) 白盒攻击, 在完全了解目
                 标模型时评估攻击成功率; 2) 黑盒攻击, 基于迁移性评估对未知模型的攻击效果; 3) 商业                       API 攻击, 在真实商业系
                 统中验证方法的实际威胁; 4) 人类听觉评估, 通过主观实验检验对抗音频的隐蔽性与自然度; 5) 防御鲁棒性, 评估
                 所生成样本对抗现有主流防御手段的能力.
                  3.1   实验设置
                    本文采用    LibriSpeech [30] 和  VCTK [31] 作为数据来源. 鉴于原始数据规模较大, 我们从中筛选部分音频样本, 构
                 建了两个精简子集       LS (源自  LibriSpeech) 与  VT (源自 VCTK), 具体划分如表   1  所示. LS  数据集进一步细分为
                 LS enrol 和 l  LS OS 两个子集. 类似地, VT  数据集也划分为  VT enrol 和 l  VT OS 两个子集. 其中, 标注为“enroll”的子集用
                            I
                                                                        I
                 于说话人识别系统的注册阶段; 标注为“OSI”的子集用于在开集识别任务中生成与测试对抗音频.

                                                    表 1 实验数据集划分

                           数据集     音频数量(个)    说话人数量      子数据集       用途     音频数量 (个)    数据来源
                                                                    注册        100
                                                          LS enroll
                             LS                                                       LibriSpeech
                                                          LS OSI  OSI任务       1 000
                                      1 100      10
                                                          VT enroll  注册       100
                             VT                                                         VCTK
                                                          VT OSI  OSI任务       1 000
                          注: LS enroll 和LS OSI 这2个子集均从文献[32]中获得

                    实验共采用以下      4 个开源说话人识别系统作为目标模型: IV_PLDA            [33] 、XV_PLDA [34] 、ECAPA [35] 和  ResNet [36] .
                 模型详细信息如表       2  所示. 这些模型在架构设计、输入声学特征类型及识别阶段所使用的评分模块等方面均存在
                 显著差异, 为后续攻击效果的对比分析提供了充分的多样性基础. 所有参与实验的模型都被验证能够有效完成
                 LB  数据集和  VT  数据集上的说话人识别任务. 为进一步评估攻击方法在真实场景下的适用性, 本文还引入了                            3  家
                 主流商业声纹识别       API 作为测试对象, 分别为腾讯语音识别 (Tencent)       [37] 、科大讯飞声纹识别 (iFlytek) [38] 和云知声
                 声纹识别 (Unisound) [39] . 所有模型 (包括开源与商业系统) 在正常环境下的识别准确率及阈值                  θ 设定如表   3  所示.

                                                  表 2 目标模型的详细信息

                    模型架构          模型名称          参数量 (M)         声学信息           训练数据集          评分模块
                     GMM          IV_PLDA         80.37          MFCC          LibriSpeech     PLDA
                                   ECAPA          20.77          fBank        VoxCeleb1&2       COSS
                     TDNN
                                  XV_PLDA         5.79           MFCC          LibriSpeech     PLDA
                      CNN          ResNet         11.17        Spectrogram    VoxCeleb1&2       COSS


                                              表 3 目标系统的说话人识别准确率

                         IV_PLDA     XV_PLDA      ECAPA       ResNet      Tecent     iFlytek   Unisound
                 数据集
                        θ  准确率 (%)  θ  准确率 (%)  θ 准确率 (%)   θ 准确率 (%) θ 准确率 (%)   θ 准确率 (%)   θ  准确率 (%)
                  LS OSI 16.3  97.6  16.4  97.6  0.42  99.6  0.45  96.6  0.7  96.4  0.6  97.3  0.6  98.3
                 VT OSI 16.3  93.5  16.4  92.5  0.42  97.9  0.45  98.9  0.7  96.3  0.6  96.5  0.6  98.4

                    实验中使用攻击成功率         (即说话人识别系统被对抗音频成功误导的比率) 来评估各种攻击方法的性能, 使用
                 信噪比 (signal-to-noise ratio, SNR) 和音频质量感知评估 (perceptual evaluation of speech quality, PESQ) [40]  指标分别
                 量化扰动幅度与听觉质量. SNR 值越高, 说明扰动越不易被察觉. PESQ                 模拟人类听觉系统的客观感知测量, PESQ
                 分值越高, 表示听觉质量越接近原始音频.
   348   349   350   351   352   353   354   355   356   357   358