Page 353 - 《软件学报》2026年第7期
P. 353
3038 软件学报 2026 年第 37 卷第 7 期
5) 输出此时扰动阈值 ε i .
3 实验分析
本节对 SIAttack 及多种代表性的对抗攻击方法进行全面评估, 设计了 5 项实验: 1) 白盒攻击, 在完全了解目
标模型时评估攻击成功率; 2) 黑盒攻击, 基于迁移性评估对未知模型的攻击效果; 3) 商业 API 攻击, 在真实商业系
统中验证方法的实际威胁; 4) 人类听觉评估, 通过主观实验检验对抗音频的隐蔽性与自然度; 5) 防御鲁棒性, 评估
所生成样本对抗现有主流防御手段的能力.
3.1 实验设置
本文采用 LibriSpeech [30] 和 VCTK [31] 作为数据来源. 鉴于原始数据规模较大, 我们从中筛选部分音频样本, 构
建了两个精简子集 LS (源自 LibriSpeech) 与 VT (源自 VCTK), 具体划分如表 1 所示. LS 数据集进一步细分为
LS enrol 和 l LS OS 两个子集. 类似地, VT 数据集也划分为 VT enrol 和 l VT OS 两个子集. 其中, 标注为“enroll”的子集用
I
I
于说话人识别系统的注册阶段; 标注为“OSI”的子集用于在开集识别任务中生成与测试对抗音频.
表 1 实验数据集划分
数据集 音频数量(个) 说话人数量 子数据集 用途 音频数量 (个) 数据来源
注册 100
LS enroll
LS LibriSpeech
LS OSI OSI任务 1 000
1 100 10
VT enroll 注册 100
VT VCTK
VT OSI OSI任务 1 000
注: LS enroll 和LS OSI 这2个子集均从文献[32]中获得
实验共采用以下 4 个开源说话人识别系统作为目标模型: IV_PLDA [33] 、XV_PLDA [34] 、ECAPA [35] 和 ResNet [36] .
模型详细信息如表 2 所示. 这些模型在架构设计、输入声学特征类型及识别阶段所使用的评分模块等方面均存在
显著差异, 为后续攻击效果的对比分析提供了充分的多样性基础. 所有参与实验的模型都被验证能够有效完成
LB 数据集和 VT 数据集上的说话人识别任务. 为进一步评估攻击方法在真实场景下的适用性, 本文还引入了 3 家
主流商业声纹识别 API 作为测试对象, 分别为腾讯语音识别 (Tencent) [37] 、科大讯飞声纹识别 (iFlytek) [38] 和云知声
声纹识别 (Unisound) [39] . 所有模型 (包括开源与商业系统) 在正常环境下的识别准确率及阈值 θ 设定如表 3 所示.
表 2 目标模型的详细信息
模型架构 模型名称 参数量 (M) 声学信息 训练数据集 评分模块
GMM IV_PLDA 80.37 MFCC LibriSpeech PLDA
ECAPA 20.77 fBank VoxCeleb1&2 COSS
TDNN
XV_PLDA 5.79 MFCC LibriSpeech PLDA
CNN ResNet 11.17 Spectrogram VoxCeleb1&2 COSS
表 3 目标系统的说话人识别准确率
IV_PLDA XV_PLDA ECAPA ResNet Tecent iFlytek Unisound
数据集
θ 准确率 (%) θ 准确率 (%) θ 准确率 (%) θ 准确率 (%) θ 准确率 (%) θ 准确率 (%) θ 准确率 (%)
LS OSI 16.3 97.6 16.4 97.6 0.42 99.6 0.45 96.6 0.7 96.4 0.6 97.3 0.6 98.3
VT OSI 16.3 93.5 16.4 92.5 0.42 97.9 0.45 98.9 0.7 96.3 0.6 96.5 0.6 98.4
实验中使用攻击成功率 (即说话人识别系统被对抗音频成功误导的比率) 来评估各种攻击方法的性能, 使用
信噪比 (signal-to-noise ratio, SNR) 和音频质量感知评估 (perceptual evaluation of speech quality, PESQ) [40] 指标分别
量化扰动幅度与听觉质量. SNR 值越高, 说明扰动越不易被察觉. PESQ 模拟人类听觉系统的客观感知测量, PESQ
分值越高, 表示听觉质量越接近原始音频.

