Page 349 - 《软件学报》2026年第7期
P. 349

3034                                                       软件学报  2026  年第  37  卷第  7  期


                 人耳难以察觉的特殊噪声, 生成对抗音频样本               (简称为对抗音频), 从而可误导识别系统, 实现身份欺诈. Kreuk              等
                 人  [7] 首次对说话人验证系统实施了对抗攻击, 标志着音频对抗攻击这一研究方向的兴起. 此后, 针对端到端说话人
                 识别系统的对抗攻击逐渐受到关注. Li 等人            [8] 在真实场景下实现了对说话人识别系统的攻击, 证实了音频对抗攻
                 击在现实环境中的可行性. Xie 等人         [9] 则提出了一种实时、通用且鲁棒性强的对抗攻击方法. 此外, 为应对黑盒设
                 置下的攻击难题, Chen    等人  [10] 提出了基于自然进化策略的黑盒对抗攻击方法.
                    随着音频对抗攻击研究的不断深入, 提升对抗音频的隐蔽性与迁移性, 已成为攻击方法研究中关注的重点. 隐
                 蔽性要求对抗音频在听觉上与原音频尽可能接近, 难以被人类感知所区分; 而迁移性则强调生成的对抗音频能够
                 同时误导多个不同的说话人识别模型. 目前, 提升对抗音频隐蔽性的方法主要可分为                          3  类: 基于心理声学模型的方
                 法  [11,12] 、基于听觉范围的方法  [13,14] 和基于特定背景噪声的方法      [15,16] . 基于心理声学模型的方法利用人耳的听觉掩
                 蔽原理  [17] , 将扰动隐藏在不易被感知的频率或强度范围内; 基于听觉范围的方法                   [13,14] 将扰动添加至人耳听觉范围
                 之外的频段 (如超声波), 从而避免被察觉; 基于特定背景噪声的方法                  [15,16] 则将扰动伪装成常见的环境声音, 如消息
                 提示音、键盘敲击声等, 使其在听觉上更自然. 在迁移性提升方面, 主流方法可分为两类: 一类是基于数据增强的
                 方法  [18] , 另一类是基于模型集成的方法      [19,20] . 基于数据增强的方法   [18] 在生成对抗音频时引入随机性变换, 如音频
                 截断、填充、语速与音高调整以及添加噪声等, 以增强其在不同模型间的泛化能力; 基于模型集成的方法                                  [19,20] 在
                 对抗音频生成过程中同时优化多个模型, 融合其梯度或决策信息, 从而提高生成样本对未知模型的攻击成功率.
                    尽管上述方法在提升对抗音频的隐蔽性与迁移性方面取得了一定成效, 但仍存在若干局限性: 1) 现有提高隐
                 蔽性的策略在实际应用中面临明显限制, 如基于心理声学模型的方法未能充分考虑个体听觉感知能力的差异, 基
                 于特定背景噪声的方法需依赖音乐、键盘声等特定声学载体等                      [21] ; 2) 迁移性增强方法往往以牺牲隐蔽性为代价,
                 如为提高对抗音频在不同模型间的泛化能力, 现有方法通常需要引入更大的扰动容量, 这在一定程度上增加了对
                 抗音频被感知或检测的风险; 3) 现有方法普遍局限于原始音频波形层面的扰动添加, 未充分探索在音频深层语义
                 特征 (如说话人身份信息) 上进行扰动的可能.
                    为此, 本文提出了一种说话人信息攻击 (speaker information attack, SIAttack) 的音频对抗攻击方法. 该方法基
                 于对音频中说话人信息与内容信息的解耦, 有针对性地对说话人信息进行扰动操作, 从而在保持高隐蔽性的同时,
                 提升对抗音频的迁移能力. 与传统在原始音频波形上添加扰动的方法不同, SIAttack 作用于更深层的说话人身份
                 特征. 原始波形是低维表征, 直接扰动易产生易于检测的高频噪声; 而说话人信息是高维语义特征, 承载了声纹、
                 口音等独特标识. SIAttack 在该高维空间引入语义一致性扰动, 能更好地保持音频自然度, 隐蔽性更强. 此外, 由于
                 说话人身份特征是识别模型决策的核心依据, 且在不同模型间具有通用性, 攻击此特征能从根本上误导模型, 使生
                 成的对抗音频具备强大的跨模型迁移能力, 对现有说话人识别系统构成了更深层次的安全威胁.
                    SIAttack 的具体实现流程如图      1  所示. 对于一段来自说话人       Bob  的原始音频, 首先将其分解为内容信息与说
                 话人信息两部分. 内容信息主要承载语音的文本转录语义, 而说话人信息则包含用于区分说话人身份的声纹特征.
                 随后, 在说话人信息上施加一个微小的对抗扰动, 再结合原始内容信息与扰动后的说话人信息, 重构生成新的音
                 频. 该音频在听觉上与原音频高度相似, 却能够有效地误导说话人识别系统做出错误判断. 实验结果表明, SIAttack
                 生成的对抗音频在迁移性方面表现优异, 最高可实现                 100%  的攻击成功率; 同时, 人类听觉测试也证实了其良好的
                 隐蔽性, 绝大多数测试者均未能察觉音频中存在的扰动.

                                                  说话人信息攻击                               Bob
                                                    内容信息

                                                   说话人信息
                                                                                     : Others
                              Bob      “I’m Bob”                 “I’m Bob”
                                                    对抗扰动                       说话人识别模型
                                                  图 1 SIAttack  实现流程图

                    本文第   1  节简要介绍说话人识别系统. 第         2  节详细介绍本文方法      SIAttack. 第  3 节介绍实验分析. 第  4  节介绍
   344   345   346   347   348   349   350   351   352   353   354