Page 351 - 《软件学报》2026年第7期
P. 351

3036                                                       软件学报  2026  年第  37  卷第  7  期


                                      ′
                 蔽性和迁移性的对抗音频         x . 该过程主要分为两步: 1) 原音频信息解耦; 2) 修改说话人信息并重建音频.

                                                              对抗音频生成
                                            内容信息 c
                    干净音频 x       内容                                                        对抗音频 x′
                                 编码器   E c
                                            说话人信息 s                              解码器 D
                                 说话人
                                 编码器   E s
                                                              对抗语者信息 s′

                                          M
                                    U(1−p, 1+p)
                                                            优化
                                    对抗扰动 δ                                  Loss function  说话人识别系统
                                           对抗扰动优化                                  损失函数设计
                                                  图 2 SIAttack  的整体框架

                    1) 原音频信息解耦: 如图      2  所示, 将干净音频    x 同时输入一个内容编码器 (       E c ) 和一个说话人编码器 (    E s ), 分

                 别得到内容信息      c 和说话人信息    s. 其中, 内容编码器    [27] 由  WavLM  模型和瓶颈提取器组成. WavLM     模型以原始
                 波形为输入, 首先生成包含内容信息和说话人信息的高维表示. 随后, 将这些高维表示放入瓶颈提取器中转换为低
                 维表示. 这种巨大的维度差距可以造成信息瓶颈, 从而迫使产生的低维表示放弃与内容无关的信息, 如噪声或说话
                 人信息. 说话人编码器则是一个在大量的语音数据集上预训练的说话人验证模型, 能有效提取说话人的身份信息.
                 本文采用的说话人编码器         [28] 采用了基于长短期记忆网络 (long short-term memory, LSTM) 的模型架构, 总共包含
                 3  层, 每层有  256  个隐藏节点. 其后接有一个包含       256  个单元的投影层, 最终对最后一层的隐藏状态进行               L2  规范
                 化, 所得向量即为说话人嵌入表示.
                    2) 修改说话人信息并重建音频: 在提取的说话人信息                 s 后, 为其添加一个微小对抗扰动         δ. 为增强生成对抗
                 音频的迁移性, 将     δ 与一个随机矩阵     M 进行  Hadamard 运算处理. 矩阵   M 中的每个元素独立地从均匀分布           U(1− p,
                 1+ p) 中采样生成, 其作用是在扰动   中引入随机性和复杂性, 以有效减轻对抗音频在源模型上的过拟合, 从而提
                                             δ
                 升其在不同目标模型间的迁移能力. 参数             p 用以控制均匀分布中采样值的范围. 当           p 值越大, 采样值的波动范围越
                                                                      ′
                 广, 引入的随机性也越强. 如公式 (2) 所示, 扰动处理后的说话人信息                s  可表示为:

                                                        ′
                                                        s = s+δ⊙M                                     (3)
                                                                                              ′
                                                         ′            D(·,·) 中, 重构生成对抗音频     x = D(c, s ). 本
                                                                                                    ′
                    接下来, 将内容信息      c 与扰动后的说话人信息        s  共同输入解码器
                               D(·,·) 结构与文献  [29] 中相同, 由多个反向卷积层组成, 每个卷积层后接有一个多接受场融合模块.
                 文所使用的解码器
                  2.3   损失函数设计
                    为实现对抗音频在有效误导说话人识别系统的同时保持良好隐蔽性, 设计了如下损失函数用于优化扰动                                   δ:

                                                                                                      (4)
                                                    L SIA = λ 1 ·L adv +λ 2 ·L per
                 其中,  L adv  代表对抗损失, 旨在增强对抗音频的攻击性, 误导系统产生错误分类;                L per  为感知损失, 用于确保对抗音
                 频与原始音频在感知上高度相似. 两者通过权重系数                 λ 1  和  λ 2  进行平衡.
                                                                                          ′
                             ′                                                          J(x ) , J(x); 或者将其
                    对抗音频    x  的目标是使得说话人识别系统将其识别为任意其他注册说话人发出的, 即
                                               J (x ) = t t ,   为目标说话人标签. 为了实现上述无目标攻击和目标攻击, 需使
                                                  ′
                 识别为特定目标注册说话人发出的, 即
                         ′         G 中的说话人的匹配分数尽可能提高. 因此,
                 对抗音频   x  与说话人组                                     L adv  定义如下:

                                            
                                             θ −max i∈G S(x ) i +κ,    Untargeted
                                                        ′
                                            
                                            
                                       L adv =   {           }                                       (5)
                                             max θ,max i∈G,i,t S(x ) i −S(x ) t +κ,  Targeted
                                                            ′
                                                                  ′
                                            
                                                                                                    κ
                 其中,   max i∈G,i,t S (x ) i   代表对抗音频  x  与注册说话人组  G 内, 除目标说话人外其他说话人匹配分数的最大值,   为置
                              ′
                                            ′
   346   347   348   349   350   351   352   353   354   355   356