Page 352 - 《软件学报》2026年第7期
P. 352
陈家源 等: 说话人信息引导的高性能音频对抗攻击 3037
信度, θ 为前文所介绍的 OSI 任务中的分数阈值.
′
为确保生成扰动后的说话人信息 s 与原说话人信息 s 尽可能相似, 使用余弦相似度计算感知损失 L per :
s· s ′
′
L per = 1−Sim(s, s ) = 1− (6)
||s||||s ||
′
其中, Sim(s, s ) 用于计算 s 和 s 之间的余弦相似度.
′
′
2.4 对抗扰动优化
根据以上构造的损失函数 L SIA , 采用迭代梯度下降的方式优化 δ, 即:
( )
δ i+1 ← clip δ i −lr ·sign(∇ δ L SIA ) (7)
ε
N
其中, lr 是学习率, sign(·) 是符号函数, clip (·) 函数对扰动幅值进行限定, 即 ||δ|| ∞ < ε. 优化步数为 , 为了缩短对抗
ε
音频生成时间, 实验中使用了文献 [10] 中的早停策略, 即对抗音频成功误导目标模型时便立刻停止优化. SIAttack
的整体过程可用算法 1 表示.
算法 1. SIAttack.
输入: 干净音频 x;
输出: 对抗音频 x .
′
1. 提取 x 的内容信息 c
2. 提取 x 的说话人信息 s
3. 计算干净音频 x 的匹配分数 J (x)
δ 0 为 0
4. 初始化扰动
5. for i = 0 to do
N
6. 构造添加了扰动的说话人信息 s = s+δ i ⊙M
′
7. 重建新音频 x = D(c, s )
′
′
8. 计算对抗音频 x 的匹配分数 J (x )
′
′
9. if J (x ) , J (x) (有目标攻击则为 J (x ) = t) then
′
′
10. return x ′
11. else
12. 计算损失 L SIA
( )
13. 更新扰动 δ i+1 ← clip δ i −lr ·sign(∇ δ L SIA )
ε
2.5 扰动阈值评估
在生成对抗音频的过程中, 解码器 D(·,·) 根据扰动后的说话人信息重建音频. 若添加的扰动过大, 可能导致重
构音频在听觉上表现为另一说话人的音色. 因此, 在扰动更新时 (公式 (7)), 需确保 ||δ|| ∞ < ε, 从而使得重构的对抗
′ ε 难以取得理想效果. 为此, 本文提出一种扰动阈值自动
音频 x 与原音频 x 尽可能相似. 然而, 仅凭经验设定阈值
ε 初始化为一个较大值, 随后逐步衰减,
评估算法, 以更合理地确定该阈值. 该算法的核心思想是: 首先将扰动阈值
直至重构音频与原始音频在说话人音色上的相似度达到可接受水平时, 迭代终止. 通过计算多个音频的平均阈值
ε 作为最终设定的 ε 值, 每个音频的阈值评估步骤如下.
1) 对于音频 x i (i = {1,...,n}), 将其输入内容编码器和说话人编码器, 得到内容信息 c i 和说话人信息 . 扰动阈
s i
值 ε i 初始设置为 max(s i )−min(s i ).
′
x
2) 构造扰动 δ i , 其值从均匀分布 U (−ε i ,ε i ) 中采样得到, 添加至 s i 后得到 s = s i +δ i , 通过解码器重建出新音频 . ′
i i
′ Cs.
3) 计算重建音频 x 与原始音频 的频谱相似度
x i
i
4) 判断 Cs 是否大于 0.7, 如果否, 则令 ε i = ε i ·0.8, 以降低其大小并跳转至第 2) 步.

