Page 274 - 《软件学报》2026年第2期
P. 274
杭均一 等: 基于不变性注入的多标记类属特征学习 753
2.3 扰动风险最小化问题上界推导
在公式 (2) 所示的扰动风险最小化问题中, 涉及关于随机噪声变量的期望计算. 该期望项难以进行解析计算,
常规做法是利用蒙特卡洛采样技术对其进行估计:
q q
∑ ∑ 1 L ∑[ ( ( ) )]
[ ( ( ) )] (i)
E p(x,y) E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k ≈ E p(x,y) L f k e ϕ (x)+ε ;θ k ,y k (5)
k
L
k=1 k=1 i=1
其中, 需要对随机噪声变量 ε k 进行 L 次采样, 然后分别对样本表示进行扰动, 并由分类模型进行预测. 上述常规实
现具有关于采样次数 L 的线性复杂度, 当采样次数 L 趋向于无穷大时, 虽能对原期望项进行精确估计, 但计算开销
过大.
为提高方法的计算效率, 本节进一步推导了原期望项的理论上界:
q
∑
[ ( ( ) )]
E p(x,y) E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k
k=1
q [
∑ ( λ ) ( ( λ ))]
( ) T ( ) T
−y k logρ f k e ϕ (x);θ k − w Σ k w −(1−y k )log 1−ρ f k e ϕ (x);θ k + w Σ k w (6)
⩽ E p(x,y) k k
2 2
k=1
其中, ρ(·) 表示 Sigmoid 函数. 与原期望项相比, 上述上界在计算过程中, 仅需在分类模型输出的逻辑值上附加由
特征协方差矩阵导出的修正值, 无需再对随机噪声变量 ε k 进行多次采样、计算, 从而有效提高了方法的计算效率.
公式 (6) 的推导过程如下:
q
∑
[ ( ( ) )]
E p(x,y) E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k
k=1
q
∑
[ ]
E p(ε k ) −y k logρ( f k (z k ;θ k ))−(1−y k )log(1−ρ( f k (z k ;θ k )))
= E p(x,y)
k=1
q [ ( ) ( )]
∑ 1 1
⩽ E p(x,y) y k logE p(ε k ) +(1−y k )logE p(ε k )
ρ( f k (z k ;θ k )) 1−ρ( f k (z k ;θ k ))
k=1
q
∑[ ( ( )) ( ( ))]
y k log 1+E p(ε k ) e −w T z k −b +(1−y k )log 1+E p(ε k ) e w T z k +b
k
k
= E p(x,y)
k=1
q
∑[ ( λ ) ( λ )]
y k log 1+e −w T e ϕ (x)−b+ 2 w T Σ k w +(1−y k )log 1+e w T e ϕ (x)+b+ 2 w T Σ k w
k
k
k
k
= E p(x,y)
k=1
q [
∑ ( ) ( ( ))]
( ) λ T ( ) λ T
= E p(x,y) −y k logρ f k e ϕ (x);θ k − w Σ k w −(1−y k )log 1−ρ f k e ϕ (x);θ k + w Σ k w (7)
k
k
2 2
k=1
[
z k = e ϕ (x)+ε k . 推导过程中, 不等式关系由 Jensen E logX ⩽ logE[X]. 倒数第 2 个等式的
]
其中, 记 不等式导出, 即
推导使用了高斯分布的特性, 即:
[ ] ( )
1
E p(X) e tX = e tµ+ 2 σ 2 t 2 , X ∼ N X;µ,σ 2 (8)
)
(
T
T
T
由于 κ = w z k +b ∼ N κ;w e ϕ (x)+b,λw Σ k w 为一高斯随机变量, 因此有:
k k k
( )
λ
E p(ε k ) e w T z k +b = e w T e ϕ (x)+b+ 2 w T Σ k w
k
k
k
(9)
( ) λ
−w T z k −b −w T e ϕ (x)−b+ 2 w T Σ k w
E p(ε k ) e k = e k k
基于导出的理论上界, INVA 方法中扰动风险最小化问题的求解过程如伪代码 1 所示.
伪代码 1. INVA 方法优化过程.
输入: 多标记训练集 D, 强度因子 λ;
1. 随机初始化模型参数 ϕ 和 Θ;
2. for t=0 to T do

