Page 274 - 《软件学报》2026年第2期
P. 274

杭均一 等: 基于不变性注入的多标记类属特征学习                                                         753


                  2.3   扰动风险最小化问题上界推导
                    在公式   (2) 所示的扰动风险最小化问题中, 涉及关于随机噪声变量的期望计算. 该期望项难以进行解析计算,
                 常规做法是利用蒙特卡洛采样技术对其进行估计:

                                    q                             q
                                   ∑                             ∑  1  L ∑[ ( (       )  )]
                                         [ ( (         )  )]                       (i)
                               E p(x,y)  E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k ≈ E p(x,y)  L f k e ϕ (x)+ε ;θ k ,y k  (5)
                                                                                   k
                                                                    L
                                   k=1                           k=1  i=1
                 其中, 需要对随机噪声变量        ε k  进行  L 次采样, 然后分别对样本表示进行扰动, 并由分类模型进行预测. 上述常规实
                 现具有关于采样次数       L 的线性复杂度, 当采样次数        L 趋向于无穷大时, 虽能对原期望项进行精确估计, 但计算开销
                 过大.
                    为提高方法的计算效率, 本节进一步推导了原期望项的理论上界:

                                q
                               ∑
                                     [ ( (         )  )]
                           E p(x,y)  E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k
                               k=1
                                  q [
                                 ∑        (           λ     )         (   (           λ     ))]
                                             (     )    T                    (     )    T
                                    −y k logρ f k e ϕ (x);θ k − w Σ k w −(1−y k )log 1−ρ f k e ϕ (x);θ k + w Σ k w  (6)
                           ⩽ E p(x,y)                   k                               k
                                                      2                               2
                                 k=1
                 其中,  ρ(·) 表示  Sigmoid  函数. 与原期望项相比, 上述上界在计算过程中, 仅需在分类模型输出的逻辑值上附加由
                 特征协方差矩阵导出的修正值, 无需再对随机噪声变量                 ε k  进行多次采样、计算, 从而有效提高了方法的计算效率.
                    公式  (6) 的推导过程如下:

                                q
                               ∑
                                     [ ( (         )  )]
                           E p(x,y)  E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k
                               k=1
                                  q
                                 ∑
                                       [                                   ]
                                   E p(ε k ) −y k logρ( f k (z k ;θ k ))−(1−y k )log(1−ρ( f k (z k ;θ k )))
                           = E p(x,y)
                                 k=1
                                  q [       (         )            (           )]
                                 ∑               1                       1
                           ⩽ E p(x,y)  y k logE p(ε k )  +(1−y k )logE p(ε k )
                                             ρ( f k (z k ;θ k ))    1−ρ( f k (z k ;θ k ))
                                 k=1
                                  q
                                 ∑[     (      (     ))        (      (    ))]
                                    y k log 1+E p(ε k ) e −w T z k −b  +(1−y k )log 1+E p(ε k ) e w T z k +b
                                                  k
                                                                         k
                           = E p(x,y)
                                 k=1
                                  q
                                 ∑[     (          λ   )         (        λ   )]
                                    y k log 1+e −w T e ϕ (x)−b+ 2 w T Σ k w  +(1−y k )log 1+e w T e ϕ (x)+b+ 2 w T Σ k w
                                                                            k
                                                                     k
                                              k
                                                    k
                           = E p(x,y)
                                 k=1
                                  q [
                                 ∑        (                 )         (   (                 ))]
                                             (     )  λ  T                   (     )  λ  T
                           = E p(x,y)  −y k logρ f k e ϕ (x);θ k − w Σ k w −(1−y k )log 1−ρ f k e ϕ (x);θ k + w Σ k w  (7)
                                                        k
                                                                                        k
                                                      2                               2
                                 k=1
                                                                            [
                        z k = e ϕ (x)+ε k . 推导过程中, 不等式关系由  Jensen         E logX ⩽ logE[X]. 倒数第  2  个等式的
                                                                                ]
                 其中, 记                                        不等式导出, 即
                 推导使用了高斯分布的特性, 即:

                                                   [  ]            (     )
                                                          1
                                               E p(X) e tX  = e tµ+ 2 σ 2 t 2 , X ∼ N X;µ,σ 2         (8)
                                                      )
                                     (
                                                  T
                                        T
                            T
                    由于  κ = w z k +b ∼ N κ;w e ϕ (x)+b,λw Σ k w  为一高斯随机变量, 因此有:
                            k           k         k

                                                    (    )
                                                                   λ
                                                 E p(ε k ) e w T z k +b  = e w T e ϕ (x)+b+ 2 w T Σ k w
                                                              k
                                                                     k
                                                
                                                       k
                                                
                                                                                                     (9)
                                                    (     )         λ
                                                     −w T z k −b  −w T e ϕ (x)−b+ 2 w T Σ k w
                                                 E p(ε k ) e  k  = e  k  k
                                                
                    基于导出的理论上界, INVA       方法中扰动风险最小化问题的求解过程如伪代码                  1  所示.
                 伪代码   1. INVA  方法优化过程.
                 输入: 多标记训练集     D, 强度因子   λ;
                 1. 随机初始化模型参数      ϕ 和  Θ;
                 2. for t=0 to T do
   269   270   271   272   273   274   275   276   277   278   279