Page 273 - 《软件学报》2026年第2期
P. 273

752                                                        软件学报  2026  年第  37  卷第  2  期


                 赋予分类模型关于无关特征变化的不变性. 扰动风险最小化问题如下所示:

                                                                           
                                                       q
                                                      ∑   ( (           )  ) 
                                                                           
                                                                           
                                            minE p(x,y) E p(ε)     L f k e ϕ (x)+i S k  ⊙ε;θ k ,y k     (1)
                                            ϕ,Θ,S
                                                       k=1
                                                     d
                 其中,  L : R×R → R +  表示二元交叉熵函数.  e ϕ : R → R d z   为一个由   ϕ 参数化的嵌入函数, 用于获取样本表示   z = e ϕ (x).
                                                                                     }
                                                                            {
                                                        }
                                            {
                         d z
                                                  d z
                 f k (·;θ k ) : R → R  表示标记  l k  由  θ k = w k ∈ R ,b k ∈ R  参数化的分类模型,  Θ = θ 1 ,θ 2 ,...,θ q  为各个标记的分类模型
                              {
                                        }
                 参数的集合.    S = S 1 ,S 2 ,...,S q , 其中  S k  表示标记  l k  的无关特征子集.  i S k  ∈ {0,1} d z   为无关特征子集  S k  的指示向量,
                 其非零分量对应标记判别的无关特征索引.              ε ∈ R d z   为一个随机噪声变量, 其服从一个各向同性高斯分布, 即           p(ε) =
                   (      )
                 N ε;0,σ ·I .
                        2
                    在公式   (1) 中, DELA  方法根据分类模型输出关于输入扰动的灵敏度差异辨识各个标记的无关特征; 同时, 通
                 过在无关特征上注入随机噪声扰动模拟无关特征的变化, 从而在学习过程中逐渐赋予分类模型关于无关特征变化
                 的不变性. 其中, 有效辨识标记判别的无关特征是扰动风险最小化问题求解的关键. 在复杂的多标记分类场景中,
                 单纯依靠输入-输出灵敏度差异区分相关特征和无关特征并不可靠. 后续章节将详细介绍本文在                                DELA  方法基础
                 上提出的改进方法.
                  2.2   协方差诱导的无关特征辨识
                    针对  DELA  方法的不足, 本文提出了一种特征协方差诱导的无关特征辨识技术, 通过显式建模数据分布特性,
                 增强无关特征辨识过程的可靠性:

                                                     q
                                                    ∑
                                                          [ ( (         )  )]
                                             minE p(x,y)  E p(ε k ) L f k e ϕ (x)+ε k ;θ k ,y k       (2)
                                             ϕ,Θ
                                                    k=1
                                                                              .
                 其中, 随机噪声变量     ε k ∈ R d z   服从一个零均值高斯分布, 即   p(ε k ) = N (ε k ;0,λ·Σ k ) Σ k ∈ R + d z ×d z   表示标记  l k  的特征协方
                 差矩阵, 从标记    l k  的正例中统计得到,   λ > 0 为控制特征扰动规模的强度因子. 该二阶矩统计量反映了类内各维度
                 特征的变化情况, 为各个标记无关特征的辨识提供了统计依据: 其中, 类内变化程度较大的特征分量, 对应标记判
                 别的无关特征; 而类内变化程度较小的特征分量, 则对应标记判别的相关特征. 同时, 特征协方差矩阵刻画了各维
                 度特征间的关联关系, 因而噪声扰动           ε k  能够更好地模拟真实数据中的特征变化情况. 例如, 人的“年龄”大小与“皱
                 纹”深浅之间存在着一定的关联关系, 随着“年龄”增长, “皱纹”通常会加深. 特征协方差矩阵能够避免噪声扰动                                ε k
                 单一地改变“年龄”大小, 而不改变“皱纹”深浅.
                    由于嵌入函数      e ϕ  在学习过程中不断优化, 训练样本的表示         z = e ϕ (x) 也随之变化. 因此, 在公式  (2) 所示的扰动
                 风险最小化问题的求解过程中, 需要不断更新各个标记的特征协方差矩阵. 为了实现的高效性, 采用了在线估计的
                                                                                B, 统计样本子集的特征均值和
                 方式对特征协方差矩阵进行更新. 具体而言, 对于第               t 次优化迭代的训练样本子集
                 特征协方差矩阵:

                                                   1  ∑
                                                (t)
                                              
                                               ˜µ =     e ϕ (x)
                                              
                                                k
                                                  |B k |
                                              
                                              
                                                     x∈B k
                                                                                                      (3)
                                                     ∑ (
                                                   1            )(       ) T
                                                (t)            (t)      (t)
                                               ˜ Σ =
                                                        e ϕ (x)− ˜µ  e ϕ (x)− ˜µ
                                              
                                                k              k        k
                                                  |B k |
                                                      x∈B k
                                                                                           (t)
                                                                                      (t)
                 其中,  B k  为训练样本子集   B 中标记   l k  的正例集合. 记第   t 次优化迭代中标记   l k  的正例数量为   m  (有  m = |B k |), 前  (t −1)
                                                                                      k    k
                 次优化迭代中出现的标记         l k  的正例总数为  n (t−1) , 可按如下方式对各个标记的特征均值和特征协方差矩阵进行更新:
                                                  k
                                                     (t) (t)
                                          n (t−1) (t−1)  +m ˜µ
                                               µ
                                      
                                       (t)  k  k    k  k
                                      µ =
                                      
                                       k      (t−1)  (t)
                                             n   +m
                                      
                                              k    k
                                      
                                      
                                                                (      )(       ) T
                                      
                                                           (t−1)  (t)  (t−1)  (t)  (t−1)  (t)
                                                     (t)
                                           n (t−1) Σ (t−1) +m ˜ Σ (t)  n  m  µ  − ˜µ  µ  − ˜µ        (4)
                                        (t)  k  k   k  k   k  k  k    k   k    k
                                      Σ =               +        (       ) 2
                                      
                                      
                                        k     (t−1)  (t)
                                              n  +m               (t−1)  (t)
                                                                  n  +m
                                              k     k
                                                                  k     k
                                      
                                      
                                      
                                      
                                       (t)  (t−1)  (t)
                                       n = n   +m
                                        k   k    k
   268   269   270   271   272   273   274   275   276   277   278