Page 110 - 《软件学报》2026年第4期
P. 110

姜高霞 等: 数值型标签噪声的渐进式区间校正方法                                                        1551


                 其中,  µ k  为均值,  Σ k  为标准差. 这些均值可以取值为多个近邻样本的标签或多个模型的预测标签.
                  3.1   标签校正的有效性理论

                    假设原始数据集      D 中有  N c  个标签被校正  (形成校正子集     D c ), 有  N u  个标签未校正  (形成未校正子集  D u ), 这时
                                                ˆ D = D c ∪ D u . 虽然真实标签是未知的, 但可以利用标签一致性特征        (如近邻
                 有   N = N c + N u . 标签被校正后的数据集
                 标签比较接近) 构造真实标签的后验分布. 若已知真实标签的后验分布, 定理                      1  给出了有效校正     (能够降低标签噪
                 声水平) 的一个充分条件.
                    定理  1. 对于含噪回归数据集       D, 校正后数据集     ˆ D 的噪声水平变低的一个充分条件是被校正样本的观测值                  y i
                 到预估值   ˆ y i  的偏差大于阈值  ∆, 即:

                                                         2      2
                                            |y i − ˆy i | > ∆ ⇒ E ˆ D (e ) < E D (e ), ∀i = 1,2,...,N c  (5)
                                                         i      i
                         √
                           1  ∑ N c  [               ]
                 其中,  ∆ =        max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0 N c  表示标签校正数据集  D c  的样本量,   为预估标签,  ˜ y i  为潜在真
                                                                                    ˆ y
                                                      ,
                               i=1
                           N c
                 实标签,   E Y (˜y i ) 表示关于后验分布   f(˜y i ) 的真实标签的期望值.
                    证明: 对于校正子集      D c  中的任意样本   ( ∀i = 1,2,...,N c ), 有:

                                                   √
                                                     1  ∑ N c  [               ]
                                         |y i − ˆy i | > ∆ =  max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0  (6)
                                                          i=1
                                                     N c

                                         1  ∑ N c  [               ]  1  ∑ N c
                                      2
                              ⇒ (ˆy i −y i ) >  max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0 ⩾  2(ˆy i −y i )(ˆy i − E Y (˜y i ))  (7)
                                             i=1                          i=1
                                         N c                          N c
                    将所有   N c  个被校正样本得到的不等式两端分别取均值可得:

                                           1  ∑ N c    2  1  ∑ N c
                                                 (ˆy i −y i ) >  2(ˆy i −y i )(ˆy i − E Y (˜y i ))    (8)
                                                i=1           i=1
                                           N c           N c

                                                        2
                                              ⇒ E D c  (ˆy i −y i ) > 2E D c (ˆy i −y i )(ˆy i − E Y (˜y i ))  (9)

                                                         2     (y i − ˆy i )(ˆy i − E Y (˜y i ))     (10)
                                            ⇒ 0 < E D c  (y i − ˆy i ) +2E D c
                                     2
                 两边同时加上     E D c ,Y (ˆy i − ˜y i ) , 得:

                                                             [
                                                       2
                                              E D c ,Y (ˆy i − ˜y i ) < E D c ,Y (y i − ˆy i )+(ˆy i − ˜y i ) ] 2  (11)

                                                 N c        2  N c       2
                                               ⇒   E D c ,Y (ˆy i − ˜y i ) <  E D c ,Y (y i − ˜y i )  (12)
                                                 N             N
                            N u
                                       2
                              E D u ,Y (y i − ˜y i ) , 可得:
                 两边同时加上
                            N

                                   N u        2  N c       2  N u       2  N c        2
                                     E D u ,Y (y i − ˜y i ) +  E D c ,Y (ˆy i − ˜y i ) <  E D u ,Y (y i − ˜y i ) +  E D c ,Y (y i − ˜y i )  (13)
                                   N            N             N            N
                 其中, 左端表示校正后数据集         ˆ D 中的标签与真实标签的平均偏差, 而右端表示原始数据集                D 中的标签与真实标签
                                2
                             E ˆ D (e ) < E D (e ). 证毕.
                                       2
                 的平均偏差, 即       i      i
                    定理  1  表明, 当实际标签距离相对可信的预估标签较远               (超过阈值   ∆) 时, 采用预估值替换原始标签可以降低
                 校正标签的噪声水平. 需要注意的是, 校正效果在一定程度上依赖于预估标签的准确性, 预估标签应当采用相对可
                 靠的标签估计方式       (如基于后验分布估计真实标签), 而不是随意指定.
                  3.2   最大后验校正
                                            ˜ y 是未知的. 本文通过每个样本的多个预测标签和             GMM  构建真实标签的后验
                    在实际回归任务中, 真实标签
                 分布, 并依据最大后验       (MAP) 原则预估每个样本的标签值, 即选择后验分布中可能性最大的标签值作为预估值.
                 如果实际标签和此预估值满足定理            1  中的条件, 则将实际标签校正为此预估值.
                    真实标签的后验分布形式为:

                                                        ∑  K
                                                   f(˜y i ) =  π k ϕ(˜y i ;µ k ,Σ k )                (14)
                                                           k=1
                 其中,  µ k = y (k)  表示第  i 个样本的第  k 个预测值. 协方差矩阵的标准差   [24] 为:
                          i
   105   106   107   108   109   110   111   112   113   114   115