Page 110 - 《软件学报》2026年第4期
P. 110
姜高霞 等: 数值型标签噪声的渐进式区间校正方法 1551
其中, µ k 为均值, Σ k 为标准差. 这些均值可以取值为多个近邻样本的标签或多个模型的预测标签.
3.1 标签校正的有效性理论
假设原始数据集 D 中有 N c 个标签被校正 (形成校正子集 D c ), 有 N u 个标签未校正 (形成未校正子集 D u ), 这时
ˆ D = D c ∪ D u . 虽然真实标签是未知的, 但可以利用标签一致性特征 (如近邻
有 N = N c + N u . 标签被校正后的数据集
标签比较接近) 构造真实标签的后验分布. 若已知真实标签的后验分布, 定理 1 给出了有效校正 (能够降低标签噪
声水平) 的一个充分条件.
定理 1. 对于含噪回归数据集 D, 校正后数据集 ˆ D 的噪声水平变低的一个充分条件是被校正样本的观测值 y i
到预估值 ˆ y i 的偏差大于阈值 ∆, 即:
2 2
|y i − ˆy i | > ∆ ⇒ E ˆ D (e ) < E D (e ), ∀i = 1,2,...,N c (5)
i i
√
1 ∑ N c [ ]
其中, ∆ = max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0 N c 表示标签校正数据集 D c 的样本量, 为预估标签, ˜ y i 为潜在真
ˆ y
,
i=1
N c
实标签, E Y (˜y i ) 表示关于后验分布 f(˜y i ) 的真实标签的期望值.
证明: 对于校正子集 D c 中的任意样本 ( ∀i = 1,2,...,N c ), 有:
√
1 ∑ N c [ ]
|y i − ˆy i | > ∆ = max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0 (6)
i=1
N c
1 ∑ N c [ ] 1 ∑ N c
2
⇒ (ˆy i −y i ) > max 2(ˆy i −y i )(ˆy i − E Y (˜y i )),0 ⩾ 2(ˆy i −y i )(ˆy i − E Y (˜y i )) (7)
i=1 i=1
N c N c
将所有 N c 个被校正样本得到的不等式两端分别取均值可得:
1 ∑ N c 2 1 ∑ N c
(ˆy i −y i ) > 2(ˆy i −y i )(ˆy i − E Y (˜y i )) (8)
i=1 i=1
N c N c
2
⇒ E D c (ˆy i −y i ) > 2E D c (ˆy i −y i )(ˆy i − E Y (˜y i )) (9)
2 (y i − ˆy i )(ˆy i − E Y (˜y i )) (10)
⇒ 0 < E D c (y i − ˆy i ) +2E D c
2
两边同时加上 E D c ,Y (ˆy i − ˜y i ) , 得:
[
2
E D c ,Y (ˆy i − ˜y i ) < E D c ,Y (y i − ˆy i )+(ˆy i − ˜y i ) ] 2 (11)
N c 2 N c 2
⇒ E D c ,Y (ˆy i − ˜y i ) < E D c ,Y (y i − ˜y i ) (12)
N N
N u
2
E D u ,Y (y i − ˜y i ) , 可得:
两边同时加上
N
N u 2 N c 2 N u 2 N c 2
E D u ,Y (y i − ˜y i ) + E D c ,Y (ˆy i − ˜y i ) < E D u ,Y (y i − ˜y i ) + E D c ,Y (y i − ˜y i ) (13)
N N N N
其中, 左端表示校正后数据集 ˆ D 中的标签与真实标签的平均偏差, 而右端表示原始数据集 D 中的标签与真实标签
2
E ˆ D (e ) < E D (e ). 证毕.
2
的平均偏差, 即 i i
定理 1 表明, 当实际标签距离相对可信的预估标签较远 (超过阈值 ∆) 时, 采用预估值替换原始标签可以降低
校正标签的噪声水平. 需要注意的是, 校正效果在一定程度上依赖于预估标签的准确性, 预估标签应当采用相对可
靠的标签估计方式 (如基于后验分布估计真实标签), 而不是随意指定.
3.2 最大后验校正
˜ y 是未知的. 本文通过每个样本的多个预测标签和 GMM 构建真实标签的后验
在实际回归任务中, 真实标签
分布, 并依据最大后验 (MAP) 原则预估每个样本的标签值, 即选择后验分布中可能性最大的标签值作为预估值.
如果实际标签和此预估值满足定理 1 中的条件, 则将实际标签校正为此预估值.
真实标签的后验分布形式为:
∑ K
f(˜y i ) = π k ϕ(˜y i ;µ k ,Σ k ) (14)
k=1
其中, µ k = y (k) 表示第 i 个样本的第 k 个预测值. 协方差矩阵的标准差 [24] 为:
i

