Page 108 - 《软件学报》2026年第4期
P. 108
姜高霞 等: 数值型标签噪声的渐进式区间校正方法 1549
含着未知数量和分布的标签噪声 [1,2] . 标签常由于标注者经验不足、设备缺陷以及编码错误等原因受到污染 [3,4] . 例
如, 在面部年龄估计任务中, 由于标注者的主观性存在差异, 不同标注者对同一人脸图像给出的年龄标注可能存在
较大偏差, 从而引入大量标签噪声 [5] . 回归任务中的标签噪声比分类任务中的标签噪声更复杂. 其主要原因是, 分
类中的标签是离散且有限的类别, 而回归中的标签可能属于一个连续且有无限可能取值的区间 [6] .
目前的标签噪声学习方法主要从两个方面处理标签噪声问题. 在模型方面, 通过设计鲁棒网络架构、重构损
失函数和应用正则化技术等方法构建噪声鲁棒模型 [7,8] . 在数据方面, 使用噪声过滤或校正方法可以将多数噪声标
签去除或纠正 [9] . 与构建噪声鲁棒模型相比, 后者只需要给出样本的筛选或校正结果, 不需要对模型进行任何改动.
因此, 从数据角度处理标签噪声已成为一类即插即用的热门方法. 在回归任务中, 噪声过滤由于成本低、风险小等
原因已成为处理标签噪声的主流方法 [10,11] . 与回归噪声标签校正相比, 噪声过滤以相对保守的方式放弃不可靠数
据, 不会引入额外的标签噪声, 但会丢失样本信息可能导致数据分布发生偏移. 标签校正在保持数据分布的同时降
低标签偏差, 但如果校正不当可能会引入额外的标签噪声. 由于回归标签噪声难以精确校正, 目前回归标签噪声的
清洗方法以噪声过滤为主. 完成高质量的标签校正是一项极具挑战性的任务, 需要审慎处理多个关键问题: 首先需
明确待校正标签的选择标准, 其次要确定合理的校正目标值, 同时还需设计科学的校正流程. 尤为关键的是, 整个
校正过程必须严格控制噪声引入, 确保最终实现标签质量的整体提升而非恶化.
在现有标签噪声回归建模的研究中, 对于那些被误标的样本, 如果能够直接纠正其标签, 将更有效地利用数据
提升模型性能 [12] . 可信的标签校正能够避免数据的损失, 它在保留更多有价值信息的同时, 还能更精准地还原数
据的真实分布和准确标签, 从而使模型学习到更准确的模式. 本文在确保噪声水平不会升高的前提下, 在每一轮渐
进地校正少量噪声大的标签, 避免数据和模型出现较大的扰动. 图 1 给出了在合成数据集上渐进式区间校正的示
例. 在每个子图中, 黑点代表标签准确的干净数据, 灰色区域表示算法推断出的可信区间. 灰色区域内的蓝点代表暂
时无需校正的低噪数据, 而灰色区域外的红点代表应该被校正的高噪数据. 具体的标签校正通过箭头表示. 图 1(a)–(c)
给出了 3 次校正的详细过程. 由图 1 可见, 噪声标签经过多次校正后更接近黑色的干净标签.
干净数据 干净数据 干净数据
低噪数据 (未校正) 低噪数据 (未校正) 低噪数据 (未校正)
高噪数据 (被校正) 高噪数据 (被校正) 高噪数据 (被校正)
可信区间 可信区间 可信区间
标签校正 标签校正 标签校正
y y y
x x x
(a) 第 1 次校正 (b) 第 2 次校正 (c) 第 3 次校正
图 1 合成数据上的标签校正算法示例
本文的主要贡献包括 3 方面.
(1) 基于真实标签的后验分布, 从噪声水平的视角给出一种标签校正的有效性条件, 为降低标签噪声水平和设
计可信校正方法提供了理论保障.
(2) 提出一种噪声标签的渐进式区间校正 (progressive interval correction, PIC) 算法. 它以真实标签的最大后验
(maximum a posteriori, MAP) 估计值为中心构造一系列从大到小的区间, 分批校正观测标签在预估区间之外的大
噪声标签. 这些区间的半径受标签校正有效性条件的约束, 以确保实际校正效果.
(3) 在基准数据集上的实验结果表明, PIC 算法优于最先进的噪声过滤方法. 在年龄估计和视线估计任务中,
PIC 算法可以有效降低主流深度模型的预测误差.
2 相关工作
当前标签噪声处理方法的研究重心多集中于分类任务中的类别型标签噪声. 与之形成鲜明对比的是, 针对回

