Page 109 - 《软件学报》2026年第4期
P. 109

1550                                                       软件学报  2026  年第  37  卷第  4  期


                 归任务中数值型标签噪声的处理方法相对较为稀缺. 在现有的回归任务研究成果中, 多数方法采用标签过滤策略
                 来应对噪声问题, 而基于标签校正的方法在理论与实践层面仍存在广阔的探索空间.
                    对于类别型标签噪声问题, 侯森寓等人             [13] 根据数据的离群程度提出一种基于相对离群因子               (ROF) 的集成过
                 滤方法, 其中   ROF  为样本的同质和异质离群因子的比值, ROF            值越大, 样本含标签噪声的概率越高. Zhang          等人  [14]
                 针对特征相关标签噪声提出一种渐进式标签纠正                 (progressive label correction, PLC) 算法. 该算法通过迭代训练神
                 经网络和校正标签来逐步提高模型性能. 文献              [15,16] 提出将标签过滤与校正有机结合的策略, 用以解决分类任务
                 中的标签噪声问题, 这一策略为标签噪声处理领域提供了新的研究视角与技术路径.
                    对于回归任务中的数值型标签噪声问题, Martin             等人  [17] 将迭代划分过滤   (iterative partition filter, IPF) 方法从
                 分类任务迁移到回归任务, 该方法在不相交的子集上构建决策树, 并使用迭代方法对整个数据集进行评估. 但这类
                 方法未考虑标签之间的本质性区别, 会导致损失函数错配或阈值依赖等问题.
                    相比之下, 针对标签噪声回归任务设计的原生方法更能适配回归任务的特性. 回归集成过滤                                  (ensemble
                 filtering for regression, RegEF) [18] 使用集成学习策略, 将多个异构模型的预测结果作为判断依据, 通过多数投票机制
                 确定标签的正确性. 编辑近邻回归          (edited nearest neighbors filtering for regression, RegENN) [19] 是一种经典的基于近
                 邻的过滤方法, 该方法将预测偏差与自适应阈值进行比较, 将大于阈值的样本识别为噪声样本. Li 等人                             [20,21] 针对回
                 归标签噪声提出了自适应阈值过滤             (adaptive threshold filter, ATF) 和集成迭代过滤  (ensemble iterative filter, EIF)
                 方法. 这两种方法分别使用同质模型和异质模型计算噪声分数, 并将噪声分数超过阈值的样本定义为噪声样本.
                 Jiang  等人  [12] 提出了一种最优样本选择   (optimal sample selection, OSS) 框架, 该框架在泛化误差界理论保证下删除
                 具有较大噪声估计的样本. 根据          OSS  框架设计了覆盖距离过滤        (covering distance filter, CDF) 和最大后验噪声过
                 滤  (maximum a posteriori noise filter, MAPNF) [22] 方法. 为了解决  OSS  框架目标函数的参数复杂性等问题, Jiang  等
                 人  [23] 提出了一种可解释性样本选择       (interpretable sample selection, ISS) 框架. 该框架在保留相对较低噪声水平的
                 同时最大化可用样本的数量, 并根据            ISS  框架设计了嵌入式覆盖距离过滤           (embedded covering distance filter,
                 ECDF) 方法.
                    在现有的回归标签噪声处理方法中, 过滤法是被广泛采用的主流策略. 然而, 这种方法存在明显局限: 一方面, 它
                 在去除噪声样本的过程中, 往往会不可避免地造成有效样本的流失, 导致模型可利用的关键信息减少; 另一方面, 过
                 滤操作可能破坏原始数据的内在分布特征, 引发数据分布偏移问题, 进而影响后续模型训练的稳定性与泛化能力.

                  3   方 法

                    本节介绍标签校正的有效性理论、最大后验校正和渐进式区间校正算法.
                                         N
                    设有回归数据集      D = {x i ,y i } ,  x i  表示第  i 个样本的输入特征,  y i  表示第  i 个样本的数值型标签. 如果数据集受
                                         i=1
                                         y i  可能不等于潜在未知的真实标签  .
                 到标签噪声的干扰, 则观测标签                                     ˜ y i
                    定义  1. 数值型标签噪声定义为:

                                                                                                      (1)
                                                         e i = y i − ˜y i
                    定义  2. 回归模型   m  在数据集上的误差定义为:

                                                                                                      (2)
                                                        r i = m(x i )−y i
                    单个样本真实标签的后验分布可以通过多个近邻样本的标签或多个模型的预测标签来构造. 高斯混合模型
                 (Gaussian mixture model, GMM) 是最基本和常见的一种构造形式      [22] , 它通过加权组合多个高斯成分的方式来描述
                 真实标签的后验分布, 其概率密度函数为:

                                                        ∑  K
                                                    f(˜y) =  π k ϕ(˜y;µ k ,Σ k )                      (3)
                                                           k=1
                 其中,  π k  表示第  k 个高斯分布的权重, 第   k 个高斯成分的密度函数为:

                                                             (                )
                                                      1        1
                                                                       −2
                                                                     T
                                           ϕ(˜y;µ k ,Σ k ) = √  ·exp − (˜y−µ k ) Σ (˜y−µ k )          (4)
                                                               2       k
                                                      2πΣ k
   104   105   106   107   108   109   110   111   112   113   114