Page 112 - 《软件学报》2026年第4期
P. 112
姜高霞 等: 数值型标签噪声的渐进式区间校正方法 1553
机上完成, CPU 为 Intel(R) Core i7-10700H, CPU 频率为 2.9 GHz, 内存为 16.0 GB. 其中第 4.1 节使用 Matlab
R2018b 编程, 第 4.2 节的实验使用了 Python 3.8 和 PyTorch 2.2, 并采用 NVIDIA GeForce RTX 4090 GPU 和 24 GB
显存进行加速.
4.1 基准数据集
实验中, 每个基准数据集按照 7:3 的比例随机划分为训练集和测试集, 在训练集中人工添加伪随机标签噪声;
然后通过所提方法或对比方法检测并过滤或校正噪声样本; 最后使用过滤或校正后的样本训练测试模型, 并在测
试集上检验有效性. 为了确保结果的稳定性, 以上步骤重复 5 次.
4.1.1 实验框架
表 1 列出了实验中使用的 10 个基准回归数据集 [25,26] . 数据的数值型特征和标签均被归一化到区间 [−1, 1].
表 1 数据集信息
No. 数据集名称 样本量 特征数
1 Concrete 1 030 8
2 Treasury 1 049 15
3 Music 1 059 68
4 MG 1 385 6
5 Airfoil 1 503 5
6 Skill 3 338 18
7 Parkinsons(y 1 ) 5 875 16
8 Parkinsons(y 2 ) 5 875 16
9 Cpusmall 8 192 12
10 Condition 11 934 16
为了更全面地模拟多种噪声, 实验中设置了 4 种噪声比例 (NR=10%、20%、30% 和 40%) 和 4 种噪声分布类
型, 每种分布类型都有两组不同参数. 它们分别服从均匀分布 (U(−0.5, 0.5) 和 U(−0.8, 0.8))、高斯分布 (N(μ=0,
σ=1) 和 N(μ=0, σ=0.8))、拉普拉斯分布 (Lp(μ=0, σ=0.5) 和 Lp(μ=0, σ=0.8)) 和高斯混合分布 (N(μ=0.1, σ=0.3)+
N(μ=−0.1, σ=0.3) 和 N(μ=0.2, σ=0.5)+N(μ=−0.1, σ=0.5)).
对比算法包括 RegENN [19] 、CDF [12] 、IPF [17] 、ATF [20] 、MAPNF [22] 、EIF [21] 和所提 PIC 算法. 测试模型包括高
斯过程回归 (GPR)、随机森林 (RF) 和支持向量回归模型 (SVR). 模型在测试集上的泛化能力采用均方误差 (mean square
error, MSE) 来度量:
1 ∑ n
MSE = [m(x i )−y i ] 2 (18)
n i=1
4.1.2 标签校正结果与分析
表 2 列出了不同噪声比例下各数据集上不同算法的平均测试误差和标准差. 从表 2 中的统计结果可以看出,
PIC 算法的测试误差总能排在前二, 且达到最优次数的比例高达 80%. 从噪声水平的角度看, 噪声比例越大, 测试
误差越大. PIC 在每种噪声比例上具有最小测试误差的次数变化幅度不大, 说明 PIC 在不同噪声水平上具有良好
的稳定性.
表 3 列出了不同噪声比例下各模型在 10 个数据集上的平均测试误差. 从表 3 中的数据可以看出, 噪声比例越
大, 测试误差越大. PIC 的测试误差在各测试模型上均为最小. 对比 3 个模型的测试误差可见, SVR 的测试误差均
为最大, 说明 SVR 模型对所添加的人工标签噪声相对更为敏感.
根据每个模型在各数据和各噪声比例上的测试误差, 图 2 展示了各种噪声处理方法所对应测试误差的临界差
异图 (critical difference, CD). CD 图不仅可以给出算法之间的排名, 还可以通过 Nemenyi 检验显示算法之间的排
名是否显著. 算法排名越小, 表示测试误差越小.

