Page 116 - 《软件学报》2026年第4期
P. 116
姜高霞 等: 数值型标签噪声的渐进式区间校正方法 1557
无法准确匹配的情况.
实验在 MPIIGaze 数据集的一个预处理后的子集上进行 (数据集下载链接: https://phi-ai.buaa.edu.cn/Gazehub/
3D-dataset/), 子集共包含 45 000 张图像及其视线标签. 实验将 PIC 算法集成到最先进的视线估计方法 L2CS-Net [28]
中. 主要步骤是将所提出的标签校正方法置于全连接层之前. 利用主成分分析法对提取的图像特征进行适当降维
处理, 确保累计贡献率达 85% 以上. 实验使用 15 折交叉验证方法评估预测结果, 每次将 1 名受试者的样本集作为
测试集, 其余 14 名受试者的样本集作为训练集并做标签校正. 表 6 列出了使用 MAE 计算的测试误差. 从表 6 可
见, 集成了 PIC 算法的 L2CS-Net 的测试误差最低. 这表明所提方法适用于带有噪声标签的真实图像数据, 可以减
小先进深度学习模型的测试误差.
表 6 MPIIGaze 数据集测试误差比较
方法 测试误差 (°)
[29]
CA-Net 4.1
[30]
AGE-Net 4.09
[28]
L2CS-Net 3.92
PIC+L2CS-Net 3.84
总的来说, PIC 算法可以有效地识别和校正年龄估计和视线估计数据集中的标签噪声, 从而提高数据质量和
模型的泛化能力.
5 总 结
当前普遍采用的标签噪声过滤策略在处理数值型标签噪声时可能存在过度过滤或分布偏差等问题, 导致模型
难以充分捕捉数据真实分布特征. 针对这一现状, 本文提出一种渐进式区间校正 (PIC) 算法. 该算法以标签估计值
为中心, 构造一系列由大到小的区间, 分批校正不在预估区间内的大噪声标签. 模拟噪声实验和真实数据实验表
明, 所提 PIC 算法在不同的噪声水平和噪声分布下均能保持鲁棒性, 具备较强的实际应用价值.
尽管所提标签校正方法在性能上有一定的优势, 然而标签校正效果依赖于校正标签和后验分布估计的准确
性. 后续拟分析预估标签的可靠性或稳定性, 以获得更鲁棒的标签校正结果. 任何校正方法都无法绝对避免引入新
的错误标签, 如何度量并有效控制标签校正风险是下一步需要考虑的问题. 此外可以根据实际的标签风险将标签
校正与标签过滤策略有机结合, 进一步完善数值型标签噪声的处理方案.
References
[1] Salekshahrezaee Z, Leevy JL, Khoshgoftaar TM. A reconstruction error-based framework for label noise detection. Journal of Big Data,
2021, 8(1): 57. [doi: 10.1186/s40537-021-00447-5]
[2] Northcutt C, Jiang L, Chuang I. Confident learning: Estimating uncertainty in dataset labels. Journal of Artificial Intelligence Research,
2021, 70: 1373–1411. [doi: 10.1613/jair.1.12125]
[3] Han B, Tsang IW, Chen L, Zhou JT, Yu CP. Beyond majority voting: A coarse-to-fine label filtration for heavily noisy labels. IEEE
Trans. on Neural Networks and Learning Systems, 2019, 30(12): 3774–3787. [doi: 10.1109/TNNLS.2019.2899045]
[4] Kang Z, Pan HQ, Hoi SCH, Xu ZL. Robust graph learning from noisy data. IEEE Trans. on Cybernetics, 2020, 50(5): 1833–1843. [doi:
10.1109/TCYB.2018.2887094]
[5] Chen JY, Zhou JJ, Shen SJ, Zheng HB, Xuan Q. Research of adversarial attack method in face recognition system. Journal of Chinese
Computer Systems, 2019, 40(8): 1723–1728 (in Chinese with English abstract). [doi: 10.3969/j.issn.1000-1220.2019.08.028]
[6] Blachnik M, Kordos M. Comparison of instance selection and construction methods with various classifiers. Applied Sciences, 2020,
10(11): 3933. [doi: 10.3390/app10113933]
[7] Song H, Kim M, Park D, Shin Y, Lee JG. Learning from noisy labels with deep neural networks: A survey. IEEE Trans. on Neural
Networks and Learning Systems, 2023, 34(11): 8135–8153. [doi: 10.1109/TNNLS.2022.3152527]
[8] Guo YQ, Wang WJ. A robust adaptive linear regression method for severe noise. Knowledge and Information Systems, 2023, 65(11):
4613–4653. [doi: 10.1007/s10115-023-01924-4]

