Page 115 - 《软件学报》2026年第4期
P. 115
1556 软件学报 2026 年第 37 卷第 4 期
型训练和测试这 4 个部分. 首先, 使用 ResNet50 深度网络提取每张图像的特征. 然后, 使用 EIF 和 PIC 对训练集进
行数据过滤或标签校正. 最后, 使用过滤或校正后的数据集训练 CART 和 GPR 回归模型. 为了获取稳定的实验结
果, 标签清洗以及训练和测试步骤重复 5 轮. 每轮训练的时间不超过 10 min. 测试误差由平均绝对误差 (mean absolute
error, MAE) 度量:
1 ∑ n
MAE = |m(x i )−y i | (19)
n i=1
为了更充分地比较不同算法, 实验构造了 3 个不同难度的测试集, 它们分别包含所有的测试集样本、不过滤
情况下 MAE 大于 5 和 10 的样本. 表 4 列出了 3 种测试集上的不同模型的 MAE 和配对 t 检验的 p 值. 结果表明,
与 NoF 相比, PIC 在所有情况下均能降低模型测试误差. t 检验的 p 值均小于 0.05, 说明与 NoF 和 EIF 相比, PIC
可以显著降低各种回归模型的测试误差.
表 4 年龄数据集测试误差比较
测试误差 配对t检验的p值
对比样本集 模型 样本量 误差减小比例 (%)
NoF EIF PIC PIC vs. NoF PIC vs. EIF
CART 7 108 13.37 12.75 12.41 7.16 0.000 0.026
全部
GPR 7 108 13.52 13.43 8.79 35.01 0.000 0.000
CART 4 992 18.01 14.48 13.89 22.85 0.000 0.005
MAE>5
GPR 5 851 15.83 14.74 9.63 39.15 0.000 0.000
NoF
CART 3 508 22.46 16.21 15.36 31.59 0.000 0.000
MAE>10
GPR 4 270 18.90 17.41 10.71 43.33 0.000 0.000
注: 测试误差的加粗数字表示最小值, t检验的加粗数字表示p值小于0.05, NoF表示未对训练集做处理
表 5 列出了一些图像与原始标签不匹配的示例. 左侧部分表示原始标签比图像表观的年龄偏大, 右侧部分表
示原始标签比图像表观的年龄偏小. 这些图像按照差值升序排序. PIC 对列出的每张图像给出一个校正后的标签.
相比于原始标签, PIC 校正后的标签更符合表观年龄.
表 5 校正的年龄标签噪声
No. 图像 原始标签 校正标签 偏差 No. 图像 原始标签 校正标签 偏差
1 61 54.64 ↑ 6 27 35.41 ↓
2 67 59.74 ↑ 7 18 26.96 ↓
3 76 68.57 ↑ 8 17 26.02 ↓
4 61 52.91 ↑ 9 24 33.19 ↓
5 67 55.8 ↑ 10 23 33.06 ↓
4.2.2 视线估计
根据人眼的注视方向可以判断一个人的心理是否健康. 使用人工智能技术预测人眼的视线为心理学研究提供
了高效的途径, 引起了计算机视觉领域研究人员的极大关注. MPIIGaze 数据集是视线估计任务中被广泛使用的数
据集之一. 它包含了从 15 名受试者在数月内的日常生活中收集的 213 659 张照片. 每幅图像的视线标签由偏航角
和俯仰角共同组成一个平面单位向量. 然而, 由于个体差异和环境条件等因素, 可能存在标注信息与实际注视方向

