Page 115 - 《软件学报》2026年第4期
P. 115

1556                                                       软件学报  2026  年第  37  卷第  4  期


                 型训练和测试这      4  个部分. 首先, 使用  ResNet50  深度网络提取每张图像的特征. 然后, 使用          EIF  和  PIC  对训练集进
                 行数据过滤或标签校正. 最后, 使用过滤或校正后的数据集训练                   CART  和  GPR  回归模型. 为了获取稳定的实验结
                 果, 标签清洗以及训练和测试步骤重复           5 轮. 每轮训练的时间不超过       10 min. 测试误差由平均绝对误差       (mean absolute
                 error, MAE) 度量:

                                                         1  ∑ n
                                                   MAE =      |m(x i )−y i |                         (19)
                                                         n   i=1
                    为了更充分地比较不同算法, 实验构造了              3  个不同难度的测试集, 它们分别包含所有的测试集样本、不过滤
                 情况下   MAE  大于  5  和  10  的样本. 表  4  列出了  3  种测试集上的不同模型的   MAE  和配对  t 检验的  p  值. 结果表明,
                 与  NoF  相比, PIC  在所有情况下均能降低模型测试误差. t 检验的           p  值均小于  0.05, 说明与  NoF  和  EIF  相比, PIC
                 可以显著降低各种回归模型的测试误差.


                                                表 4 年龄数据集测试误差比较

                                                      测试误差                              配对t检验的p值
                     对比样本集         模型    样本量                         误差减小比例 (%)
                                                 NoF    EIF    PIC                  PIC vs. NoF  PIC vs. EIF
                                  CART    7 108  13.37  12.75  12.41      7.16         0.000     0.026
                       全部
                                   GPR    7 108  13.52  13.43  8.79      35.01         0.000     0.000
                                  CART    4 992  18.01  14.48  13.89     22.85         0.000     0.005
                          MAE>5
                                   GPR    5 851  15.83  14.74  9.63      39.15         0.000     0.000
                   NoF
                                  CART    3 508  22.46  16.21  15.36     31.59         0.000     0.000
                         MAE>10
                                   GPR    4 270  18.90  17.41  10.71     43.33         0.000     0.000
                 注: 测试误差的加粗数字表示最小值, t检验的加粗数字表示p值小于0.05, NoF表示未对训练集做处理

                    表  5  列出了一些图像与原始标签不匹配的示例. 左侧部分表示原始标签比图像表观的年龄偏大, 右侧部分表
                 示原始标签比图像表观的年龄偏小. 这些图像按照差值升序排序. PIC                    对列出的每张图像给出一个校正后的标签.
                 相比于原始标签, PIC    校正后的标签更符合表观年龄.


                                                  表 5 校正的年龄标签噪声

                   No.    图像       原始标签      校正标签      偏差      No.    图像       原始标签      校正标签      偏差
                   1                 61       54.64     ↑       6                27       35.41     ↓


                   2                 67       59.74     ↑       7                18       26.96     ↓


                   3                 76       68.57     ↑       8                17       26.02     ↓


                   4                 61       52.91     ↑       9                24       33.19     ↓


                   5                 67        55.8     ↑      10                23       33.06     ↓


                  4.2.2    视线估计
                    根据人眼的注视方向可以判断一个人的心理是否健康. 使用人工智能技术预测人眼的视线为心理学研究提供
                 了高效的途径, 引起了计算机视觉领域研究人员的极大关注. MPIIGaze 数据集是视线估计任务中被广泛使用的数
                 据集之一. 它包含了从      15  名受试者在数月内的日常生活中收集的             213 659  张照片. 每幅图像的视线标签由偏航角
                 和俯仰角共同组成一个平面单位向量. 然而, 由于个体差异和环境条件等因素, 可能存在标注信息与实际注视方向
   110   111   112   113   114   115   116   117   118   119   120