Page 67 - 《软件学报》2026年第5期
P. 67

1946                                                       软件学报  2026  年第  37  卷第  5  期


                  3.5   消融实验分析
                    为了验证    CTRH  模型中所提出的每个模块的有效性, 本文在             MirFlickr 和  NUS-WIDE  数据集中  4  种不同哈希
                 码长度的情况下进行了消融实验. 表           4  和表  5  分别展示了  mAP@5000  和  mAP@all 的性能指标   (所有方法均使用
                 AlexNet 为主干网络, 最优结果已加粗表示). 其中, 第         1  行代表去除所有优化方法只保留哈希学习框架的结果. 第
                 2  行在其基础上增加了弱监督标签置换模块, 可见效果得到了明显的提升, 尤其在噪声较多的                           NUS-WIDE  以及哈
                 希码长度很小这样的极端情况下效果更为明显. 第                3  行在第  2  行的基础上增加了弱监督标签赋权模块, 通过进一
                 步优化对更新后标签的使用, 其准确率同样得到了提升. 第                 4  行是本文所提出的方法, 在第        3  行的基础上引入了平
                 衡损失, 有利于模型更好地学习困难样本.

                                       表 4 CTRH  模型添加不同模块后        mAP@5000  对比 (%)

                                            MirFlickr                            NUS-WIDE
                     方法
                               16 bits  32 bits   48 bits  64 bits   16 bits   32 bits  48 bits  64 bits
                   基准模型        64.99     73.53    74.25     75.58    34.52     65.85    69.15     70.01
                    增加TR       72.78     76.17    77.74     78.08    68.77     74.09    76.09     77.30
                    增加TW       77.89     81.74    82.63     82.09    77.58     77.62    78.04     79.83
                    CTRH       78.80     82.66    83.33     82.98    78.19     78.50    78.98     80.61


                                        表 5 CTRH  模型添加不同模块后        mAP@all 对比 (%)

                                            MirFlickr                            NUS-WIDE
                     方法
                               16 bits  32 bits   48 bits  64 bits   16 bits   32 bits  48 bits  64 bits
                   基准模型        63.60     68.01    68.32     69.52    34.00     58.23    58.97     59.22
                    增加TR       68.90     70.12    71.25     71.64    61.96     62.86    63.67     64.75
                    增加TW       71.62     73.17    74.85     74.62    67.02     66.89    67.64     68.23
                    CTRH       72.21     74.03    75.38     75.37    67.79     67.63    68.49     68.96

                    为了分析    CTRH  的参数敏感性, 本文使用       48 bits 长度的哈希码分别在      MirFlickr 和  NUS-WIDE  数据集上对
                                                         λ 4  的取值进行分析, 如图   9                   α = 0.5 时,
                 插值系数   α、边界参数     ε 和标签平衡损失比例参数                              所示. 其中, 当插值系数
                 在  MirFlickr 数据集中效果最好, 这说明了微调过程中学到的新知识和原始的知识同样重要. 而对于噪声更大的
                 NUS-WIDE  数据集而言, 则    α = 0.25 效果更好. 这说明在   NUS-WIDE  数据集中进行微调时, 过多的噪声标签不仅
                 没有使得    CLIP  更加适应下游数据, 反而破坏了         CLIP  模型中原有的视觉语言知识. 当铰链损失中边界值               ε = 0.7
                 时, 在  MirFlickr 数据集中效果最好. 而对于噪声更大的        NUS-WIDE  数据集则需要当      ε = 0.9 时效果最好. 在对损失
                 函数超参数的探讨中, 本文这里只对新引入标签平衡损失的超参数                     λ 4  的取值进行实验. 当   λ 4 = 15 时在两个数据集
                 中的总体效果最好.

                     0.84                         0.84                        0.84
                    mAP@5000  0.80               mAP@5000  0.80              mAP@5000  0.80
                                                                              0.82
                     0.82
                                                  0.82
                                                                              0.78
                     0.78
                                                  0.78
                     0.76                         0.76                        0.76
                          0  0.25  0.50  0.75  1.00   0.6  0.7  0.8  0.9  1.0      0   5   10  15  20
                                超参数                          超参数                         超参数    4
                                                        MirFlickr  NUS-WIDE
                                                     图 9 消融实验结果

                    为了分析    CTRH  在不同主干网络上的性能, 除了        AlexNet, 本文还进行了更先进的主干网络实验, 包括          ResNet-50、
                 ViT-B-16 和  CLIP (ViT-B-32) 的视觉编码器. 对于 ResNet-50 和 ViT-B-16, 我们在训练过程中进行了端到端微调,
                 以便更好地适配当前任务; 而对于 CLIP, 我们采用了部分参数冻结的方式, 仅微调其投影层, 以保留其语义知识.
   62   63   64   65   66   67   68   69   70   71   72