Page 67 - 《软件学报》2026年第5期
P. 67
1946 软件学报 2026 年第 37 卷第 5 期
3.5 消融实验分析
为了验证 CTRH 模型中所提出的每个模块的有效性, 本文在 MirFlickr 和 NUS-WIDE 数据集中 4 种不同哈希
码长度的情况下进行了消融实验. 表 4 和表 5 分别展示了 mAP@5000 和 mAP@all 的性能指标 (所有方法均使用
AlexNet 为主干网络, 最优结果已加粗表示). 其中, 第 1 行代表去除所有优化方法只保留哈希学习框架的结果. 第
2 行在其基础上增加了弱监督标签置换模块, 可见效果得到了明显的提升, 尤其在噪声较多的 NUS-WIDE 以及哈
希码长度很小这样的极端情况下效果更为明显. 第 3 行在第 2 行的基础上增加了弱监督标签赋权模块, 通过进一
步优化对更新后标签的使用, 其准确率同样得到了提升. 第 4 行是本文所提出的方法, 在第 3 行的基础上引入了平
衡损失, 有利于模型更好地学习困难样本.
表 4 CTRH 模型添加不同模块后 mAP@5000 对比 (%)
MirFlickr NUS-WIDE
方法
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
基准模型 64.99 73.53 74.25 75.58 34.52 65.85 69.15 70.01
增加TR 72.78 76.17 77.74 78.08 68.77 74.09 76.09 77.30
增加TW 77.89 81.74 82.63 82.09 77.58 77.62 78.04 79.83
CTRH 78.80 82.66 83.33 82.98 78.19 78.50 78.98 80.61
表 5 CTRH 模型添加不同模块后 mAP@all 对比 (%)
MirFlickr NUS-WIDE
方法
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
基准模型 63.60 68.01 68.32 69.52 34.00 58.23 58.97 59.22
增加TR 68.90 70.12 71.25 71.64 61.96 62.86 63.67 64.75
增加TW 71.62 73.17 74.85 74.62 67.02 66.89 67.64 68.23
CTRH 72.21 74.03 75.38 75.37 67.79 67.63 68.49 68.96
为了分析 CTRH 的参数敏感性, 本文使用 48 bits 长度的哈希码分别在 MirFlickr 和 NUS-WIDE 数据集上对
λ 4 的取值进行分析, 如图 9 α = 0.5 时,
插值系数 α、边界参数 ε 和标签平衡损失比例参数 所示. 其中, 当插值系数
在 MirFlickr 数据集中效果最好, 这说明了微调过程中学到的新知识和原始的知识同样重要. 而对于噪声更大的
NUS-WIDE 数据集而言, 则 α = 0.25 效果更好. 这说明在 NUS-WIDE 数据集中进行微调时, 过多的噪声标签不仅
没有使得 CLIP 更加适应下游数据, 反而破坏了 CLIP 模型中原有的视觉语言知识. 当铰链损失中边界值 ε = 0.7
时, 在 MirFlickr 数据集中效果最好. 而对于噪声更大的 NUS-WIDE 数据集则需要当 ε = 0.9 时效果最好. 在对损失
函数超参数的探讨中, 本文这里只对新引入标签平衡损失的超参数 λ 4 的取值进行实验. 当 λ 4 = 15 时在两个数据集
中的总体效果最好.
0.84 0.84 0.84
mAP@5000 0.80 mAP@5000 0.80 mAP@5000 0.80
0.82
0.82
0.82
0.78
0.78
0.78
0.76 0.76 0.76
0 0.25 0.50 0.75 1.00 0.6 0.7 0.8 0.9 1.0 0 5 10 15 20
超参数 超参数 超参数 4
MirFlickr NUS-WIDE
图 9 消融实验结果
为了分析 CTRH 在不同主干网络上的性能, 除了 AlexNet, 本文还进行了更先进的主干网络实验, 包括 ResNet-50、
ViT-B-16 和 CLIP (ViT-B-32) 的视觉编码器. 对于 ResNet-50 和 ViT-B-16, 我们在训练过程中进行了端到端微调,
以便更好地适配当前任务; 而对于 CLIP, 我们采用了部分参数冻结的方式, 仅微调其投影层, 以保留其语义知识.

