Page 66 - 《软件学报》2026年第5期
P. 66
李泽超 等: 基于 CLIP 引导标签优化的弱监督图像哈希 1945
LSH SH ITQ WDHT MGRN EWSH WSHRCA CTRH
0.8 0.8
0.7 0.7 0.7 0.7
Precision 0.6 Precision 0.6 Precision 0.6 Precision 0.6
0.5
0.5
0.5
0.5
0.4 0.4 0.4 0.4
0 0.2 0.4 0.6 0.8 1.0 0 0.2 0.4 0.6 0.8 1.0 0 0.2 0.4 0.6 0.8 1.0 0 0.2 0.4 0.6 0.8 1.0
Recall Recall Recall Recall
(a) 16 bits (b) 32 bits (c) 48 bits (d) 64 bits
图 7 各方法在 NUS-WIDE 数据集上不同哈希码长度的 PR 曲线
查询 检索图像 top-10 的结果
图片
图 8 前 10 个检索结果的效果展示
除了对检索性能的定量分析外, 在哈希检索任务中, 时间与空间开销同样是衡量方法实用性的重要指标, 尤其
是在本文引入了弱监督标签置换和标签赋权等结构模块后, 需进一步验证其在实际检索过程中的效率表现. 值得
说明的是, 这些模块仅在训练阶段参与优化, 而在测试阶段, 模型仅保留轻量的哈希编码网络用于高效检索. 为评
估检索过程中的时间与空间效率, 本文在 MirFlickr 和 NUS-WIDE 两个数据集上分别测试了不同模型生成 64 bits
哈希码的平均时间和存储开销. 具体地, 我们对每个数据集中的所有图像进行了前向传播推理, 记录单张图像的平
均推理时间和最大显存使用, 结果如表 3 所示 (所有方法均使用 AlexNet 为主干网络, 最优结果已加粗表示). 从结
果中可以看出, CTRH 在推理阶段与其他深度弱监督哈希方法相比, 在时间和空间开销方面均未带来额外负担, 反
而在两个指标上略具优势. 这进一步说明, 本文提出的方法在保持检索效率的同时, 兼顾了计算资源的友好性.
表 3 CTRH 和其他方法在两个数据集上的平均时间和空间开销比较
MirFlickr (64 bits) NUS-WIDE (64 bits)
方法
时间开销 (ms) 空间开销 (MB) 时间开销 (ms) 空间开销 (MB)
WDHT 1.44 232.18 1.16 232.18
MGRN 1.37 229.05 1.11 229.05
EWSH 1.38 232.58 1.14 232.58
WSHRCA 1.40 228.89 1.13 228.89
CTRH 1.35 228.95 1.13 228.95

