Page 68 - 《软件学报》2026年第5期
P. 68
李泽超 等: 基于 CLIP 引导标签优化的弱监督图像哈希 1947
表 6 和表 7 分别展示了 mAP@5000 和 mAP@all 的性能指标 (最优结果已加粗表示). 结果表明, 本文方法在更强
主干网络的支持下取得了进一步性能提升, 同时也验证了所提方法在不同视觉编码器下的通用性与鲁棒性.
表 6 CTRH 在两个数据集上使用不同主干网络的 mAP@all (%)
MirFlickr NUS-WIDE
主干网络
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
AlexNet 72.21 74.03 75.38 75.37 67.79 67.63 68.49 68.96
ResNet-50 74.11 76.73 78.09 77.51 66.02 65.44 67.49 68.34
ViT-B-16 76.60 77.13 77.69 77.81 61.81 65.56 66.93 68.14
CLIP (ViT-B-32) 79.79 78.06 78.96 80.82 67.57 69.91 69.41 68.35
表 7 CTRH 在两个数据集上使用不同主干网络的 mAP@5000 (%)
MirFlickr NUS-WIDE
主干网络
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
AlexNet 78.80 82.66 83.33 82.98 78.19 78.50 78.98 80.61
ResNet-50 84.50 86.30 87.89 87.85 78.46 79.91 80.81 81.75
ViT-B-16 87.97 88.28 88.38 88.02 77.98 80.63 81.70 82.13
CLIP (ViT-B-32) 88.17 86.76 87.34 89.26 80.50 81.54 81.86 82.50
为了分析 CTRH 在不同预训练多模态基础模型上的性能, 除了 CLIP 外, 本文还尝试使用 OpenCLIP, 在 MirFlickr
和 NUS-WIDE 数据集上进行实验. 实验结果如表 8 和表 9 所示 (最优结果已加粗表示). 实验结果表明, CLIP 在不
同哈希码长度下依然取得更优的 mAP 性能, 整体表现优于 OpenCLIP, 展现出更强的稳定性和鲁棒性. 我们认为,
这一现象的主要原因在于: CTRH 所面向的是弱监督多标签图文哈希检索场景, 其中标签信息稀疏、语义噪声大,
这可能使得 OpenCLIP 在大规模语义分布预训练中学到的泛化特征未能充分发挥优势. 相比之下, CLIP 在图文对
齐上的特性更稳定, 对语义噪声更具鲁棒性, 因此在此类任务中仍具有优势. 综上所述, 采用 CLIP 模型是一个合
理且有效的选择, 能够很好支撑本文所提出的哈希学习框架.
表 8 CTRH 在两个数据集上使用不同预训练多模态基础模型的 mAP@all (%)
MirFlickr NUS-WIDE
VL模型
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
CLIP 72.21 74.03 75.38 75.37 67.79 67.63 68.49 68.96
OpenCLIP 70.60 72.32 72.77 73.17 64.25 66.17 66.71 66.64
表 9 CTRH 在两个数据集上使用不同预训练多模态基础模型的 mAP@5000 (%)
MirFlickr NUS-WIDE
VL模型
16 bits 32 bits 48 bits 64 bits 16 bits 32 bits 48 bits 64 bits
CLIP 78.80 82.66 83.33 82.98 78.19 78.50 78.98 80.61
OpenCLIP 77.25 79.22 80.03 80.34 73.11 75.42 76.71 77.27
4 总 结
本文提出了一种 CLIP 引导标签优化的弱监督哈希方法, 通过挖掘 CLIP 蕴含的丰富的多模态知识对用户标
签进行优化, 从而增强图像与文本的联合表示, 并进一步地引导哈希模型生成具有高判别性的哈希码. 为缓解噪声
标签对模型性能的影响, 本文设计了一个弱监督标签置换模块, 通过微调 CLIP 并融合预训练参数来进行推理, 生
成和图像内容一致的文本标签. 进一步地, 本文引入了弱监督标签赋权模块, 利用多头自注意力机制实现优化标签
和图像的全局交互, 有效提升联合表示的表征能力. 针对文本标签分布不均的问题, 本文设计了标签平衡损失, 通
过动态加权策略加强对尾类样本的学习. 最后, 本文联合引入相似性保留损失、铰链损失和量化损失, 进一步引导

