Page 59 - 《软件学报》2026年第5期
P. 59
1938 软件学报 2026 年第 37 卷第 5 期
像特征, 并使用 Word2Vec 模型 [20] 提取文本特征作为弱监督信号. 其中, 最早提出的方法是基于标签嵌入的弱监督
图像深度哈希 (weakly supervised deep image hashing through tag embedding, WDHT) 方法 [11] . 该方法平等地对待每
个文本标签, 使用平均聚合标签向量作为弱监督信号, 然而该策略容易受到噪声标签的干扰, 影响模型性能. 基于
掩蔽视觉语义图推理 (masked visual-semantic graph-based reasoning, MGRN) 的方法 [12] 通过构建视觉-语义图, 并训
练图神经网络预测随机遮蔽的标签, 从而以自监督方式学习图像与标签的联合表示. 尽管在性能上有所提升, 但该
方法需处理复杂的图结构信息, 导致计算开销显著增加. 基于迭代标签优化的深度增强弱监督哈希 (deep enhanced
weakly-supervised hashing with iterative tag refinement, EWSH) 方法 [13] 根据图像内容对用户提供的标签进行优化,
以获得更为准确的弱监督信息. 然而, 该方法在优化过程中未充分考虑图像与标签之间的模态交互, 限制了模型对
跨模态语义关联的挖掘能力. 基于重构跨模态注意力的弱监督哈希 (weakly supervised hashing with reconstructive
cross-modal attention, WSHRCA) 方法 [14] 则通过哈希码重构图像特征, 以显式更新哈希表示, 同时引入跨模态注意
力机制优化特征学习. 该方法在一定程度上提升了性能, 并降低了噪声标签的影响. 但其对噪声标签的处理仍较为
有限, 仅通过削弱权重因子进行调整, 哈希学习过程仍可能受噪声干扰.
1.2 预训练多模态基础大模型
最近几年, 预训练多模态基础大模型取得了显著进展. 通过联合训练大规模图像与文本数据, 这类视觉-语言
模型在图像理解、文本生成、跨模态检索等多种任务中展现出卓越性能 [21,22] . 其中, ViLT (vision-and-language
Transformer) [15] 是一种基于 Transformer [23] , 用于自监督学习的视觉和语言交互式模型. 该模型无需依赖卷积神经
网络或区域级监督, 直接通过最大似然估计优化图像与文本的跨模态匹配关系, 从而学习到通用且高质量的多模
态表示. UNITER (universal image-text representation learning) [16] 采用条件掩蔽策略, 增强视觉与语言之间的对齐效
果, 并设计了 4 种预训练任务, 从不同角度挖掘多模态关联性, 提升表示能力. OSCAR (object-semantics aligned pre-
training) [17] 则引入目标检测器提取图像中的对象标签作为额外语义信息, 结合对比学习与负采样策略, 进一步加强
图像与文本之间的语义关联. CLIP [18] 则采用大规模对比学习框架, 将图像与文本嵌入映射到统一语义空间中, 从
而实现高效的跨模态语义对齐. 由于其训练不依赖下游任务的标签, CLIP 具备强大的零样本迁移能力, 能够广泛
适用于多种下游任务. 受此启发, 本文引入 CLIP 所蕴含的多模态先验知识与跨模态对齐能力, 对用户提供的弱标
签进行优化与补全, 增强联合表示的语义表达能力, 从而提升哈希检索的性能.
2 本文所提方法
本文所提的 CTRH 方法主要包含弱监督标签置换模块、弱监督标签赋权模块和哈希学习模块, 下面具体介
绍相关内容.
2.1 问题描述
S tr =
在弱监督哈希图像检索任务中, 通常将数据集划分为训练集、数据库集和查询集. 假设训练集记为
i
{(x i ,T i )|i = 1,...,N tr }, 其中 x i 表示第 张图片, N tr 为训练集中图像的总数, T i 表示与 x i 相关联的弱监督文本标签, 由
网络用户提供. 具体地, T i = [T i1 ,...,T iC ], 这里 C 表示图像 x i 所关联的文本标签数量. 数据库集和查询集分别表示
为 S db = {(x i ,y i )|i = 1,...,N db } 和 S q = {(x i ,y i )|i = 1,...,N q }, 其中 y i 表示图像 x i 的真值标签, N db 和 N q 分别为数据库集
和查询集中的图像数量.
给定图像 x i , 本文利用编码器抽取图像特征, 并通过哈希映射得到对应的哈希码, 表示为:
h i = σ( f hash (Encoder(x i ))) (1)
其中, Encoder 为编码器主干网络, f hash (·) 表示哈希层将高维特征投影到低维哈希空间, σ(·) 表示 Sigmoid 激活函
L
数, h i ∈ R 表示长度为 L 的哈希码.
2.2 CTRH 的总体框架图
CTRH 的整体框架如图 1 所示, 主要包括 3 个模块: 弱监督标签置换、弱监督标签赋权和哈希学习. 在标签置

