Page 59 - 《软件学报》2026年第5期
P. 59

1938                                                       软件学报  2026  年第  37  卷第  5  期


                 像特征, 并使用    Word2Vec 模型  [20] 提取文本特征作为弱监督信号. 其中, 最早提出的方法是基于标签嵌入的弱监督
                 图像深度哈希     (weakly supervised deep image hashing through tag embedding, WDHT) 方法  [11] . 该方法平等地对待每
                 个文本标签, 使用平均聚合标签向量作为弱监督信号, 然而该策略容易受到噪声标签的干扰, 影响模型性能. 基于
                 掩蔽视觉语义图推理       (masked visual-semantic graph-based reasoning, MGRN) 的方法  [12] 通过构建视觉-语义图, 并训
                 练图神经网络预测随机遮蔽的标签, 从而以自监督方式学习图像与标签的联合表示. 尽管在性能上有所提升, 但该
                 方法需处理复杂的图结构信息, 导致计算开销显著增加. 基于迭代标签优化的深度增强弱监督哈希                               (deep enhanced
                 weakly-supervised hashing with iterative tag refinement, EWSH) 方法  [13] 根据图像内容对用户提供的标签进行优化,
                 以获得更为准确的弱监督信息. 然而, 该方法在优化过程中未充分考虑图像与标签之间的模态交互, 限制了模型对
                 跨模态语义关联的挖掘能力. 基于重构跨模态注意力的弱监督哈希                      (weakly supervised hashing with reconstructive
                 cross-modal attention, WSHRCA) 方法  [14] 则通过哈希码重构图像特征, 以显式更新哈希表示, 同时引入跨模态注意
                 力机制优化特征学习. 该方法在一定程度上提升了性能, 并降低了噪声标签的影响. 但其对噪声标签的处理仍较为
                 有限, 仅通过削弱权重因子进行调整, 哈希学习过程仍可能受噪声干扰.
                  1.2   预训练多模态基础大模型

                    最近几年, 预训练多模态基础大模型取得了显著进展. 通过联合训练大规模图像与文本数据, 这类视觉-语言
                 模型在图像理解、文本生成、跨模态检索等多种任务中展现出卓越性能                          [21,22] . 其中, ViLT (vision-and-language
                 Transformer) [15] 是一种基于  Transformer [23] , 用于自监督学习的视觉和语言交互式模型. 该模型无需依赖卷积神经
                 网络或区域级监督, 直接通过最大似然估计优化图像与文本的跨模态匹配关系, 从而学习到通用且高质量的多模
                 态表示. UNITER (universal image-text representation learning) [16] 采用条件掩蔽策略, 增强视觉与语言之间的对齐效
                 果, 并设计了   4  种预训练任务, 从不同角度挖掘多模态关联性, 提升表示能力. OSCAR (object-semantics aligned pre-
                 training) [17] 则引入目标检测器提取图像中的对象标签作为额外语义信息, 结合对比学习与负采样策略, 进一步加强
                 图像与文本之间的语义关联. CLIP         [18] 则采用大规模对比学习框架, 将图像与文本嵌入映射到统一语义空间中, 从
                 而实现高效的跨模态语义对齐. 由于其训练不依赖下游任务的标签, CLIP                     具备强大的零样本迁移能力, 能够广泛
                 适用于多种下游任务. 受此启发, 本文引入            CLIP  所蕴含的多模态先验知识与跨模态对齐能力, 对用户提供的弱标
                 签进行优化与补全, 增强联合表示的语义表达能力, 从而提升哈希检索的性能.
                  2   本文所提方法


                    本文所提的     CTRH  方法主要包含弱监督标签置换模块、弱监督标签赋权模块和哈希学习模块, 下面具体介
                 绍相关内容.
                  2.1   问题描述
                                                                                                     S tr =
                    在弱监督哈希图像检索任务中, 通常将数据集划分为训练集、数据库集和查询集. 假设训练集记为
                                            i
                 {(x i ,T i )|i = 1,...,N tr }, 其中  x i  表示第   张图片,  N tr  为训练集中图像的总数,   T i  表示与  x i  相关联的弱监督文本标签, 由
                 网络用户提供. 具体地,      T i = [T i1 ,...,T iC ], 这里   C  表示图像  x i  所关联的文本标签数量. 数据库集和查询集分别表示
                 为   S db = {(x i ,y i )|i = 1,...,N db } 和  S q = {(x i ,y i )|i = 1,...,N q }, 其中   y i  表示图像  x i  的真值标签,  N db  和  N q  分别为数据库集
                 和查询集中的图像数量.
                    给定图像    x i , 本文利用编码器抽取图像特征, 并通过哈希映射得到对应的哈希码, 表示为:

                                                   h i = σ( f hash (Encoder(x i )))                   (1)
                 其中,  Encoder  为编码器主干网络,    f hash (·) 表示哈希层将高维特征投影到低维哈希空间,          σ(·) 表示  Sigmoid  激活函
                        L
                 数,  h i ∈ R  表示长度为  L  的哈希码.
                  2.2   CTRH  的总体框架图
                    CTRH  的整体框架如图      1  所示, 主要包括  3  个模块: 弱监督标签置换、弱监督标签赋权和哈希学习. 在标签置
   54   55   56   57   58   59   60   61   62   63   64