Page 58 - 《软件学报》2026年第5期
P. 58

李泽超 等: 基于   CLIP  引导标签优化的弱监督图像哈希                                                1937


                 designed,  which  dynamically  reweights  hard  samples  to  enhance  the  model’s  representation  learning.  Experiments  on  two  general  datasets,
                 MirFlickr and NUS-WIDE, verify the effectiveness of the proposed method compared to state-of-the-art approaches.
                 Key words:  image retrieval; weakly supervised hashing; multimodal pre-trained foundation model; tag refinement

                    在当今信息爆炸的时代, 图像作为信息传递的重要媒介, 广泛分布于社交媒体, 商业网站以及科研数据库等各
                 类平台, 催生了海量的图像数据. 如何从这些海量图像中高效并且精准地检索到与用户需求最相关的内容, 已成为
                 计算机视觉、信息检索和人工智能领域的热点研究方向之一                     [1] .
                    图像检索旨在根据用户输入的查询图像, 从数据库中检索出与之相关的图像. 其中, 哈希技术因其能将高维度
                 数据转换为低维度的二值哈希码, 在降低存储和计算成本方面表现突出, 被广泛应用于图像检索任务中                                [2] . 近年来,
                 深度学习技术的发展推动了深度哈希方法的广泛研究                  [3−6] , 通过端到端的特征学习与哈希编码联合优化, 有效提升
                 了检索性能. 然而, 深度哈希方法通常依赖大规模的人工标注数据, 获取成本高昂, 限制了其实用性. 为此, 研究者
                 提出了多种无监督深度哈希方法            [7−10] , 虽然无需依赖标签, 但由于缺乏语义引导, 模型学习到的哈希码判别能力
                 有限.
                    为缓解上述问题, 已有研究        [11−14] 尝试利用网络用户提供的文本标签作为弱监督信息进行模型训练. 这类标签
                 在一定程度上蕴含图像的语义内容, 有助于降低对精确人工标注的依赖, 并提升检索性能. 然而, 由于这些标签往
                 往包含与图像内容相关性较低的噪声信息, 限制了模型的检索性能. 为了降低噪声标签的影响, Wang                             等人  [13] 提出
                 对用户标签进行优化, 通过最小化图像与其标签嵌入之间相似性矩阵的负迹值, 迭代式地将与图像具有最大相似
                 性的标签加入当前标签集合, 同时从集合中移除相似性最小的标签. 由于没有考虑图像和文本之间的交互, 限制了
                 文本标签优化的质量. 此外, Du       等人  [14] 通过注意力机制来学习图像和文本之间的关联, 对噪声标签赋值较低的权
                 重, 并通过加权得到联合表示来引导图像哈希码的学习. 这些方法虽然获得了一定的性能提升, 但是并不能有效地
                 解决噪声标签问题, 使得学习到的联合表示是次优的.
                    近年来, 预训练多模态基础模型           [15−18] 被广泛用于跨模态检索、视觉问答、分类等任务. 其中, contrastive
                 language-image pretraining (CLIP) 模型  [18] 因其出色的图像-文本对齐能力而备受关注. CLIP   基于从互联网收集的
                 4  亿对图文数据进行训练, 所学得的多模态表示融合了丰富的视觉概念和语言语义知识. 受此启发, 本文充分挖掘
                 CLIP  蕴含的多模态知识与跨模态对齐能力, 对用户提供的文本进行重标注与语义补全, 并结合优化后的文本集,
                 通过多模态交互机制增强图文联合表示的语义表达能力.
                    为此, 本文提出了一种基于         CLIP  引导标签优化的哈希模型       (CLIP-guided tag refinement hashing, CTRH). 该方
                 法充分利用    CLIP  所蕴含的视觉语义知识以及跨模态理解能力, 来引导弱监督标签的优化和哈希学习过程. CTRH
                 方法由   3  个核心部分组成: 弱监督标签置换模块、弱监督标签赋权模块和标签平衡损失. 弱监督标签置换模块通
                 过微调   CLIP  模型并融合其预训练模型参数, 实现对图像标签的推理, 通过图像与标签库之间的相似性匹配, 生成
                 更为准确的标签集合. 弱监督标签赋权模块将主干网络提取到的图像特征与                         CLIP  文本编码器得到的文本特征映
                 射到统一特征空间, 以增强图像与文本之间的交互, 从而获得更加丰富的多模态联合表示. 由于用户文本标签分布
                 不均匀, 本文引入了标签平衡损失通过对样本对动态加权, 使得模型更加关注尾部类标签的学习. 在哈希学习部
                 分, 利用相似性保留损失、铰链损失和量化损失, 引导哈希码有效捕获联合特征蕴含的语义知识. 为了验证所提方
                 法的有效性, 在     MirFlickr 和  NUS-WIDE  两个通用数据集上与多种先进方法进行了对比实验. 实验结果表明,
                 CTRH  在检索性能方面均取得了提升, 充分验证了其在弱监督哈希检索任务中的优越性.

                  1   相关工作

                    本文从弱监督哈希学习和预训练多模态基础大模型进行相关研究工作的介绍.
                  1.1   弱监督深度哈希学习
                    弱监督深度哈希方法通过使用网络用户提供的弱监督标签, 既有效降低了人工标注成本, 又在图像检索任务
                 中取得了良好的性能. 目前, 较新的弱监督深度哈希图像检索方法通常采用诸如                          AlexNet [19] 等深度模型来提取图
   53   54   55   56   57   58   59   60   61   62   63