Page 60 - 《软件学报》2026年第5期
P. 60
李泽超 等: 基于 CLIP 引导标签优化的弱监督图像哈希 1939
换模块中, 为增强 CLIP 对下游任务的适应能力, 本文使用下游数据对其进行微调, 并将微调后的参数与原始 CLIP
参数加权融合, 基于融合模型对图像进行标签推理, 以获得更准确的文本标签. 在标签赋权模块中, 使用 CLIP 文
本编码器提取标签语义特征, 并结合多头自注意力机制, 实现图像与文本特征的深度交互, 生成更具判别力的多模
态表示. 在哈希学习模块中, 设计了量化损失、相似性保留损失和铰链损失, 联合引导哈希码学习多模态语义信
息. 同时, 引入标签平衡损失, 通过动态调整样本对权重, 提升对尾部类别的关注度.
二值编码器 哈希学习模块 相似性保留损失
量化损失
图像 x i 铰链损失
标签平衡损失
10…01 512 维
… … … ᇗܒҪ
哈希码 48 bits 图像特征 V i
加权聚合
*
文本特征t i
Q
微调权重
θ finetune 新权重 512 维 K, V
CLIP 跨模态注
θ final 文本特征 t i 意力机制 弱监督标签权重
原始权重 0.5
0.4
θ zeroshot
0.3
*
A photo of 消除类间影响后重推理 T 0.2
T i : Babileta, Flores, Explore, Flower
0.1
a T i
0
ิൕൻೆ T i : Grass, Wood, Flower, Garden Grass Wood Flower Garden
*
弱监督标签置换模块 弱监督标签赋权模块
图 1 CTRH 的整体框架示意图
2.3 弱监督标签置换模块
在理解图像内容的基础上对噪音标签进行置换是弱监督哈希的关键. 基于此目的, 本文使用具有较好跨模态
理解能力的大规模视觉语言模型 CLIP 来引导这一过程. 本模块的流程大致可以分为以下几个步骤.
(1) 微调 CLIP 模型. 虽然 CLIP 模型拥有强大的零样本预测能力, 但为了使其更加适用下游任务, 本文首先对
CLIP 模型进行微调. 对于图像 x i 使用提示模版“A photo of a T i ”作为其对应的文本描述. 微调过程中, 本文设置较
小的学习率并且 10 轮训练后将学习率降低为原来的 0.1 倍, 以避免对预训练模型的权重做出过大的改动. 同时,
对大模型的训练过程采用混合精度来减少显存的使用并提高计算效率. 此外, 本文使用交叉熵损失对图像编码器
和文本编码器进行优化. 这里将微调后的权重记为 θ finetune , 原始权重记为 θ zeroshot .
(2) 权重融合. 在上述微调 CLIP 模型的过程中, 由于使用的是带有噪声的图片文本对, 若直接依赖该数据进行
训练, 可能会破坏 CLIP 原有的视觉-语义知识结构. 如图 2 所示, 虽然微调后的模型可以去除原始文本标签中较明
显的噪声标签, 但由于使用的数据集中的动植物图像带有“花园”“户外”等如图 2 中红色标注所示的文本, 微调后
的模型在推理阶段会更倾向于预测这些标签. 然而, 这些用户标签其实并不能很好地表示图像的内容. 相比之下,
若将微调后的权重与原始预训练权重进行融合后再进行推理, 则更容易获得如图 2 中绿色部分所示的, 更具语义
针对性的标签. 为此, 本文采用线性插值策略进行权重融合, 即以加权方式结合微调后的模型参数与原始 CLIP 预
训练参数, 具体表达式为:
(2)
θ final = (1−α)θ zeroshot +αθ finetune
其中, α 是插值系数可以控制模型权重的贡献比例. 适当的插值比例可以使得模型既能学习到新任务的特征, 又能
保留预训练模型原始的知识. 尤其是在弱监督任务中, 权重融合可以避免受到噪声标签的较大影响.
(3) 消除类间影响. 在推理阶段, 本文使用上述的融合权重 θ final 对图像标签进行预测, 并选择预测概率排名前

