Page 62 - 《软件学报》2026年第5期
P. 62
李泽超 等: 基于 CLIP 引导标签优化的弱监督图像哈希 1941
F r ∈ R 1×50×512 :
特征
F r = mean(F o ⊙expand(w)) (7)
通过对原始的融合 F o 去除受各类别影响的冗余特征 F r 可以得到新的融合表征 F n :
F n = F o −expand(F r ) (8)
F n ∈ R 1×50×C×512 进行推理, 可以减少显著标签对其他标签的影响. 本文对融合表
利用上述得到的新的融合表征
征的图像维度和特征维度求均值, 利用 F n ∈ R 1×C 预测, 取分数最高的前 K 个标签作为最后的置换标签. 如图 3 中
绿色区域所示, 重新推理后得到的标签中不会出现某些显著类别预测概率分数很高但其他类别都很低的情况, 这
也使得与图片内容相关的非显著类同样可以被提取.
2.4 弱监督标签赋权模块
弱监督标签赋权模块采用 Transformer 模型中的多头自注意力机制来捕获图像和优化标签之间的全局依赖关
系. 本文首先将哈希码通过重构层将其映射为 512 v:
维的特征
v = f re (h) (9)
其中, f re (·) 表示重构层. 同时, 利用融合权重后的 CLIP 文本编码器将优化后的标签转化为 512 维的文本特征 t:
text
t = CLIP (T) (10)
Q
K
其中, CLIP text 表示为 CLIP 的文本编码器. 对于 MSA 中的每个头 φ ∈ {1,2,...,h}, 都有 3 个权重矩阵 W 、 W 、 W φ V
φ
φ
Q φ 、
用于计算 K φ 和 V φ :
Q
K
V
Q φ = W v, K φ = W t, V φ = W t (11)
φ
φ
φ
接着利用缩放点积注意力得到相似度分数并和 V φ 相乘得到如下表示 Z φ :
T
Q φ K
φ
Z φ = Softmax √ V φ (12)
d k
√
其中, d k 是缩放因子用来避免梯度消失或者梯度爆炸的问题, d k 是 K φ 的维度. 将所有头的输出拼接在一起并通
过一个线性层得到输出特征 Z, 计算表达式为:
(13)
Z = Concat(Z 1 ,Z 2 ,...,Z h )W 0
其中, W 0 表示线性层的权重矩阵. 为了增强局部特征和非线性表达能力, 这里使用一个前馈网络进一步处理和转
∗
换输出的特征, 并进行残差连接得到最终的文本表示 t :
∗
t = Z +FFN(Z) (14)
其中, FFN 表示前馈网络, 主要包括两个全连接层、一个激活层和一个 Dropout 层. 第 1 个全连接层将 512 维的文
本特征扩展到更高的维度, 为激活函数提供更多非线性变换的可能. 激活层采用 ReLU 激活函数引入非线性, 增加
模型的表达能力. Dropout 层可以提高模型的泛化能力.
2.5 哈希学习模块
为了学习具有判别性的哈希码, 本文利用量化损失、铰链损失和相似性保留损失保留文本特征中蕴含的丰富
的 CLIP 的预训练多模态知识. 此外, 引入标签平衡损失用来缓解标签不平衡问题.
(1) 量化损失. 该损失通过约束哈希码的每位接近于 0.5, 使得模型输出的值近似二值化, 计算表达式如下所示:
1
N b ∑
L q = ∥h i −0.5I∥ 2 (15)
L 2
i=1
其中, h i 表示图像 x i 的哈希码, N b 表示最小批次的大小, L 代表哈希码中的比特数量, I 是与哈希码同维度的全 1
向量. 量化损失的意义在于确保连续特征在二值化时尽量保留语义信息. 同时, 引导模型稳定优化, 避免二值化带
来梯度消失的问题.
(2) 铰链损失. 该损失的作用是通过在高维特征空间对齐公式 (14) 中文本表示 t 和公式 (9) 中哈希码重构的
∗
图像表示 v 来增强哈希码的判别能力. 该损失的计算表达式如下所示:

