Page 63 - 《软件学报》2026年第5期
P. 63
1942 软件学报 2026 年第 37 卷第 5 期
N b ∗ T ∗ T
t v
N b ∑ ∑ t v
j i i
L hinge = i (16)
max0,ε+
−
∗
∗
i=1 j=1,j,i
t
v i
t
v i
j
2 2 i 2 2
其中, ε 是边界参数用于控制匹配对和非匹配对之间的最小相似度差.
(3) 相似性保留损失. 该损失项旨在促使样本在哈希空间中保留其在文本语义空间中的相似性关系, 从而使生
成的哈希码能够有效表达原始文本的语言信息. 其具体表达式为:
∗ ∗T 2
t t
2 1 i j
L pair =
h i −h j
− 1−
(17)
N b ∑ N b ∑ 1
L 2 2
∗
∗
i=1 j=1
t
t
i
2
j 2
该损失促使样本在哈希空间的汉明距离与余弦距离具有相似的分布.
(4) 标签平衡损失. 由于文本标签分布不均匀, 导致模型更加倾向于拟合头部类标签. 为此, 本文引入标签平衡
损失通过对样本对动态加权, 使得模型更加关注尾部类标签的学习. 在正样本比例较低时赋予较高的权重, 同时使
模型更加聚焦于困难样本. 标签平衡损失计算表达式如下所示:
γ
∗ T
∗ T
1 m ∑ C ∑ t v t v
c i
c i
∗
L b = − βT 1−σ
logσ
(18)
m ic
∗
∗
i=1 c=1
t
v i
t
v i
c
c
2 2 2 2
其中, β 是平衡因子, C 是经过优化后的新标签集 T 中的类别数, T ic ∗ 表示图片 x i 在 T 中的独热标签向量, 参数 γ
∗
∗
作为调节因子用于调整对困难样本的关注程度, σ(·) 表示 Sigmoid 激活函数.
最终, 本文的总体目标函数如下所示:
(19)
L = λ 1 L q +λ 2 L hinge +λ 3 L pair +λ 4 L b
其中, λ 是各损失对应的权重因子.
3 实验分析
为了验证本文所提方法的有效性, 在弱监督图像检索领域常用的两个数据集 MirFlickr [24] 和 NUS-WIDE [25] 上
进行对比实验验证.
3.1 实验数据集介绍
MirFlickr 数据集包含了 25 000 张图片, 分为 38 个通用类别. 每张图片归属于一个或者多个类别, 并且包含了
不定数量的由用户提供的弱监督标签. 这些弱监督标签中较为常见的有 1 386 种, 模型在训练过程中只能使用用户
提供的弱监督标签, 对精细标注的 38 种真值标签是不可见的. 本文从中随机选取 2 000 张图片作为查询集, 其余
图片作为数据库集和训练集.
NUS-WIDE 数据集包含 269 498 张图片, 81 个通用类别. 与 MirFlickr 数据集相似, NUS-WIDE 数据集的每
张图片是多标签的, 并且拥有不定数量的弱监督标签. 本文选用了 81 个类别中最常见的 10 个类别, 总共包括
181 365 张图片. 从中随机选择 5 000 张图片作为查询集, 其余图片作为数据库集, 并从数据库集中选择 10 500 张图
片作为训练集.
3.2 评价指标和对比方法
为了评估所提方法的有效性, 本文与一些先进的方法进行对比. 这些方法包括 3 种无监督的方法 (LSH [26] 、
SH [27] 和 ITQ [28] ) 和 4 种近期最具有代表性的弱监督方法 (WDHT [11] 、MGRN [12] 、EWSH [13] 和 WSHRCA [14] ). 本文
采用了图像检索领域常用的 4 种评估方法: 前 5 000 个检索结果的平均精度 (mAP@5000)、所有检索结果的平均
精度 (mAP@all)、前 N 个返回值准确率曲线 (P@N) 和准确率回归曲线 (PR).
3.3 实验设置
本文利用预训练的 AlexNet 网络作为主干网络提取特性特征, 接着连接一个用 Sigmoid 函数激活的哈希全连
接层输出哈希码. 重构层 f re 包含一个由 Leaky ReLU 函数激活的全连接层. 大规模视觉语言模型 CLIP 使用的权

