Page 61 - 《软件学报》2026年第5期
P. 61
1940 软件学报 2026 年第 37 卷第 5 期
K 的标签替换原始的文本标签. 为了提升标签替换的灵活性与适应性, 本文根据原始文本标签在数据集中的常见
标签集中的出现次数动态调整 K 值; 若原始标签中无任何标签出现在常见标签集中, 则将 K 值设置为原始标签的
数量. 具体定义如下:
{
Count(T i ∩T common ), if Count(T i ∩T common ) > 0
K = (3)
Count(T i ), if Count(T i ∩T common ) = 0
其中, T common 表示常见文本标签的集合, Count(·) 表示计数函数. 在利用上述方法推理得到前 K 个优化标签的过程
中, 本文观察到显著标签对其他标签的预测存在干扰. 如图 3 所示, 当输入图像中存在与“人”相关的显著语义内容
时, 与其相关的文本标签在预测结果中会获得较高的置信度分数, 从而主导整个预测排序. 这些显著标签会压制其
他语义相关但不显著的标签的得分, 导致原本与图像内容密切相关的标签 (如“天空”等) 未能进入前 K 个标签的
候选集, 如图 3 中红色区域所示.
图 2 利用融合权重的 CLIP 模型推理的文本标签示例
直接预测排名前 K 个标签 消除类间影响后重推理
people: 63.04% woman: 8.30%
woman: 13.01% people: 8.02%
bride: 3.24% sky: 7.06%
… …
sky: 2.26% bride: 6.78%
outdoor: 2.03% field: 6.32%
真值标签:
clouds, female
people, sky
图 3 消除类间影响得到的文本标签示例
为消除推理阶段不同类别之间的相互干扰, 本文提出对各类别之间的冗余特征进行建模与抑制. 具体而言, 首
先利用融合权重 θ final 得到的图像特征 F im ∈ R 1×50×512 与文本标签的特征 F txt ∈ R C×512 , 分别进行 L2 归一化处理. 随后,
通过对图像特征与文本特征维度扩充, 进行逐元素相乘, 构建原始的跨模态交叉表征 F o ∈ R 1×50×C×512 . 该过程可表
示为:
( ) ( )
F im F txt
F o = expand ⊙expand (4)
∥F im ∥ 2 ∥F txt ∥ 2
其中, ⊙ 表示向量逐元素相乘, expand(·) 表示维度扩充操作. 之后, 使用 CLIP 图像特征 F im 中的类别标记特征 F c ∈ R 1×512
F txt ∈ R C×512 s ∈ R 1×C :
和文本特征 计算相似度分数
( ) T
F c F txt
s = Softmax (5)
∥F c ∥ 2 ∥F txt ∥ 2
其中, T 表示特征向量的转置. 通过各类别的相似度分数和均值分数的比值计算权重 w ∈ R 1×C :
s
w = (6)
mean(s)
其中, mean(·) 表示求均值运算. 然后对每一个特征加权, 并在类别维度求均值作为该类别受其他类别影响的冗余

