Page 61 - 《软件学报》2026年第5期
P. 61

1940                                                       软件学报  2026  年第  37  卷第  5  期


                 K  的标签替换原始的文本标签. 为了提升标签替换的灵活性与适应性, 本文根据原始文本标签在数据集中的常见
                 标签集中的出现次数动态调整           K  值; 若原始标签中无任何标签出现在常见标签集中, 则将               K  值设置为原始标签的
                 数量. 具体定义如下:

                                            {
                                             Count(T i ∩T common ), if Count(T i ∩T common ) > 0
                                        K =                                                           (3)
                                             Count(T i ),    if Count(T i ∩T common ) = 0
                 其中,  T common  表示常见文本标签的集合,    Count(·) 表示计数函数. 在利用上述方法推理得到前           K  个优化标签的过程
                 中, 本文观察到显著标签对其他标签的预测存在干扰. 如图                 3  所示, 当输入图像中存在与“人”相关的显著语义内容
                 时, 与其相关的文本标签在预测结果中会获得较高的置信度分数, 从而主导整个预测排序. 这些显著标签会压制其
                 他语义相关但不显著的标签的得分, 导致原本与图像内容密切相关的标签                         (如“天空”等) 未能进入前      K  个标签的
                 候选集, 如图   3  中红色区域所示.










                                       图 2 利用融合权重的       CLIP  模型推理的文本标签示例


                                                 直接预测排名前 K 个标签      消除类间影响后重推理
                                                   people: 63.04%     woman: 8.30%
                                                   woman: 13.01%      people: 8.02%
                                                   bride: 3.24%       sky: 7.06%

                                                       …                 …
                                                   sky: 2.26%         bride: 6.78%
                                                   outdoor: 2.03%     field: 6.32%
                                      真值标签:
                                     clouds, female
                                      people, sky

                                             图 3 消除类间影响得到的文本标签示例

                    为消除推理阶段不同类别之间的相互干扰, 本文提出对各类别之间的冗余特征进行建模与抑制. 具体而言, 首
                 先利用融合权重      θ final  得到的图像特征  F im ∈ R 1×50×512   与文本标签的特征  F txt ∈ R C×512 , 分别进行  L2  归一化处理. 随后,
                 通过对图像特征与文本特征维度扩充, 进行逐元素相乘, 构建原始的跨模态交叉表征                           F o ∈ R 1×50×C×512 . 该过程可表
                 示为:

                                                       (     )       (    )
                                                         F im          F txt
                                              F o = expand    ⊙expand                                 (4)
                                                        ∥F im ∥ 2    ∥F txt ∥ 2
                 其中,  ⊙ 表示向量逐元素相乘,     expand(·) 表示维度扩充操作. 之后, 使用   CLIP 图像特征   F im  中的类别标记特征   F c ∈ R 1×512
                          F txt ∈ R C×512       s ∈ R 1×C :
                 和文本特征              计算相似度分数

                                                              (     ) T 
                                                           F c  F txt  
                                                                     
                                                  s = Softmax                                     (5)
                                                           ∥F c ∥ 2 ∥F txt ∥ 2
                 其中, T  表示特征向量的转置. 通过各类别的相似度分数和均值分数的比值计算权重                        w ∈ R 1×C :

                                                              s
                                                        w =                                           (6)
                                                           mean(s)
                 其中,  mean(·) 表示求均值运算. 然后对每一个特征加权, 并在类别维度求均值作为该类别受其他类别影响的冗余
   56   57   58   59   60   61   62   63   64   65   66