Page 76 - 《软件学报》2026年第5期
P. 76

方承炀 等: 面向免训练视频问答的双重自适应冗余消除                                                      1955


                 示了一个家庭的惬意聊天. 对于问题“What is a family having?”, 传统的基于提示的时间采样方法虽然选取了                    3  个
                 与问题高度相关的帧, 但第        3  帧并非所需的关键帧. 在这种情况下, 利用视频帧之间的内在语义关系, 从其他候选
                 帧中识别出更合适的替代帧. 该模块通过联合考虑文本与视频帧之间的相关性以及帧与帧之间的语义一致性, 有
                 效解决了时间维度下采样过程中的效率与准确性问题, 从而保证所选信息的完整性与相关性.
                    设计方案: 在时间维度上, 首先利用提示信息来引导选择与其最相关的时间帧. 具体来说, 使用与视觉编码器
                    CLIP) 对齐的文本编码器     E  提取问题提示的特征:
                 (如
                                                         F V = E(Q)                                   (3)
                                                    D
                    提示序列    Q 将被表示为一个向量        F Q ∈ R . 通过视觉编码器处理后, 视频帧的视觉标记不仅捕捉了各帧内部
                                                                                  cls
                 的信息, 还与提示特征处于同一子空间中. 然后, 通过全局平均池化提取视觉特征                        F ∈ R T×D , 得到每一帧的表示.
                 接下来, 计算每帧视觉特征与提示特征之间的相关性得分                  (即余弦相似度):

                                                              F cls
                                                   IQ  cls      i    F Q
                                                 cos (F , F Q ) = 
  
 · 
  
                         (4)
                                                   i  i      
  cls
                                                             
F 
  
F Q
                                                               i  2    2
                                                                    T
                                                                                            k
                 其中,   i = 1,2,...,T  表示帧的时间索引. 根据相似度得分, 将帧     f ∈ R  按相似度降序排列, 并划分为   个与提示最相
                 关帧、  t 个中等相关帧以及      T −k −t 个低相关帧  (被丢弃).
                    在根据提示特征选择出相关帧后, 还需考虑帧与帧之间的关系. 具体地, 计算帧与帧之间的余弦相似度:

                                                              F cls  F cls
                                                   II  cls  cls  f i  f j
                                                 cos (F , F ) = 
 
  
 · 
 
  
 
                     (5)
                                                   i,j
                                                         f j
                                                      f i
                                                               cls
                                                             
F 
  
  cls
                                                               f i  2 
F
                                                                      f j
                                                                       2
                    接着, 在前   k 个高相关帧中, 识别出与其他帧相似度最低的帧. 我们计算每个帧与其他                     k −1 个帧的相似度总和:

                                                 k ∑             F cls  k ∑  F cls
                                                      II
                                                            cls
                                                         cls
                                          s throw  =  cos (F , F ) = 
 
  f i  
 ·  
 
  f j  
 
     (6)
                                           i
                                                      i,j
                                                            f j
                                                         f i
                                                                  cls

                                                                            cls
                                                j=1,j,i         
F 
 2  j=1,j,i 
F
                                                                  f i
                                                                            f j
                                                                              2
                                                                                                    t
                                                                     f
                                                                      ′
                    然后, 丢弃其中     m 个与其他帧间相似度最低的帧, 剩余帧记为  , 数量为               k −m. 接下来, 从中等相关的   帧中
                     m 帧                                          ′                                  f  中
                                                                                                      ′
                 补充      (编号为   f i (i = k +1,k +2,...,k +t)), 要求这些帧不与   f  中的帧重复. 选择方式如下, 计算候选帧与
                 所有帧的相似度总和:

                                                k−m               cls  k−m  cls
                                                ∑               F    ∑ F ′ f j
                                             fill
                                                     II
                                                           cls
                                                        cls
                                            s =    cos (F , F ′ ) = 
  f i  
 ·  
  
                 (7)
                                             i       i,j  f i  f j  
  cls
                                                                          cls

                                                 j=1           
F 
   j=1 
F ′
                                                                   2
                                                                 f i
                                                                            2
                                                                          f j
                                                         ′
                    最后, 依据   s fill   的得分, 从候选帧中选择  m 个与   f  不重复的帧, 得到最终选中的关键帧集合         f  best . 如图  1  场景  1
                              i
                 中, 使用双关联时间采样策略后, 对于问题“What is a family having?”, 本文的方法可以有效地保证筛选出的视频帧
                 之间保持语义相关性, 同时与问题保持语义一致性.
                  2.4   动态空间采样  (dynamic spatial sampling)
                    实验动机: 视频帧中包含丰富的空间信息, 但这些信息往往也包含噪声和冗余. 在视觉问答任务中, 不同的问
                 题需要关注不同的关键区域. 现有方法通常采用最大池化提取全局特征                        [7] , 或基于提示词进行固定大小的空间采
                 样  [9] , 但这些方式可能无法很好地适应不同的问题需求. 为了解决这一问题, 我们提出了一种动态空间采样策略.
                 如图  1  场景  2  所示, 对于问题“How many higher officials meet in a room?”, 基于提示词的固定空间采样方法可以在
                 视频帧中突出相关区域, 但左侧分散的区域并不是目标区域, 甚至可能对答案的准确性产生负面影响. 因此, 我们
                 进一步精细化采样策略, 通过剔除无关区域, 以获得更精确的关注区域. 本模块分析与提示高度相关的区域, 提取
                 最大连通区域, 并对视频帧的空间特征表示进行动态优化.
                    设计方案: 为适应不同任务, 模型需要聚焦于特定空间区域以生成有效回答. 为此, 提出利用提示信息引导视
                 频中的兴趣区域      (region of interest, RoI) 选择. 具体而言, 对于单帧视频的视觉特征标记      F V i  ∈ R N×D , 我们将其重塑
                           IR
                 为空间形式    F ∈ R H×W×D , 其中  H×W  表示特征图的空间尺寸. 对于空间位置        (h, w) 上的特征向量, 我们计算其与提
   71   72   73   74   75   76   77   78   79   80   81