Page 75 - 《软件学报》2026年第5期
P. 75

1954                                                       软件学报  2026  年第  37  卷第  5  期






                                      视觉
                                      编码器           双关联时间采样           动态空间采样           大语言模型     回答: Two




                 问题: How many higher   文本
                 officials have a chat?  编码器

                                                                                                      (a)
                                                     f ′   f  best
                                                丢弃                       P                COS  余弦相似度
                                            COS
                                                                                   COS
                                 高相关帧                                                      P  划分为图像块
                                                补充                          提示
                         COS
                                                                                          LCR  最大连通区域
                                 中等相关帧
                                                                      RoI    LCR
                                            丢弃                                            RoI  感兴趣区域
                   提示
                                 低相关帧
                                                    (b) 双关联时间采样             (c) 动态空间采样
                                                    图 2 模型总体框架图

                  2.2   预备知识: 免训练视频大语言模型
                    免训练视频大语言模型是一种无需对数据进行进一步微调的技术, 通过基于预训练的图像大语言模型构建视
                 频理解模型. 其核心特点是避免训练过程, 直接利用已有的视觉语言模型进行视频处理.
                    给定一个视频      V, 帧采样器从中均匀选取       T  帧组成图像序列     {I 1 , I 2 ,..., I N }. 采样帧随后被送入基于图像的视觉
                 编码器   (如  CLIP-L) 提取视觉特征:

                                                     F V = E(I 1 , I 2 ,..., I N )                    (1)
                 其中, E  表示视觉编码器,     F V ∈ R T×N×D ,  T  是从视频中均匀选取的帧数量,  N  是每帧视觉标记的数量,      D 是标记维度,
                                                        F T  送入  LLM  中以产生响应:
                 F V  组成由所有的帧. 后将视频标注       F V  和文本标注

                                                     Y = LLM([F V , F T ])                            (2)
                    这个简单的流程直观而有效, 被广泛运用             [7–9] . 然而, 与图像大语言模型相比, 视频大语言模型的计算复杂度显
                 著增加. 在图像大语言模型中, 模型仅需处理二维图像数据, 其输入维度为                      ( H,W,C), 计算复杂度主要受空间维度
                 ( H,W) 的影响. 而在视频大语言模型中, 输入数据由多个时间帧组成, 维度扩展为                    ( T,H,W,C), 这要求模型不仅要
                 处理空间信息, 还需建模时间维度上的依赖关系. 因此, 为了捕捉时间维度上的动态变化, 视频模型通常引入时间
                 建模模块, 如   3D  卷积或时序   Transformer, 这会显著提高计算开销. 例如, 时间维度上的自注意力机制的计算复杂
                 度为  O( T ), 整体复杂度也从图像模型中的         O( H W ) 增加至  O( T · H W ). 因此, 如何对视频帧进行合理的时间采
                                                        2
                                                                        2
                                                                      2
                        2
                                                      2
                 样和空间降维, 以减少计算量、降低算法复杂度并提升算法效率, 成为提升免训练的视频大语言模型性能的关键.
                  2.3   双关联时间采样  (dual-relation temporal sampling)
                    实验动机: 视频通常以高帧速率捕获, 导致相邻帧之间存在大量冗余信息. 对于视频问答任务而言, 需在保留
                 关键信息的前提下减少帧数. 与现有方法             (例如每个视频片段采样一帧          [6] 、采样稀疏聚合、密集聚合        [7] 、均匀时
                 间采样  [8] 、局部聚类  [38] 和基于提示的时间采样     [9] ) 不同, 我们提出了一种双关联时间采样策略. 该方法不仅结合了
                 任务或问题的文本上下文, 还能够在推理过程中动态调整图文关联性不匹配的帧. 例如, 在图                            1  场景  1  中, 视频展
   70   71   72   73   74   75   76   77   78   79   80