Page 74 - 《软件学报》2026年第5期
P. 74

方承炀 等: 面向免训练视频问答的双重自适应冗余消除                                                      1953


                 过将视觉编码器与冻结的大语言模型对齐, 增强了图像描述与创意性故事生成的能力. 3D-LLM                            [22] 将三维表示与
                 大语言模型相结合, 为图像语言模型在三维数据处理中的应用打开了新局面. 此外, MM1                          [23] 通过消融实验揭示了
                 影响图像大语言模型性能的关键因素, Ferret          [24,25] 增强了模型处理物体框/形状模态的能力, 在多模态推理任务中表
                 现更佳. Qwen-VL  [26] 借鉴了  BLIP-2  中的  Q-Former 结构作为融合层  (fusion layer), 将视觉编码器输出的图像特征
                 与大语言模型的语义空间对齐.
                  1.2   视频大语言模型  (Video-LLM)
                    虽然视频与图像同属视觉模态, 但视频作为图像在时间维度上的扩展, 不仅提升了信息密度, 还引入了时序特
                 性. 在图像大语言模型和大语言模型的基础上, 视频大语言模型也迅速发展. FrozenBiLM                     [27] 首创了零样本视频问答
                 方法, 通过使用冻结的双向语言模型, 无需人工标注便达到了当时该任务的先进水平. VideoChat                           [28] 和  Video-
                 LLaMA  [29] 使用双流架构处理音频与视频信号, 其中        Video-LLaMA  在两个模态中均引入了       Q-Former, 而  VideoChat
                 则将视频标记特征与字幕感知工具结合, 并利用以视频为中心的多模态指令微调数据集进一步增强模型能力. Video-
                 ChatGPT  [30] 通过利用预训练视觉编码器提取视频的时空特征, 并将其投射到大语言模型的输入空间, 同时构建了包
                 含  10  万条视频指令问答对的高质量数据集. Chat-UniVi        [31] 通过动态视觉标记   (token) 统一了图像和视频特征表示;
                 而  PLLaVA [32] 则通过引入了训练后权重融合机制, 以缓解多模态微调过程中模型遗忘的问题. 此外, LLaVA-NeXT-
                 Video [33] 通过在视频数据上微调   LLaVA-NeXT [19] 提升了其视频理解能力, 其     DPO  版本进一步优化了模型响应, 使其
                                         [34]
                 与模型反馈更加一致. TimeChat       结合了时间戳感知帧编码器与滑动式视频              Q-Former, 成为面向长视频理解的时间
                 敏感型多模态大语言模型. LLaMA-VID        [35] 引入了上下文标记与内容标记的双标记机制, 在处理长视频时有效降低了
                 视觉-语言模型的计算开销. Oryx      [36] 利用可变分辨率编码与动态压缩机制, 能够高效处理不同空间尺度与时间长度的
                 视觉数据, 显著提升了多模态大模型在图像、视频以及多视角                   3D  场景理解任务中的适应性与表现能力.
                  1.3   免训练的视频大语言模型      (training-free Video-LLM)
                    近年来, 免训练     (training-free) 的视频大语言模型逐渐受到广泛关注, 特别是在如何以最小的调整将现有图像
                                                            [6]
                 模型架构适配为视频输入方面取得了显著进展. IG-VLM 作为该领域的开创性工作, 将视频转换为单个复合图像
                                                                                   [7]
                 网格, 使高性能的视觉语言模型          (VLM) 无需在视频数据上训练即可直接应用. FreeVA 探索了使用离线图像大语
                 言模型作为免训练视频助手的潜力, 并通过引入无参数的时间聚合模块, 在零样本视频问答任务中取得了强劲表
                                                          [8]
                 现, 甚至超越了一些经过视频微调的模型. SF-LLaVA 采用双流架构, 有效捕捉视频中的空间与时间特征, 在多个
                                                                          [9]
                 视频基准任务上无需额外训练即实现具有竞争力的性能. Free Video-LLM 提出了一种提示引导的视觉感知框架,
                 将空间和时间维度进行解耦, 执行视频帧采样和问题感兴趣区域裁剪, 显著减少视觉标记的数量, 从而降低计算开
                 销. INTP-Video-LLMs [37] 则利用视频标记重排序与免训练的上下文窗口扩展方法, 突破固定视频编码器的限制, 增
                 强了模型对长视频内容的理解能力. 此外, 该方法还引入了一种免训练的键值对缓存压缩机制, 在推理阶段有效降
                 低内存开销, 从而实现对长视频的高效处理.

                  2   方 法

                  2.1   总 览
                    本文提出了一种面向免训练视频问答的双重自适应冗余消除方法, 旨在提升免训练大语言模型在视频理解任
                 务中的表现. 整体架构如图        2(a) 所示, 包含以下   4  个核心模块: 1) 视觉编码器, 分别提取视频帧特征和文本特征;
                 2) 双关联时间采样模块, 利用文本与视频帧的关联性以及视频帧间的内在关系, 实现时间维度的降维采样; 3) 动
                 态空间采样模块, 结合提示信息动态优化视频帧的空间特征表达, 增强区域级别的表征能力; 4) 大语言模型, 接收
                 优化后的视觉标记, 生成与文本标记一致的响应.
                    为了更清晰地展示方法流程, 首先介绍免训练视频大语言模型的整体框架, 该框架旨在将图像大语言模型                                  (如
                 CLIP) 的能力扩展至视频理解任务. 随后, 逐步介绍所提出的双关联时间采样模块和动态空间采样模块两个关键
                 模块的设计理念及其在视频理解中的具体作用.
   69   70   71   72   73   74   75   76   77   78   79