Page 75 - 《软件学报》2026年第5期
P. 75
1954 软件学报 2026 年第 37 卷第 5 期
视觉
编码器 双关联时间采样 动态空间采样 大语言模型 回答: Two
问题: How many higher 文本
officials have a chat? 编码器
(a)
f ′ f best
丢弃 P COS 余弦相似度
COS
COS
高相关帧 P 划分为图像块
补充 提示
COS
LCR 最大连通区域
中等相关帧
RoI LCR
丢弃 RoI 感兴趣区域
提示
低相关帧
(b) 双关联时间采样 (c) 动态空间采样
图 2 模型总体框架图
2.2 预备知识: 免训练视频大语言模型
免训练视频大语言模型是一种无需对数据进行进一步微调的技术, 通过基于预训练的图像大语言模型构建视
频理解模型. 其核心特点是避免训练过程, 直接利用已有的视觉语言模型进行视频处理.
给定一个视频 V, 帧采样器从中均匀选取 T 帧组成图像序列 {I 1 , I 2 ,..., I N }. 采样帧随后被送入基于图像的视觉
编码器 (如 CLIP-L) 提取视觉特征:
F V = E(I 1 , I 2 ,..., I N ) (1)
其中, E 表示视觉编码器, F V ∈ R T×N×D , T 是从视频中均匀选取的帧数量, N 是每帧视觉标记的数量, D 是标记维度,
F T 送入 LLM 中以产生响应:
F V 组成由所有的帧. 后将视频标注 F V 和文本标注
Y = LLM([F V , F T ]) (2)
这个简单的流程直观而有效, 被广泛运用 [7–9] . 然而, 与图像大语言模型相比, 视频大语言模型的计算复杂度显
著增加. 在图像大语言模型中, 模型仅需处理二维图像数据, 其输入维度为 ( H,W,C), 计算复杂度主要受空间维度
( H,W) 的影响. 而在视频大语言模型中, 输入数据由多个时间帧组成, 维度扩展为 ( T,H,W,C), 这要求模型不仅要
处理空间信息, 还需建模时间维度上的依赖关系. 因此, 为了捕捉时间维度上的动态变化, 视频模型通常引入时间
建模模块, 如 3D 卷积或时序 Transformer, 这会显著提高计算开销. 例如, 时间维度上的自注意力机制的计算复杂
度为 O( T ), 整体复杂度也从图像模型中的 O( H W ) 增加至 O( T · H W ). 因此, 如何对视频帧进行合理的时间采
2
2
2
2
2
样和空间降维, 以减少计算量、降低算法复杂度并提升算法效率, 成为提升免训练的视频大语言模型性能的关键.
2.3 双关联时间采样 (dual-relation temporal sampling)
实验动机: 视频通常以高帧速率捕获, 导致相邻帧之间存在大量冗余信息. 对于视频问答任务而言, 需在保留
关键信息的前提下减少帧数. 与现有方法 (例如每个视频片段采样一帧 [6] 、采样稀疏聚合、密集聚合 [7] 、均匀时
间采样 [8] 、局部聚类 [38] 和基于提示的时间采样 [9] ) 不同, 我们提出了一种双关联时间采样策略. 该方法不仅结合了
任务或问题的文本上下文, 还能够在推理过程中动态调整图文关联性不匹配的帧. 例如, 在图 1 场景 1 中, 视频展

