Page 77 - 《软件学报》2026年第5期
P. 77
1956 软件学报 2026 年第 37 卷第 5 期
示特征的相关性得分 (余弦相似度), 公式如下:
F IR
PQ IR h,w F Q
cos (F , F Q ) =
·
(8)
h,w h,w
IR
F
F Q
h,w 2 2
其中, 1 ⩽ h ⩽ H 且 1 ⩽ w ⩽ W. 根据这些相似度得分, 选取得分最高的前 n 个标记, 其对应的位置集合为: {(h 1 ,w 1 ),
,
(h 2 ,w 2 ),...,(h n ,w n )}, 其中 n = αHW 0 ⩽ α ⩽ 1. 这些位置用于确定兴趣区域的中心坐标及形状.
在特征图上对这些高相关标记的位置分布进行分析, 提取出最大连通区域 e 的中心坐标, 通过该连通区域内
所有标记的位置平均计算得出:
1 n e ∑
h c = h e i (9)
n e
i=1
1 n e ∑
w c = w e i (10)
n e
i=1
i
其中, n e 为最大连通区域中的标记数量, e i 表示第 个标记在特征图 F IR 中的位置. 同时, 兴趣区域的高与宽由该连
通区域的最大垂直与水平跨度决定:
′
H = H e (11)
max
e
W = W max (12)
′
其中, H e 、 W e 分别是连通区域在垂直和水平方向的最大跨度. 根据计算得到的中心坐标和区域大小, 我们从帧
max max
的特征图中裁剪出兴趣区域, 并将其重新调整为一组标记向量, 作为视频与提示词对齐的表示.
最后, 这些紧凑的视觉标记与文本提示标记结合, 作为大语言模型的输入. 通过这种方法, 免训练的视频大模
型可以使用更少的标记表示视频, 从而显著提升推理效率. 如图 1 场景 2 中, 使用动态空间采样策略后, 模型可以
关注不同尺寸的感兴趣区域, 更加精准地获取与问题有关的视觉信息.
3 实 验
3.1 实验准备
1) 基准评测: 本文对提出的方法在多个开放式视频问答基准数据集上进行了全面评估. 开放式视频问答基准
数据集包括 MSVD-QA [10] 、MSRVTT-QA [11] 、TGIF-QA [12] 和 ActivityNet-QA [13] , 主要用于评估模型生成自由形式
答案的能力.
2) 评估指标: 在评估过程中, 本文采用了 GPT 辅助评测方法, 分别从答案的准确性 (答案正确或错误) 和质量
(评分范围为 0–5 分) 两个维度进行量化评估. 为保证评估结果的公平性与一致性, 本文遵循 FreeVA、SF-LLaVA
和 Free Video-LLM 等工作的方法, 统一使用 GPT-3.5-Turbo-0125 作为评估模型.
3) 实验细节: 遵循 SF-LLaVA 和 Free Video-LLM 等工作, 实验中本文采用 LLaVA-v1.6 模型, 分别选用了 7B
和 34B 两种规模模型作为基础框架. 视觉和文本编码器均采用 OpenAI 的 CLIP-L-14 模型, 预训练权重从
HuggingFace 获取. 输入视频被统一调整为 336×336 的分辨率, 每帧图像被划分为 24×24 的标记网格. 为提升模型
对长序列的处理能力, 本文将 LLaVA-v1.6 中旋转位置编码的缩放因子设为 2, 以支持最长为 8 192 标记的上下文
长度. 所有实验使用 PyTorch 框架实现, 在保持基础模型预训练权重不变的前提下仅对超参数进行了适度调整.
3.2 主要实验结果
开放式视频问答任务的设置方式与 Free Video-LLM 保持一致, 模型选取 3 帧双关联时间采样帧特征、5 帧
[9]
均匀时间采样帧特征及 50 帧密集聚合采样帧特征, 其中双关联时间采样帧特征与均匀时间采样帧还会经动态空
间采样处理以降低冗余噪声. 开放式视频问答任务的实验结果如表 1 和表 2 所示. 表中每个单元格中的两个数字
分别表示“准确率/分数”. 加粗的数字表示在免训练方法中性能最佳的结果. 表 2 的大语言模型均采用 CLIP-L 视
觉编码器. 我们提出的模型在零样本视频问答任务中展现出了显著的性能提升. 具体而言, 通过利用不同规模的大
语言模型, 我们的模型在多个基准测试中均优于现有的零样本方法.

