Page 80 - 《软件学报》2026年第5期
P. 80
方承炀 等: 面向免训练视频问答的双重自适应冗余消除 1959
样, 使用 3 帧视频帧, 选用 Free Video-LLM 模型结果作为对比基线, 实验结果如图 3 所示. 观察结果如下: 当 RoI
比率为 0.4 时, 视觉标记数约为 360 个, 在 MSVD-QA 数据集上准确率为 73.1%, 而 Free Video-LLM 模型能够达
到 74.1% 的准确率, 这是因为 RoI 比率很小的情况下动态空间采样关注视频的位置是变化的, 而 Free Video-LLM
模型以视频帧中心点为筛选区域中心; 当增加 RoI 比率到 0.5 时, 视觉标记数约为 408 个, 准确率提升至 74.4%, 超
过了相同设置的 Free Video-LLM 模型性能; 继续增加 RoI 比率到 0.6 及以上时, 尽管视觉标记数量增加, 但是模
型性能趋于稳定, 准确率在 75.5%–75.8% 之间浮动. 这表明, 更大的 RoI 比率虽能覆盖更多的空间信息, 但当 RoI
比率超过一定阈值 (如 0.6) 后, 性能提升的边际效益变小. 综上所述, 实验充分表明合理优化 RoI 比率对于提升视
频问答性能至关重要, 并进一步验证了我们提出的提示引导采样策略在提升视觉标记效率和模型准确率方面的有
效性.
76.0 75.8
75.7 75.6
75.5 75.6 75.0
MSVD-QA 准确率 (%) 75.0 74.1 74.4 74.2 74.9 74.8
75.5
74.5
74.0
73.5
73.1 本文方法
Free Video-LLM
73.0
0.4 0.5 0.6 0.7 0.8 0.9 1.0
RoI 比率
图 3 RoI 比率的影响
3.4 视频问答可视化分析
前文图 1 展示了本文提出的双关联时间采样与动态空间采样方法, 与 Free Video-LLM 方法在两个典型场景
中的对比示例. 在场景 1 中, 利用双关联时间采样策略, 模型能够有效筛选出与提示语高度相关的 3 帧图像, 剔除
原方法中误选的第 3 帧语义不符图像, 并从其他相关帧中补充选取更具代表性的图像, 从而提升时间采样的语义
一致性. 在场景 2 中, 借助动态空间采样机制, 模型在提示引导下首先定位出相关的图像标记区域, 并进一步基于
语义相关性动态划分空间区域, 聚焦于与任务最相关的视觉区域, 从而得到更精确的空间采样结果.
我们还展示了一些来自视觉问答任务复杂场景的可视化案例, 以更直观地体现我们方法的优势, 如后文图 4
所示. 具体来说: 在图 4(a) 中, 本文模型采用了双关联采样策略, 整合了视频帧中的关键信息, 进一步优化了视觉信
息与文本信息的对齐, 准确捕捉到了包含黑板的视频帧以及后续视频帧中男子的姿势、办公环境以及正在进行的
讲解动作. 在图 4(b) 中, 模型的动态空间采样策略优化了对视频帧中关键区域的关注, 精准提取了手机的手势和
方向盘的握法, 并通过对视频上下文的分析, 成功推断出该男子正在演示使用语音识别控制技术进行电话通信. 在图 4(c)
中, 模型高精度地选择了与问题相关的关键帧, 提供了更具上下文准确性的推理, 成功推断出马正在训练场或围栏
内奔跑, 突出展现了马的运动细节. 在图 4(d) 中, 模型对情感和动作均作出精准判断, 给出了丰富且细腻的情感描
述, 展示了其在处理复杂场景时的优势.
3.5 算法复杂度分析
表 5 呈现了各模型在免训练视频问答任务中的算法复杂度对比结果, 仅包含推理阶段分析, 因该任务无需训
练过程. 表中推理速度指标定义为处理所有视频的总时间除以视频总数, 数值越低表明模型推理效率越高. 从结果
可见, 在所有免训练视频问答模型中, FreeVA 以 2.72 s 的推理速度表现最优, IG-VLM 以 2.94 s 次之, 而本文方法
的推理速度为 3.64 s, 处于中等水平. 这一结果与本文方法的设计理念密切相关, 通过双关联时间采样实现时间维
度的精确筛选与修正, 同时借助动态空间采样完成空间维度的冗余降维, 在有效提升任务性能的前提下, 保持了模
型推理复杂度的可控性.

