Page 73 - 《软件学报》2026年第5期
P. 73
1952 软件学报 2026 年第 37 卷第 5 期
略. 该策略通过联合建模问题语义与视频帧间的关系图, 实现关键帧序列的精准筛选与动态修正, 在剔除冗余帧的
同时严格保持时序连贯性. 这一策略直接修复了图 1 场景 1 中 Free Video-LLM 的帧选择偏差, 通过帧间关系的自
适应推理消除错误帧, 最终得到时序连贯的关键帧序列. 2) 针对空间噪声干扰问题, 框架引入动态空间采样策略.
该策略从提示相关热力图中提取最大连通区域, 既能有效消除零散噪声区域的干扰, 又能显著提升空间特征的语
义相关性. 此设计优化了图 1 场景 2 中 Free Video-LLM 的固定尺寸裁剪缺陷, 通过自适应聚焦问题相关区域, 规
避了固定大小裁剪带来的噪声污染, 为精准空间定位任务提供可靠特征输入.
场景 1
问题: What is a family having?
答案: Conversation
场景 2
问题: How many higher officials
meet in a room?
答案: Two
图 1 当前存在的问题与挑战
本文所提方法在 4 个广泛使用且具有挑战性的数据集 (MSVD-QA [10] 、MSRVTT-QA [11] 、TGIF-QA [12] 和
ActivityNet-QA [13] ) 上进行了评估. 与 14 个当前最先进的模型进行对比, 该方法在答案准确性和答案质量这两个广
泛采用的评估指标上均优于其他对比模型. 可视化分析进一步表明, 该模型能在复杂场景中准确定位关键时空线
索. 综上所述, 本文的主要贡献如下.
1) 提出了一种双重关联采样策略, 联合建模问题语义与视频帧间关系, 实现更精准的关键帧筛选与修正. 消融
实验验证该方法相较于均匀采样和提示引导采样更加有效.
2) 设计了一种基于最大连通区域提取的动态空间优化机制, 有效消除零散区域的空间噪声干扰, 增强目标区
域的语义相关性. 消融实验表明该机制优于全局池化与固定尺寸裁剪策略.
3) 在 4 个公开数据集上进行了大量实验, 结果显示本文方法在答案准确率和答案质量这两个常用指标上超越
了 14 个当前最先进模型. 定性分析进一步验证了双重自适应冗余消除框架在复杂视频问答场景中的有效性.
1 相关工作
1.1 图像大语言模型 (Image-LLM)
近年来, 图像大语言模型 (Image-LLM) 取得了显著进展, 主要得益于 CLIP 引入了视觉与语言的共享表示空
间以及大规模语言模型 (LLM) 的发展, 如 GPT [14] 和 LLaMA [15] 的发展. Flamingo [16] 通过无缝集成视觉与语言模型,
在少样本任务中展现出强大的能力, BLIP-2 [17] 则利用轻量级的 Querying Transformer 架构进一步推动了视觉与语
言模态的融合. 多模态指令优化进一步提升了图像大语言模型的表现. 例如, LLaVA [18,19] 结合 GPT-4 提升了多模态
指令数据生成与图文理解能力, InstructBLIP [20] 则扩展了 BLIP-2 的功能以适应更广泛的任务范围. MiniGPT-4 [21] 通

