Page 81 - 《软件学报》2026年第5期
P. 81
1960 软件学报 2026 年第 37 卷第 5 期
问题: 答案: 问题: 答案:
我们的描述:
我们的描述:
的描述:
的描述:
(a) 场景 1: 男子伏案讲解
(c) 场景 3: 马匹场地奔跑
问题:
答案:
问题: 答案:
我们的描述:
我们的描述:
的描述:
的描述:
(b) 场景 3: 驾车语音通话 (d) 场景 4: 卡通形象互动
图 4 零样本视频问答可视化及对比
表 5 算法复杂度分析表
模型 推理时间 (s)↓
IG-VLM [6] 2.94
FreeVA [7] 2.72
SF-LLaVA [8] 3.75
Free Video-LLM [9] 3.47
本文方法 3.64
注: 加粗字体表示最优结果, “↓”表示数值越低越好
4 总 结
在免训练视频问答 (VQA) 任务中, 存在两个主要挑战: 时序对齐失准和空间噪声干扰. 为了解决这些问题, 我
们提出了一种基于双重自适应冗余消除的免训练视频理解框架. 通过构建文本语义与帧间关系的联合推理机制,

