Page 71 - 《软件学报》2026年第5期
P. 71
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
2026,37(5):1950−1963 [doi: 10.13328/j.cnki.jos.007544] [CSTR: 32375.14.jos.007544] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
*
面向免训练视频问答的双重自适应冗余消除
方承炀, 朱 畅, 姜文晖, 方玉明, 鄢杰斌
(江西财经大学 计算机与人工智能学院, 江西 南昌 330013)
通信作者: 方玉明, E-mail: leo.fangyuming@foxmail.com
摘 要: 近年来, 免训练的视频问答模型因其即插即用的特性, 成为轻量级多模态推理研究的热点. 然而, 包含丰富
语义信息的高帧率视频往往具备天然的冗余性, 导致在时间维度上存在信息密度与计算效率之间的平衡问题, 传
统的采样策略容易受到噪声帧的干扰. 此外, 在复杂的动态场景中, 背景干扰物和局部身体部位等非目标区域会引
入空间特征偏差, 严重影响答案生成的可靠性. 为解决以上两个问题, 提出了双重自适应冗余消除 (dual adaptive
redundancy elimination, DARE) 框架, 旨在通过时空冗余协同优化机制, 实现免训练范式下视频语义理解精度与答
案质量的系统性提升. 首先, 提出一种基于文本-视觉对齐与帧间语义一致的双关联时间采样方法, 通过双向交互推
理筛选视频关键帧序列, 并同步剔除与文本语境冲突的冗余帧. 其次, 引入一种动态空间采样方法, 从与提示相关
的热力图候选区域中提取最大连通语义区域, 以消除与问题无关的分散区域的干扰, 增强空间特征表达的紧密相
关性. 所提方法在 MSVD-QA、MSRVTT-QA、TGIF-QA 和 ActivityNet-QA 等广泛使用的数据集上进行了实验,
并在零样本 (zero-shot) 设定下与 14 个最新模型进行了对比评估. 实验结果表明, 所提方法在使用更少视频特征序
列的情况下实现了更具竞争力的性能. 可视化分析进一步验证了该方法在复杂场景中 (如多人交互和细粒度动作
识别) 表现出更准确的时空定位能力. 所提出的双重自适应冗余消除框架通过协同优化时空冗余, 在免训练范式下
显著提升了视频问答任务的性能, 能够生成准确且高质量的答案, 展现出其在多模态视频理解中的应用潜力.
关键词: 免训练; 视频问答; 双关联时间采样; 动态空间采样; 零样本
中图法分类号: TP37
中文引用格式: 方承炀, 朱畅, 姜文晖, 方玉明, 鄢杰斌. 面向免训练视频问答的双重自适应冗余消除. 软件学报, 2026, 37(5): 1950–1963.
http://www.jos.org.cn/1000-9825/7544.htm
英文引用格式: Fang CY, Zhu C, Jiang WH, Fang YM, Yan JB. Dual Adaptive Redundancy Elimination for Training-free Video
Question Answering. Ruan Jian Xue Bao/Journal of Software, 2026, 37(5): 1950–1963 (in Chinese). http://www.jos.org.cn/1000-9825/
7544.htm
Dual Adaptive Redundancy Elimination for Training-free Video Question Answering
FANG Cheng-Yang, ZHU Chang, JIANG Wen-Hui, FANG Yu-Ming, YAN Jie-Bin
(School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics, Nanchang 330013, China)
Abstract: In recent years, training-free video question answering (VQA) models have become a research hotspot for lightweight
multimodal reasoning due to their plug-and-play nature. However, although high frame rate videos contain rich semantic information, their
inherent redundancy leads to a balance problem between information density and computational efficiency in the temporal dimension, with
traditional sampling strategies being susceptible to noise frame interference. Furthermore, in complex dynamic scenes, background clutter
* 基金项目: 国家自然科学基金 (62562035, 62441203, 62311530101, 62461028); 江西省重点研发计划 (20252BCE310034); 江西省自然科
学基金 (20242BAB23012, 20252BAC200182); 江西省双千计划 (jxsq2023101092); 江西省职业早期青年科技人才培养项目 (2025
2BEJ730121); 江西财经大学第十九届学生科研课题 (20241126104806366)
本文由“多媒体智能理解与生成”专题特约编辑孙立峰教授、闵巍庆副研究员、马占宇教授、蒋树强研究员、彭宇新教授、田丰研究
员、黄庆明教授推荐.
收稿时间: 2025-05-26; 修改时间: 2025-07-11; 采用时间: 2025-09-05; jos 在线出版时间: 2025-09-23
CNKI 网络首发时间: 2025-12-25

