Page 71 - 《软件学报》2026年第5期
P. 71

软件学报 ISSN 1000-9825, CODEN RUXUEW                                        E-mail: jos@iscas.ac.cn
                 2026,37(5):1950−1963 [doi: 10.13328/j.cnki.jos.007544] [CSTR: 32375.14.jos.007544]  http://www.jos.org.cn
                 ©中国科学院软件研究所版权所有.                                                          Tel: +86-10-62562563



                                                                      *
                 面向免训练视频问答的双重自适应冗余消除

                 方承炀,    朱    畅,    姜文晖,    方玉明,    鄢杰斌


                 (江西财经大学 计算机与人工智能学院, 江西 南昌 330013)
                 通信作者: 方玉明, E-mail: leo.fangyuming@foxmail.com

                 摘 要: 近年来, 免训练的视频问答模型因其即插即用的特性, 成为轻量级多模态推理研究的热点. 然而, 包含丰富
                 语义信息的高帧率视频往往具备天然的冗余性, 导致在时间维度上存在信息密度与计算效率之间的平衡问题, 传
                 统的采样策略容易受到噪声帧的干扰. 此外, 在复杂的动态场景中, 背景干扰物和局部身体部位等非目标区域会引
                 入空间特征偏差, 严重影响答案生成的可靠性. 为解决以上两个问题, 提出了双重自适应冗余消除                               (dual adaptive
                 redundancy elimination, DARE) 框架, 旨在通过时空冗余协同优化机制, 实现免训练范式下视频语义理解精度与答
                 案质量的系统性提升. 首先, 提出一种基于文本-视觉对齐与帧间语义一致的双关联时间采样方法, 通过双向交互推
                 理筛选视频关键帧序列, 并同步剔除与文本语境冲突的冗余帧. 其次, 引入一种动态空间采样方法, 从与提示相关
                 的热力图候选区域中提取最大连通语义区域, 以消除与问题无关的分散区域的干扰, 增强空间特征表达的紧密相
                 关性. 所提方法在     MSVD-QA、MSRVTT-QA、TGIF-QA      和  ActivityNet-QA  等广泛使用的数据集上进行了实验,
                 并在零样本    (zero-shot) 设定下与  14  个最新模型进行了对比评估. 实验结果表明, 所提方法在使用更少视频特征序
                 列的情况下实现了更具竞争力的性能. 可视化分析进一步验证了该方法在复杂场景中                             (如多人交互和细粒度动作
                 识别) 表现出更准确的时空定位能力. 所提出的双重自适应冗余消除框架通过协同优化时空冗余, 在免训练范式下
                 显著提升了视频问答任务的性能, 能够生成准确且高质量的答案, 展现出其在多模态视频理解中的应用潜力.
                 关键词: 免训练; 视频问答; 双关联时间采样; 动态空间采样; 零样本
                 中图法分类号: TP37

                 中文引用格式: 方承炀, 朱畅, 姜文晖, 方玉明, 鄢杰斌. 面向免训练视频问答的双重自适应冗余消除. 软件学报, 2026, 37(5): 1950–1963.
                 http://www.jos.org.cn/1000-9825/7544.htm
                 英文引用格式: Fang  CY,  Zhu  C,  Jiang  WH,  Fang  YM,  Yan  JB.  Dual  Adaptive  Redundancy  Elimination  for  Training-free  Video
                 Question Answering. Ruan Jian Xue Bao/Journal of Software, 2026, 37(5): 1950–1963 (in Chinese). http://www.jos.org.cn/1000-9825/
                 7544.htm

                 Dual Adaptive Redundancy Elimination for Training-free Video Question Answering

                 FANG Cheng-Yang, ZHU Chang, JIANG Wen-Hui, FANG Yu-Ming, YAN Jie-Bin
                 (School of Computing and Artificial Intelligence, Jiangxi University of Finance and Economics, Nanchang 330013, China)
                 Abstract:  In  recent  years,  training-free  video  question  answering  (VQA)  models  have  become  a  research  hotspot  for  lightweight
                 multimodal  reasoning  due  to  their  plug-and-play  nature.  However,  although  high  frame  rate  videos  contain  rich  semantic  information,  their
                 inherent  redundancy  leads  to  a  balance  problem  between  information  density  and  computational  efficiency  in  the  temporal  dimension,  with
                 traditional  sampling  strategies  being  susceptible  to  noise  frame  interference.  Furthermore,  in  complex  dynamic  scenes,  background  clutter


                 *    基金项目: 国家自然科学基金  (62562035, 62441203, 62311530101, 62461028); 江西省重点研发计划  (20252BCE310034); 江西省自然科
                  学基金  (20242BAB23012, 20252BAC200182); 江西省双千计划  (jxsq2023101092); 江西省职业早期青年科技人才培养项目  (2025
                  2BEJ730121); 江西财经大学第十九届学生科研课题     (20241126104806366)
                  本文由“多媒体智能理解与生成”专题特约编辑孙立峰教授、闵巍庆副研究员、马占宇教授、蒋树强研究员、彭宇新教授、田丰研究
                  员、黄庆明教授推荐.
                  收稿时间: 2025-05-26; 修改时间: 2025-07-11; 采用时间: 2025-09-05; jos 在线出版时间: 2025-09-23
                  CNKI 网络首发时间: 2025-12-25
   66   67   68   69   70   71   72   73   74   75   76