Page 84 - 《软件学报》2026年第5期
P. 84
方承炀 等: 面向免训练视频问答的双重自适应冗余消除 1963
IEEE, 2024. 22195–22206. [doi: 10.1109/CVPR52733.2024.02095]
[42] Cheng ZS, Leng SC, Zhang H, Xin YF, Li X, Chen GZ, Zhu YX, Zhang WQ, Luo ZY, Zhao DL, Bing LD. VideoLLaMA 2: Advancing
spatial-temporal modeling and audio understanding in Video-LLMs. arXiv:2406.07476, 2024.
[43] Meng LC, Yang JW, Tian R, Dai XY, Wu ZX, Gao JF, Jiang YG. DeepStack: Deeply stacking visual tokens is surprisingly simple and
effective for LMMs. In: Proc. of the 38th Int’l Conf. on Neural Information Processing Systems. Vancouver: Curran Associates Inc.,
2025. 23464–23487.
附中文参考文献
[1] 胡锦祥, 孟朝晖. 基于视频描述和阅读理解的视频问答研究. 计算机应用研究, 2021, 38(12): 3781–3785. [doi: 10.19734/j.issn.1001-
3695.2021.04.0152]
[2] 姚暄, 高君宇, 徐常胜. 基于自监督图对比学习的视频问答方法. 软件学报, 2023, 34(5): 2083–2100. http://www.jos.org.cn/1000-9825/
6775.htm [doi: 10.13328/j.cnki.jos.006775]
[3] 赵恩源, 宋宁, 聂婕, 王鑫, 郑程予, 魏志强. 面向遥感视觉问答的尺度引导融合推理网络. 软件学报, 2024, 35(5): 2133–2149. http://
www.jos.org.cn/1000-9825/7025.htm [doi: 10.13328/j.cnki.jos.007025]
[4] 殷炯, 张哲东, 高宇涵, 杨智文, 李亮, 肖芒, 孙垚棋, 颜成钢. 视觉语言预训练综述. 软件学报, 2023, 34(5): 2000–2023. http://www.jos.
org.cn/1000-9825/6774.htm [doi: 10.13328/j.cnki.jos.006774]
[38] 郭丹, 姚沈涛, 王辉, 汪萌. 嵌入局部聚类描述符的视频问答 Transformer 模型. 计算机学报, 2023, 46(4): 671–689. [doi: 10.11897/
SP.J.1016.2023.00671]
作者简介
方承炀, 博士, 讲师, CCF 专业会员, 主要研究领域为场景文字视觉问答, 多模态内容理解, 计算机视觉.
朱畅, 硕士生, CCF 学生会员, 主要研究领域为多媒体信号处理.
姜文晖, 博士, 副教授, 博士生导师, CCF 专业会员, 主要研究领域为图像内容理解, 跨媒体分析.
方玉明, 博士, 教授, 博士生导师, CCF 杰出会员, 主要研究领域为计算机视觉, 多媒体信号处理, 视觉质量评估.
鄢杰斌, 博士, 讲师, CCF 专业会员, 主要研究领域为计算机视觉.

