Page 78 - 《软件学报》2026年第5期
P. 78

方承炀 等: 面向免训练视频问答的双重自适应冗余消除                                                      1957



                                表 1 各类视频语言模型在         70  亿参数开放式视频问答任务上的性能对比

                                               大模型                    Open-ended VideoQA (准确率 (%)/分数)
                      类别             模型               视觉编码器
                                              规模 (B)            MSVD-QA  MSRVTT-QA  ActivityNet-QA  TGIF-QA
                                 Video-LLaMA [29]  7   CLIP-G    51.6/2.5  29.6/1.8    12.4/4.1    -
                                 Video-LLaVA [39]  7    ViT-L    70.1/3.9  59.2/3.5    45.3/3.3  70.0/4.0
                                 Vista-LLaMA [40]  7   CLIP-G    65.3/3.6  56.3/3.5    48.3/3.3    -
                                  VideoChat [28]  7    CLIP-G    56.3/2.8  45.0/2.5    26.5/2.2  34.4/2.3
                  训练微调过的模型
                                  VideoChat2 [41]  7   CLIP-L    75.3/4.1  59.3/3.9    49.1/3.4    -
                                Video-ChatGPT [30]  7  CLIP-L    74.3/3.9  62.3/3.7    50.2/2.3    -
                                VideoLLaMA 2 [42]  7   CLIP-L    70.9/3.8    -           -         -
                                   PLLaVA [32]   7     CLIP-L    76.6/4.1  62.0/3.5    56.3/3.5  77.5/4.1
                                   FreeVA [7]    7               73.8/4.1  60.0/3.5    51.2/3.5    -
                                 DeepStack-L [43]  7             76.0/4.0    -         49.3/3.1    -
                                   IG-VLM [6]    7               78.3/4.4  63.7/3.4    54.3/3.4  73.0/4.0
                    免训练模型                              CLIP-L
                                  SF-LLaVA [8]   7               79.1/4.0  65.8/3.4    55.5/3.4  78.7/4.2
                                           [9]
                                Free Video-LLM   7               78.2/4.0  65.6/3.6    54.8/3.4  77.8/4.1
                                   本文方法          7               79.4/4.1  66.5/3.6    54.9/3.4  78.9/4.1

                             表 2 各类视频语言模型在         340 亿或更大参数开放式视频问答任务上的性能对比

                                                     大模型             Open-ended VideoQA (准确率 (%)/分数)
                       类别               模型
                                                     规模 (B)  MSVD-QA   MSRVTT-QA   ActivityNet-QA  TGIF-QA
                                    VideoLLaMA 2 [42]  46.7   70.5/3.8     -          50.3/3.4     -
                  训练微调过的模型        LLaVA-NeXT-Video [33]  34     -          -          58.8/3.4     -
                                  LLaVA-NeXT-DPO [33]  34       -          -          64.4/3.6     -
                                  LLaVA-NeXT-Image [33]  34   73.8/4.1   60.0/3.5     51.2/3.5     -
                                 IG-VLM (LLaVA-v1.6) [6]  34  79.6/4.1   62.4/3.5     58.4/3.5   79.1/4.2
                    免训练模型           SF-LLaVA-34B [8]   34     79.3/4.1   67.0/3.7     58.8/3.5   80.2/4.3
                                    Free Video-LLM [9]  34    79.2/4.1   67.2/3.7     58.9/3.5   79.8/4.3
                                       本文方法            34     79.7/4.1   67.2/3.7     59.0/3.5   80.9/4.3

                    在使用   7B  规模大语言模型时, 模型在视频时序采样和自适应空间采样方面取得显著改进, 这得益于视频帧
                 与提示信息之间以及视频帧与整段视频之间的高效关联建模. 例如, 相较于                        Free Video-LLM  方法, 我们的模型在
                 MSVD-QA  数据集上准确率提升了         1.2%, 达到了  79.4%  的准确率, 同时答案质量得分也从         4.0  提升到了  4.1; 在
                 MSRVTT-QA  基准测试上准确率提升         0.9%, 达到了  66.5%  的准确率. 此外, 通过对视频帧与提示词及整体视频之
                 间的强关联建模, 我们的方法在快速路径             (fast pathway) 中实现了高效筛选与优化. 与      SF-LLaVA  相比, 该方法在
                 TGIF-QA  上准确率提升了     0.1%, 达到了  78.9%. 由于我们的方法在零样本视频问答任务中具备强大的知识迁移能
                 力, 因此该方法在不需要额外训练的前提下, 依然表现出与经过训练的视频问答模型相媲美的性能.
                    在使用   34B  规模  LLM  时, 本文所提的方法在多个任务上进一步超越其他最先进的方法. 在                    MSVD-QA  数据
                 集上与   Free Video-LLM  方法对比, 准确率提升了    0.5%, 达到了  79.7%. 在  MSRVTT-QA  数据集上准确率与当前最
                 先进的方法持平. 在      ActivityNet-QA  数据集上准确率达到     59.0%. 在  TGIF-QA  数据集上, 相比于最先进的       SF-
                 LLaVA-34B  方法, 准确率提升了    0.7%.
                    通过使用不同规模的大模型作为基础框架在多个视频问答数据集上进行公平对比实验, 我们的方法在多个数
                 据集上达到最先进的水平, 这证明了我们所提方法的有效性.
                  3.3   消融实验
                    为验证本文模型中各个模块的有效性和高效性, 本文在                   MSVD-QA  数据集上进行了消融实验, 所有实验均基
   73   74   75   76   77   78   79   80   81   82   83