Page 81 - 《软件学报》2026年第5期
P. 81

1960                                                       软件学报  2026  年第  37  卷第  5  期





                 问题:              答案:                         问题:                答案:

                  我们的描述:
                                                              我们的描述:



                             的描述:
                                                                          的描述:




                              (a) 场景 1: 男子伏案讲解
                                                                          (c) 场景 3: 马匹场地奔跑


                 问题:
                         答案:
                                                              问题:                      答案:
                  我们的描述:
                                                              我们的描述:






                             的描述:
                                                                          的描述:






                              (b) 场景 3: 驾车语音通话                            (d) 场景 4: 卡通形象互动

                                              图 4 零样本视频问答可视化及对比



                                                   表 5 算法复杂度分析表

                                          模型                              推理时间 (s)↓
                                        IG-VLM [6]                           2.94
                                        FreeVA [7]                           2.72
                                       SF-LLaVA [8]                          3.75
                                     Free Video-LLM [9]                      3.47
                                        本文方法                                 3.64
                          注: 加粗字体表示最优结果, “↓”表示数值越低越好

                  4   总 结

                    在免训练视频问答       (VQA) 任务中, 存在两个主要挑战: 时序对齐失准和空间噪声干扰. 为了解决这些问题, 我
                 们提出了一种基于双重自适应冗余消除的免训练视频理解框架. 通过构建文本语义与帧间关系的联合推理机制,
   76   77   78   79   80   81   82   83   84   85   86