Page 419 - 《软件学报》2026年第5期
P. 419

2298                                                       软件学报  2026  年第  37  卷第  5  期


                 表 1    不同弱监督细粒度图像识别方法在          CUB-200-2011、Stanford Dogs、NABirds 和  iNaturalist2017  数据集上的
                                                   识别准确率对比      (%)(续)

                  数据集      对比方法       基础网络      Top-1 准确率      数据集        对比方法       基础网络     Top-1 准确率
                            ViT [11]  ViT-B_16      89.9                   ViT [11]  ViT-B_16    68.7
                           TransFG [14]  ViT-B_16   90.5                 TransFG [14]  ViT-B_16   -
                          SIM-Trans [15]  ViT-B_16  90.3                 SIM-Trans [15]  ViT-B_16  69.9
                            IELT [16]  ViT-B_16     90.1                  IELT [16]  ViT-B_16     -
                           API-Net [29]  DenseNet-161  88.1              API-Net [29]  ResNet-101  -
                           Cross-X [39]  ResNet-50  86.4                  Cross-X [39]  ResNet-50  -
                            PRIS [43]  ResNet-101   88.4                   PRIS [43]  ResNet-101  -
                          AA-Trans [45]  ViT-B_16   90.2                 AA-Trans [45]  ViT-B_16  -
                          ACC-ViT [46]  ViT-B_16    91.3                 ACC-ViT [46]  ViT-B_16  70.2
                          MP-FGVC [47]  ViT-B_16    91.0                 MP-FGVC [47]  ViT-B_16   -
                          MpT-Trans [48]  ViT-B_16  91.3                 MpT-Trans [48]  ViT-B_16  -
                  NABirds                                   iNaturalist2017
                           PAIRS [50]  ResNet-50    87.9                  PAIRS [50]  ResNet-50   -
                           GHRD [51]  ResNet-50     88.0                  GHRD [51]  ResNet-50    -
                            DSTL [52]  Inception-v3  87.9                 DSTL [52]  Inception-v3  -
                          MGE-CNN [53]  SENet-154   88.6                MGE-CNN [53]  SENet-154   -
                            SSN [54]  ResNet-101    -                      SSN [54]  ResNet-101  65.2
                            IARG [55]  ResNet-101   -                     IARG [55]  ResNet-101  66.8
                           TASN [56]  ResNet-50     -                     TASN [56]  ResNet-50   68.2
                           SGRN [57]  ResNet-50     -                     SGRN [57]  ResNet-50   73.6
                            HI2R [58]  ViT-B_16     -                     HI2R [58]  ViT-B_16    73.9
                           SwinFG [59]  Swin-B      -                     SwinFG [59]  Swin-B    73.0
                           本文方法       ViT-B_16      91.9                  本文方法       ViT-B_16    74.1
                    在  CUB-200-2011  数据集上的实验结果表明, 仅使用基础         ViT  模型  [11] 即超越了多数基于传统    CNN  的方法, 达
                 到了  90.2%  的识别准确率. 而当采用本文提出的双视图融合识别框架后, 准确率更是实现了显著的提升, 相较于原
                 始  ViT  模型进一步提升了     1.9%. 这证明了本文所设计模块的有效性以及框架设计的合理性. 在                   Stanford Dogs 数
                 据集上, 本文的模型相比于原始          ViT  模型实现了   1.5%  的准确率提升, 与目前最佳的       MpT-Trans 算法  [48] 相比还提
                 升了  0.3%. 特别地, Stanford Dogs 数据集中包含大量相似的背景区域, 这使得大多数单视图方法具有挑战性. 然而,
                 本文方法中的编码器内部冗余信息过滤模块和外部关键区域定位模块有效地抑制了背景噪声, 显著提升了模型在
                 此类复杂环境中的判别能力. 在          NABirds 数据集上的实验结果更是印证了本文方法的卓越性能. 本文方法不仅大
                 幅度超越了其他算法, 而且在识别准确率上相比目前表现最佳的                     ACC-ViT  模型  [46] 高出  0.6%, 该模型还额外地引
                 入了图卷积网络对目标的结构信息进行建模. 尽管有些方法采用了更深层的卷积网络如                             ResNet-101, 其准确率仍
                 低于本文的方法约       1.0%. 值得注意的是, 本文提出的双视图融合识别框架通过精细的调整和优化处理流程, 未引
                 入额外复杂结构, 便实现了性能的提升. 此外, 在更具挑战性的                 iNaturalist2017  数据集上, 本文方法同样表现优异,
                 取得了   74.1%  的识别准确率. 相较于采用相同        ViT-B_16  基础网络的  HI2R  方法  [58] , 本文方法提高了  0.2%. 更值得
                 关注的是, 与其他主流方法相比, 本文方法表现出明显优势, 例如超越了基于                      Swin Transformer 架构的  SwinFG  模
                 型  [59]  1.1%, 同时显著领先于传统  ResNet 架构的  SGRN  方法  [57]  0.5%. 这一结果充分表明, 本文提出的双视图融合
                 策略不仅能够高效提取细粒度特征, 而且在大型复杂自然环境数据集中具备强大的泛化能力. 综上, 本文所提出的
                 基于  ViT 的双视图融合框架在多个数据集上都展现了显著的优越性.
                  4.4   消融实验
                  4.4.1    双视图识别范式的有效性与高效性分析
                    为验证双视图识别范式在细粒度图像识别任务中的有效性, 本节在                      CUB-200-2011、Stanford Dogs 和  NABirds
   414   415   416   417   418   419   420   421   422   423   424