Page 410 - 《软件学报》2026年第5期
P. 410

唐昊 等: 基于视觉    Transformer 的双视图融合细粒度图像识别                                         2289


                    本文提出的方法在       CUB-200-2011 [17] 、Stanford Dogs [18] 、NABirds [19] 和  iNaturalist2017 [20] 这  4  个常用的细粒度
                 图像识别数据集上进行了全面的对比实验. 实验结果表明, 相比于传统的单视图                          ViT  模型, 本文提出的基于     ViT
                 的双视图识别范式在识别性能上实现了显著的提升. 此外, 与当前最先进的基于                         ViT  模型的细粒度图像识别方法
                 相比, 本文提出的双视图融合细粒度识别框架展现出更加卓越的性能. 这一性能提升归功于本文对                                ViT  编码器的
                 高效利用以及精心设计的推理策略. 这些结果不仅证明了本文方法的有效性, 也展示了其在细粒度图像识别领域
                 的应用潜力.

                  1   相关工作

                    随着深度学习技术的不断发展, 目前的细粒度图像识别方法主要基于卷积神经网络                           (CNN) 和视觉  Transformer
                 (ViT) 这两种模型框架. 其中, 基于     CNN  的方法已相对成熟, 这类方法进一步分为基于强监督学习和基于弱监督学
                 习的两大研究方向. 相比之下, 基于         ViT  的细粒度图像识别方法尚处于起步阶段.

                  1.1   基于卷积神经网络的细粒度图像识别
                  1.1.1    基于强监督学习的算法
                    基于强监督学习的细粒度图像识别算法              [21−24] 主要依赖训练数据集中的额外人工标注信息, 这些信息帮助检测
                 目标物体的边框, 并定位关键局部区域. 进一步地, 通过主干网络提取特征, 并进行特征调整和融合等操作, 最终通
                 过训练分类器实现了较好的识别效果. 具有代表性的研究包括                     Part-based R-CNN  [23] 、Pose-normalized CNN [24] 等.
                 例如, Zhang  等人  [23] 提出的  Part-RCNN  算法, 通过目标检测模型对细粒度图像的局部区域进行检测, 并对这些候
                 选区域进行特征提取, 以便        SVM  分类器的训练. 虽然这种依赖于对象或部位级别标签的强监督方法取得了一定
                 成果, 但其对人工标注信息的高度依赖性使得方法既耗时又成本高昂, 这在一定程度上限制了其实际应用性.
                  1.1.2    基于弱监督学习的算法
                    基于弱监督学习的细粒度图像识别算法不依赖于详细的部位标注, 仅通过图像的标签信息就能捕获全局和局
                 部特征. 特别值得一提的是, 注意力机制的引入极大地提高了弱监督图像识别的性能, 使其成为近年来的研究热
                 点. 当前主流的弱监督模型主要集中于基于区域定位                 [25−27] 和基于特征编码  [9,28,29] 的方法. 基于区域定位的方法通常
                 利用注意力机制和特征聚类等技术定位关键局部区域, 从而提取更有辨识力的视觉特征. 例如, Fu                             等人  [25] 设计的
                 循环注意卷积神经网络        (RA-CNN) 使用注意力区域网络来定位图像中的目标物体区域, 进行裁剪放大后送入下一
                 层网络以获取物体部位级别的图像, 并在最后一层网络中融合全局和局部特征进行预测分类. 另一方面, 基于特征
                 编码的方法则通过计算高阶信息来捕获丰富的关键特征表示, 例如, Yu                     等人  [28] 利用层级双线性结构将图像特征和
                 注意力特征编码为高阶特征向量, 以显著提升网络的特征表达能力.
                    总体来看, 卷积神经网络        (CNN) 作为主干网络在捕捉图像局部区域内细微差异方面存在局限性. 因此, 基于
                 CNN  的细粒度图像识别方法通常通过多次利用骨干网络来提取区域特征, 或通过定位最具辨识力的局部区域来
                 提升捕获细节差异的能力. 然而, 这些方法往往使训练过程复杂化, 并增加了识别过程的复杂度. 鉴于目前基于
                 CNN  的细粒度图像识别方法正面临性能瓶颈, 本文将视觉                 Transformer 引入此领域, 并进一步改进框架结构以提
                 高其在细粒度图像识别任务中的效率和准确度.
                  1.2   基于视觉  Transformer 的细粒度图像识别
                    视觉  Transformer (ViT) [11] 主要由嵌入层和编码器层构成, 其核心是通过多头自注意力机制来捕获全局上下文
                 特征. 作为首个采用纯      Transformer 结构的视觉识别模型, ViT    的架构也被研究人员尝试应用于细粒度图像分类任
                 务, 并探索如何解决      ViT  在数据高效训练和特征提取方面的潜在问题. He 等人              [14] 提出了  TransFG, 这是第  1  个基
                 于  ViT  的细粒度图像识别框架. 其核心思想是利用多头自注意力机制筛选出具有辨识力的图像块, 然后将这些图
                 像块特征嵌入与分类标记嵌入一起作为编码器最后一层的输入, 以进行后续预测分类. 此方法通过处理与目标物
                 体区域高度相关的图像块间的内部关系, 有效提高了识别细微差异的能力. 然而, TransFG                       无法生成多尺度的细粒
                 度识别特征, 为了解决这一问题, Zhang        等人  [30] 提出了自适应注意力多尺度融合模型          AFTrans, 该模型利用注意力
   405   406   407   408   409   410   411   412   413   414   415