Page 420 - 《软件学报》2026年第5期
P. 420
唐昊 等: 基于视觉 Transformer 的双视图融合细粒度图像识别 2299
这 3 个数据集上对预测结果进行了一系列的消融实验. 消融实验结果展示在表 2 中, 其目的是探索基于全局视图
的识别范式与基于局部视图的识别范式在模型最终性能上的独立和联合影响. 实验结果表明, 在这 3 个数据集上,
虽然仅使用基于全局视图的识别或仅使用基于局部视图的识别就已经能够获得相当高的识别准确率, 但当将双视
图识别范式应用时, 识别准确率得到了更为显著的提升. 此外, 对两种不同视图的识别范式在各数据集上的表现进
行比较后发现, 不同数据集的特性可能对基于全局视图或局部视图识别的效果产生不同影响. 例如, 在 Stanford
Dogs 数据集上, 基于局部视图的识别效果优于基于全局视图的识别, 这可能与该数据集中图片的背景噪声较大有
关. 这一发现提示我们, 在设计细粒度图像识别模型时, 需要根据数据集特性合理融合全局视图与局部视图的上下
文信息.
表 2 CUB-200-2011、Stanford Dogs 及 NABirds 数据集上双视图识别范式的消融实验研究 (%)
数据集 全局视图 局部视图 Top-1 准确率
√ - 91.7
CUB-200-2011 - √ 91.6
√ √ 92.1
√ - 90.3
Stanford Dogs - √ 91.3
√ √ 91.7
√ - 90.6
NABirds - √ 90.9
√ √ 91.9
为进一步分析本文提出的双视图识别范式的高效性, 本节还在 CUB-200-2011 数据集上对比了本文方法
(包括单视图和双视图形式) 与基线模型 ViT [11] 及代表性单视图方法 TransFG [14] 的浮点运算次数 (FLOPs) 和 GPU
内存占用情况. 相关实验结果如表 3 所示, 相较于传统单视图 ViT 模型 [11] 与 TransFG 模型 [14] , 本文提出的单视图
方法在识别准确率方面分别提高了 1.5% 和 1.2%, 而计算复杂度 (以浮点运算次数表示) 与 TransFG 模型基本持
平 (约 62 GFLOPs), GPU 内存占用仅增加 0.14 GB. 进一步采用本文的双视图融合识别方法后, 识别准确率又提升
了 0.4%, 达到了 92.1%, 显示了明显的性能优势; 而 GPU 内存占用仅略微增加至 0.47 GB, 基本未造成额外负担.
尽管双视图方法的浮点运算次数增加到单视图的约 2 倍 (达到 124.51 GFLOPs), 但鉴于本文所设计的自适应推理
策略可根据样本难易程度动态选择是否启用双视图推理, 绝大多数简单样本仍只需单视图即可完成识别任务, 因
此实际应用中, 双视图识别仅针对少部分难识别样本执行, 有效控制了整体计算开销. 这表明本文提出的双视图识
别范式在性能与效率之间实现了良好平衡.
表 3 在 CUB-200-2011 数据集上单视图识别方法与双视图识别方法的高效性对比
对比方法 准确率 (%) 浮点运算次数 (GFLOPs) GPU内存占用 (GB)
[11]
ViT (单视图) 90.2 67.46 0.32
[14]
TransFG (单视图) 90.5 61.97 0.32
本文方法 (单视图) 91.7 62.24 0.46
本文方法 (双视图) 92.1 124.51 0.47
4.4.2 定制化模块的有效性分析
本节深入分析了双视图融合识别框架中各个模块的有效性. 为此, 本文在 CUB-200-2011、Stanford Dogs 和
NABirds 这 3 个数据集上执行了详尽的消融实验, 目的是分析 3 个专门为细粒度图像识别任务设计的模块 (即冗
余信息过滤、关键区域定位和局部特征增强) 对模型性能的具体影响, 其结果已展示于表 4 中. 基线模型 (即传统
的 ViT 模型) 在 3 个数据集上的表现仅为基础水平. 当引入冗余信息过滤模块后, 模型性能在所有数据集上都实
现了显著提升, 尤其是在 CUB-200-2011 和 Stanford Dogs 数据集上, 这证明了冗余信息过滤对于提升模型识别关

