Page 419 - 《软件学报》2026年第5期
P. 419
2298 软件学报 2026 年第 37 卷第 5 期
表 1 不同弱监督细粒度图像识别方法在 CUB-200-2011、Stanford Dogs、NABirds 和 iNaturalist2017 数据集上的
识别准确率对比 (%)(续)
数据集 对比方法 基础网络 Top-1 准确率 数据集 对比方法 基础网络 Top-1 准确率
ViT [11] ViT-B_16 89.9 ViT [11] ViT-B_16 68.7
TransFG [14] ViT-B_16 90.5 TransFG [14] ViT-B_16 -
SIM-Trans [15] ViT-B_16 90.3 SIM-Trans [15] ViT-B_16 69.9
IELT [16] ViT-B_16 90.1 IELT [16] ViT-B_16 -
API-Net [29] DenseNet-161 88.1 API-Net [29] ResNet-101 -
Cross-X [39] ResNet-50 86.4 Cross-X [39] ResNet-50 -
PRIS [43] ResNet-101 88.4 PRIS [43] ResNet-101 -
AA-Trans [45] ViT-B_16 90.2 AA-Trans [45] ViT-B_16 -
ACC-ViT [46] ViT-B_16 91.3 ACC-ViT [46] ViT-B_16 70.2
MP-FGVC [47] ViT-B_16 91.0 MP-FGVC [47] ViT-B_16 -
MpT-Trans [48] ViT-B_16 91.3 MpT-Trans [48] ViT-B_16 -
NABirds iNaturalist2017
PAIRS [50] ResNet-50 87.9 PAIRS [50] ResNet-50 -
GHRD [51] ResNet-50 88.0 GHRD [51] ResNet-50 -
DSTL [52] Inception-v3 87.9 DSTL [52] Inception-v3 -
MGE-CNN [53] SENet-154 88.6 MGE-CNN [53] SENet-154 -
SSN [54] ResNet-101 - SSN [54] ResNet-101 65.2
IARG [55] ResNet-101 - IARG [55] ResNet-101 66.8
TASN [56] ResNet-50 - TASN [56] ResNet-50 68.2
SGRN [57] ResNet-50 - SGRN [57] ResNet-50 73.6
HI2R [58] ViT-B_16 - HI2R [58] ViT-B_16 73.9
SwinFG [59] Swin-B - SwinFG [59] Swin-B 73.0
本文方法 ViT-B_16 91.9 本文方法 ViT-B_16 74.1
在 CUB-200-2011 数据集上的实验结果表明, 仅使用基础 ViT 模型 [11] 即超越了多数基于传统 CNN 的方法, 达
到了 90.2% 的识别准确率. 而当采用本文提出的双视图融合识别框架后, 准确率更是实现了显著的提升, 相较于原
始 ViT 模型进一步提升了 1.9%. 这证明了本文所设计模块的有效性以及框架设计的合理性. 在 Stanford Dogs 数
据集上, 本文的模型相比于原始 ViT 模型实现了 1.5% 的准确率提升, 与目前最佳的 MpT-Trans 算法 [48] 相比还提
升了 0.3%. 特别地, Stanford Dogs 数据集中包含大量相似的背景区域, 这使得大多数单视图方法具有挑战性. 然而,
本文方法中的编码器内部冗余信息过滤模块和外部关键区域定位模块有效地抑制了背景噪声, 显著提升了模型在
此类复杂环境中的判别能力. 在 NABirds 数据集上的实验结果更是印证了本文方法的卓越性能. 本文方法不仅大
幅度超越了其他算法, 而且在识别准确率上相比目前表现最佳的 ACC-ViT 模型 [46] 高出 0.6%, 该模型还额外地引
入了图卷积网络对目标的结构信息进行建模. 尽管有些方法采用了更深层的卷积网络如 ResNet-101, 其准确率仍
低于本文的方法约 1.0%. 值得注意的是, 本文提出的双视图融合识别框架通过精细的调整和优化处理流程, 未引
入额外复杂结构, 便实现了性能的提升. 此外, 在更具挑战性的 iNaturalist2017 数据集上, 本文方法同样表现优异,
取得了 74.1% 的识别准确率. 相较于采用相同 ViT-B_16 基础网络的 HI2R 方法 [58] , 本文方法提高了 0.2%. 更值得
关注的是, 与其他主流方法相比, 本文方法表现出明显优势, 例如超越了基于 Swin Transformer 架构的 SwinFG 模
型 [59] 1.1%, 同时显著领先于传统 ResNet 架构的 SGRN 方法 [57] 0.5%. 这一结果充分表明, 本文提出的双视图融合
策略不仅能够高效提取细粒度特征, 而且在大型复杂自然环境数据集中具备强大的泛化能力. 综上, 本文所提出的
基于 ViT 的双视图融合框架在多个数据集上都展现了显著的优越性.
4.4 消融实验
4.4.1 双视图识别范式的有效性与高效性分析
为验证双视图识别范式在细粒度图像识别任务中的有效性, 本节在 CUB-200-2011、Stanford Dogs 和 NABirds

