Page 417 - 《软件学报》2026年第5期
P. 417
2296 软件学报 2026 年第 37 卷第 5 期
图处理之间灵活切换, 有效地分配注意力以优化效率和准确性. 受此启发, 本文提出了一种基于双视图置信度的自
适应推理策略, 如图 6 所示, 该策略旨在使所提出的双视图融合识别框架更适应细粒度图像分类任务, 在保持高精
度的同时提升推理效率. 本文首先对输入样本执行基于全局视图的细粒度识别, 获取初步预测结果及其置信度. 若
置信度高于设定阈值, 模型将当前预测视为易识别样本, 以此作为最终结果, 停止进一步推理. 若置信度低于阈值,
模型则判定样本为难识别, 随即激活基于注意力阈值的关键区域定位模块, 对输入样本进行基于注意力激活的裁
剪, 并将放大后的视图重新输入编码器进行基于局部视图的细粒度识别, 旨在对难以识别图像的关键部分或特定
特征进行更细致的分析和重新分类. 最终, 两次预测结果结合形成最终的预测判断.
全局视图 基于全局视图的细粒度识别 样本难易程度判断
全局分类
标记嵌入 预测结果的 是
视觉 Transformer 编码器 线性分类器 第 1 次预测结果 置信度是否
大于阈值?
否 单视图预测结果
基于注意力阈值的 判定为难样本需要进行再次识别
关键区域定位
局部区域
特征嵌入
视觉 Transformer 编码器 局部区域特征 自适应增强 线性分类器
局部视图 基于局部视图的细粒度识别 第 2 次预测结果 预测结果加和 双视图预测结果
图 6 基于双视图置信度的自适应推理策略示意图
4 实验与评估
本节将在 4 个广泛使用的细粒度图像识别数据集上进行对比实验, 来验证本文所提方法的优越性. 此外, 本节
还进行了一系列的消融实验, 不仅验证了每个模块对于整体性能的贡献, 而且还涵盖了模型的参数敏感性分析与
可视化分析.
4.1 数据集
本文实验在 4 个极具挑战性的细粒度图像识别数据集上进行: CUB-200-2011 [17] , Stanford Dogs [18] , NABirds [19]
和 iNaturalist2017 [20] .
CUB-200-2011 数据集由加州理工学院和加州大学圣迭戈分校共同发布, 专门用于研究鸟类图像的细粒度分
类问题. 这个数据集涵盖了 200 种鸟类, 每种约有 60 张图片, 总共 11 788 张. 它被官方划分为 5 994 张训练图片
和 5 794 张测试图片.
Stanford Dogs 数据集出自斯坦福大学, 专注于狗的品种识别. 包含 120 个犬种, 总计约 20 580 张图片, 其中 12 000
张用于训练, 8 580 张用于测试. 该数据集的特点是包含了各种背景和姿态的图像, 这对训练和测试能在复杂环境
下识别狗品种的算法非常有帮助.
NABirds 数据集由康奈尔大学发布, 是一个大型的北美鸟类识别数据集. 它包含了 555 个子类别的北美鸟类,
共 48 562 张图像, 分为 23 929 张训练图像和 24 633 张测试图像. 与 CUB-200-2011 相比, NABirds 提供了更多种
类和更多数量的图片, 适合需要大规模数据集进行训练和测试的研究.
iNaturalist2017 数据集来源于真实的生物多样性观察平台 iNaturalist, 涵盖了包括植物、动物、真菌等在内
的 13 个大类, 共计 5 089 个细粒度类别. 其中, 训练集和测试集分别包含 579 184 和 95 986 张图像, 整体规模远超

