Page 424 - 《软件学报》2026年第5期
P. 424
唐昊 等: 基于视觉 Transformer 的双视图融合细粒度图像识别 2303
到, 尽管置信度阈值的提高带来了准确率的轻微提升, 但推理时间显著增加. 特别是当阈值从 0.9 增至 1.0 时, 推理
时间的增加并未带来准确率的进一步提升, 这暗示了阈值设置为 1.0 时的低效性. 对于 CUB-200-2011 数据集, 识
别准确率在置信度阈值 0.8 时达到 92.1%, 随后保持稳定, 但推理时间持续增加, 尤其是阈值为 1.0 时, 推理时间几
乎翻倍, 达到 141.3 s. 在 Stanford Dogs 数据集上, 置信度阈值对识别准确率的影响较稳定, 保持在 91.6%–91.7% 之
间, 而推理时间则从 117.5 s 逐步上升至 209.3 s, 尤其在阈值 0.9–1.0 之间的增长并未带来显著的准确率提升. 综
合 3 个数据集上的实验结果, 本文选择 0.8 作为统一的置信度阈值, 为不同特性的数据集提供一个稳健的推理策
略, 实现了识别性能与推理效率的最佳平衡. 这一决策旨在不牺牲识别准确性的同时, 避免过度增加推理时间. 本
节的实验研究不仅展示了自适应推理策略在提升细粒度图像识别任务效率方面的有效性, 还证明了通过对不同数
据集的置信度阈值进行精细调整, 可以实现识别性能与推理效率的最佳折中.
92.1
92.0
91.9
识别准确率 (%) 91.7
91.8
91.6
91.5
CUB-200-2011
91.4
Stanford Dogs
91.3 NABirds
12 25 50 75 100
冗余信息过滤阈值 K
图 10 在 CUB-200-2011、Stanford Dogs 和 NABirds 数据集上冗余信息过滤阈值 K 对识别准确率的影响
600 CUB-200-2011 92.4 CUB-200-2011
Stanford Dogs Stanford Dogs
NABirds 92.2 NABirds
500 92.0
推理时间 (s) 400 识别准确率 (s) 91.8
300
200 91.6
91.4
100 91.2
0 91.0
0.5 0.6 0.7 0.8 0.9 1.0 0.5 0.6 0.7 0.8 0.9 1.0
置信度阈值 置信度阈值
(a) 推理时间 (b) 识别准确率
图 11 在 CUB-200-2011、Stanford Dogs 和 NABirds 数据集上自适应推理策略中置信度阈值的参数敏感性分析
4.6 可视化分析
4.6.1 冗余信息过滤效果的可视化
本节通过一系列可视化实验直观地展示了基于注意力融合的冗余信息过滤模块的效果. 图 12(a) 清晰展示了
模型是如何从全局视图和局部视图的图像块中筛选出与分类标记嵌入关联度较高的区域特征. 通过观察所提供的
可视化图像, 可以看到模型对某些关键区域展现出更高的关注度. 这些区域在可视化图像中以高亮像素呈现, 突显
了模型识别过程中的焦点区域. 在全局视图中, 尽管背景复杂, 模型依然能够准确聚焦于鸟类所在区域, 这证明了
注意力融合机制在识别关键信息方面的有效性. 在局部视图中, 模型对鸟类的细节特征, 如头部和翅膀等, 展现出
更精细的关注, 高亮区域准确展示了模型在进行局部特征分析时的精确性. 这进一步证实了本文提出的冗余信息

