Page 422 - 《软件学报》2026年第5期
P. 422

唐昊 等: 基于视觉    Transformer 的双视图融合细粒度图像识别                                         2301


                    为进一步分析公式       (14) 中两个视图分类损失函数权重参数对模型性能的影响, 本节在                   CUB-200-2011  数据集
                                                                               1−α, 变化局部视图损失函数的
                 上进行了详细的消融实验研究. 具体而言, 我们固定全局视图损失函数的权重为
                               α 值对模型识别准确率的影响. 实验结果如图             8  所示, 当局部视图损失函数权重较小时, 模型无
                 权重   α, 探讨不同
                                                             α 逐渐增大, 模型对局部视图特征的关注程度逐渐提高,
                 法有效捕获局部视图的细节特征, 导致准确率较低. 随着
                 识别准确率显著提升, 并在        α = 0.5 时达到最高  (92.1%). 然而, 当  α 继续增大, 模型可能过度依赖局部视图特征, 忽
                 略全局视图的信息补充作用, 导致识别准确率逐渐降低. 综上所述, 适度平衡全局视图与局部视图损失函数的权重
                 至关重要. 本实验结果验证了所提出的双视图损失函数设计的合理性和有效性, 最优权重比例                               α (   =0.5) 能够使模
                 型在全局与局部视图之间达到良好的平衡, 从而充分利用双视图融合框架的优势, 有效提高细粒度图像识别的
                 性能.

                                     92.5
                                                              92.1
                                     92.0                          91.9
                                                         91.8           91.8  91.6
                                     识别准确率 (%)  91.5                             91.0
                                                    91.5

                                     91.0
                                           90.6  90.8
                                     90.5


                                     90.0
                                           0.1  0.2  0.3  0.4  0.5  0.6  0.7  0.8  0.9
                                                       局部视图损失函数权重
                                图 8 在 CUB-200-2011  数据集上局部视图损失函数权重的消融实验研究

                  4.4.4    自适应推理策略的有效性分析
                    为展现自适应推理策略在双视图融合识别框架中的高效作用, 本节在                          CUB-200-2011、Stanford Dogs 和
                 NABirds 这  3  个数据集上进行了一系列实验, 比较了是否采用基于双视图置信度的自适应推理策略对识别准确率
                 和推理时间的影响. 为了确保推理时间测量的准确性与可靠性, 本节实验采用                        PyTorch 1.10  框架的内置时间记录
                 工具进行时间测量. 为稳定        GPU  性能, 实验开始前先以       64  张图像为一个批次, 连续运行       50  个批次进行   GPU  预
                 热. 预热完成后, 以同样的批次大小计算整个数据集的总推理时间. 为保证结果的一致性和准确性, 所有数据集的
                 推理时间测量均重复进行         3  次, 最终结果取   3  次实验的时间平均值. 实验结果如表         5  所示, 在保持准确率不变的同
                 时, 自适应推理策略显著降低了推理时间. 在             CUB-200-2011  数据集上从   142.1 s 减少至  76.6 s, 在  Stanford Dogs
                 从  209.3 s 减少至  136.1 s, 在  NABirds 从  600.8 s 减少至  359.7 s. 这一显著的推理时间优化证明了自适应推理策略
                 在提高效率方面的显著效用. 自适应推理策略的关键在于基于全局视图识别结果置信度动态评估样本难易程度,
                 从而在不牺牲准确率的情况下有效减少推理过程中的计算负担. 这一实验结果不仅验证了该策略的有效性, 而且
                 表明它可以作为一种有效手段将本文的双视图融合识别框架应用于大规模数据集上.

                           表 5 不同推理策略在       CUB-200-2011、Stanford Dogs 和 NABirds 数据集上的性能对比

                                 数据集              自适应推理            准确率 (%)           时间 (s)
                                                     -                92.1            142.1
                              CUB-200-2011
                                                     √                92.1            76.6
                                                     -                91.7            209.3
                              Stanford Dogs
                                                     √                91.7            136.1
                                                     -                91.9            600.8
                                NABirds
                                                     √                91.9            359.7
   417   418   419   420   421   422   423   424   425   426   427