Page 425 - 《软件学报》2026年第5期
P. 425

2304                                                       软件学报  2026  年第  37  卷第  5  期


                 过滤模块在聚焦细粒度特征上的效力. 此外, 通过比较全局视图和局部视图中的关注区域, 可以推断出模型在全局
                 视图中已初步识别出关键特征, 并在局部视图中进一步强化这些特征的学习. 这种从全局到局部的递进式注意力
                 关注机制有效缓解了背景噪声带来的干扰, 确保了关键特征被模型有效捕捉并加以强化.


















                  全局视图    关键区域定位     局部视图      全局视图     冗余信息过滤     局部视图    冗余信息过滤      输入图片      特征激活
                    (a) 所提出模型中基于注意力融合                  (b) 所提出模型中基于注意力阈值               (c) 所提出模型在处理具有
                        的冗余信息过滤示例                          的关键区域定位示例                   不同背景图片时的注意力
                                                                                           分布可视化图
                                      图 12 本文方法在     CUB-200-2011  数据集上的可视化分析

                  4.6.2    关键区域定位效果的可视化
                    本节通过可视化分析成功地展示了基于注意力阈值的关键区域定位模块在细粒度图像识别中的应用效果. 如
                 图  12(b) 所示的可视化结果清楚地揭示了模型如何在全局视图中通过自适应阈值识别并突出关键区域, 以及如何
                 将这些区域转化为局部视图进行深入分析. 可以看出, 在全局视图                     (第  1  列) 的基础上, 模型生成了图像块掩码矩
                 阵  (第  2  列). 在这些掩码矩阵中, 较亮的像素块表示高于自适应阈值的区域, 被模型识别为包含关键信息和对分类
                 判别至关重要的部分. 较暗的区域则表示注意力分数较低, 通常与图像背景或不重要的前景相关联. 第                               1  列展示了
                 模型处理的原始全局图像, 这些图像包含了丰富的背景信息, 可能为细粒度类别识别带来干扰. 第                             2  列中通过自适
                 应阈值计算得到的图像块掩码矩阵清晰指出了模型所关注的区域, 这些较亮区域的边界与背景噪声形成鲜明对
                 比, 突显了模型认为重要的图像块. 第          3  列的局部视图则展示了经过裁剪和放大的关键区域, 对区分相似子类别至
                 关重要. 这些可视化结果清晰地表明, 本文提出的关键区域定位模块有效地模仿了人类的视觉处理机制, 即在复杂
                 场景中优先关注对任务有决定性影响的视觉信息. 通过自适应阈值的引入, 该模块能够灵活适应不同图像的特性
                 和复杂度, 准确地定位关键视觉特征, 并有效地抑制背景噪声.
                  4.7   局限性与未来工作方向
                  4.7.1    模型的泛化能力
                    本文所提出的双视图融合识别框架在细粒度数据集如                       CUB-200-2011、Stanford Dogs、NABirds  和
                 iNaturalist2017  上展现出了出色的识别性能. 然而, 尽管在这些数据集上取得了高准确率, 但它们的图像背景通常
                 具有较高的一致性和简化性, 未能充分反映自然环境中的复杂性. 在自然环境下, 多变的光照条件、复杂多样的背
                 景噪声以及动态变化的观察视角可能会挑战模型的泛化能力, 导致识别准确率下降. 这主要归因于模型未能有效
                 区分图像的前景与复杂背景噪声. 图           12(c) 清楚地展示了这一问题. 在图中第          1  行, 可以观察到模型在处理简单背
                 景时, 注意力集中在图像的关键前景区域; 而在第               2  行与第  3  行中, 当背景变得复杂时, 模型的注意力分布变得高
                 度分散, 导致模型难以有效识别和聚焦于主要目标. 为了进一步提升模型在实际应用中的泛化能力和实用性, 未来
                 工作计划采取以下几种策略: (1) 背景抑制技术: 深入研究并开发新的算法以更好地区分和抑制背景噪声, 例如通
                 过改进模型的注意力机制, 增强其对图像关键区域的聚焦能力, 而非背景; (2) 多环境数据训练: 在训练阶段引入具
                 有多种背景的图像数据, 使模型能够适应并在多样化的环境中维持性能稳定. 这包括使用生成对抗网络生成的具
   420   421   422   423   424   425   426   427   428   429   430