Page 412 - 《软件学报》2026年第5期
P. 412

唐昊 等: 基于视觉    Transformer 的双视图融合细粒度图像识别                                         2291


                  2.2   局限性分析
                    通过第   2.1  节对视觉  Transformer 核心架构的详细分析, 可以发现几个结构性的缺陷: (1) 缺乏空间归纳偏置:
                 模型依赖于图像块的位置编码与注意力权重来建模空间关系, 缺少类似于卷积操作的局部归纳偏置; (2) 感受野固
                 定: 固定的图像块尺寸限制了关键特征的捕捉, 尤其在区分细微差异时显得不足; (3) 注意力均等化: 尤其在区分细
                 微差异时显得不足; (4) 全局优先: 尽管分类标记嵌入在提取全局上下文信息方面表现出色, 它却往往无法精准捕
                 捉关键的局部特征差异. 当视觉          Transformer 在处理具有复杂背景的细粒度图像识别任务时, 这些内在的结构性缺
                 陷突显了模型在处理需要背景噪声时的局限性, 具体表现为: (1) 分类标记嵌入稀释: 由于视觉                         Transformer 均等地
                 处理每个图像块, 大量背景块的特征可能被错误地引入分类标记嵌入中, 影响全局特征的准确表达; (2) 特征块处
                 理的均等化: 视觉     Transformer 无法区分含有目标特征的关键图像块与背景噪声块, 这降低了模型对目标特征的关
                 注, 增加了背景噪声对目标对象的干扰; (3) 类别间视觉相似性误导: 在背景特征与目标物体视觉属性相似的情况
                 下, 视觉  Transformer 可能会将背景的某些部分错误地解释为目标类别的特征, 特别是在不同类别的图像具有相似
                 背景的情况下. 为了克服这些限制, 本研究提出了一系列改进策略, 旨在增强模型对背景噪声的鲁棒性, 优化对关
                 键特征的捕捉能力.

                  3   本文方法

                    本文提出了一个双视图融合细粒度图像识别框架, 如前文图                    2  所示. 该框架不仅整合了标准的        ViT  编码器, 还
                 集成了   3  个专为细粒度识别设计的模块: 一个即插即用的基于注意力融合的冗余信息过滤模块、一个无参数的基
                 于注意力阈值的关键区域定位模块, 以及一个局部区域特征自适应增强模块. 在识别过程中, 框架首先使用                                ViT  编
                 码器对输入样本进行基于全局视图的初步分析, 然后通过关键区域定位模块识别并提取出前景区域, 再将这些区
                 域重新送回编码器进行基于局部视图的细粒度识别. 最终, 框架综合全局视图和局部视图的预测结果, 形成最终的
                 识别判断. 本框架的独特之处在于它从全局和局部两个互补的视角高效地利用结构相同且共享参数的                                   ViT  编码
                 器, 可根据输入图像的识别难度动态选择最高效的推理路径.
                  3.1   基于注意力融合的冗余信息过滤
                  3.1.1    冗余信息过滤的动机
                    在细粒度图像识别中, 冗余信息指的是那些对分类决策贡献较小或无关的图像特征, 如背景元素和非关键视
                 觉噪声. 传统   ViT  编码器通过多头自注意力机制捕获丰富的全局上下文信息, 细化这些全局特征并聚集到最后一
                 层的分类标记嵌入中, 但这可能忽略图像中关键的局部区域信息. 此外, 自注意力机制的全局性质有时会错误地将
                 注意力分配给与目标类别无关的图像区域, 如背景树木或建筑. 因此, 如何确保模型聚焦于含有类别决定性特征的
                 图像区域, 是提高     ViT  模型在细粒度图像识别任务中的关键挑战之一. 近期, 基于掩码图像建模                       (masked image
                 modeling, MIM) 的无监督学习方法    [31,32] 的成功实践表明, 在  ViT  中大约只需   25%  的图像块就能有效表征整张图
                 片的语义信息. 这一发现启发本文在           ViT  编码器的深层处进行冗余信息过滤, 筛选出较为重要的图像块特征嵌入,
                 以增强分类标记嵌入的辨识性.
                  3.1.2    层级注意力的融合
                    He 等人  [14] 指出, 在  ViT  架构中, 编码器的不同层级学习到的局部特征存在差异. 基于这一发现, 本文为具有                    l
                 层编码器的    ViT  模型设计了一个即插即用的冗余信息过滤模块. 该模块巧妙地融合了不同层级间的注意力权重,
                 充分挖掘编码器浅层的细节信息和深层的语义信息. 它自适应地从第                      l−1 层编码器的输出中筛选出具有辨识力的
                                          l 层的输入. 这种方法不仅精细化了最终的分类标记嵌入, 而且有效地进行了冗余
                 图像块特征嵌入, 并将其作为第
                 信息的过滤, 从而提升了整体模型的识别能力和效率. 如图                   3  所示, 对于输入图像    x, 设  ViT  编码器第  l−1 层的
                                    2
                                 1
                                          N
                 输出为   Z l−1 = [x class ;Z ;Z ;...;Z ], 相应的多头自注意力层会根据公式  (3) 中的点积注意力机制计算出的注意力
                                    l−1
                                          l−1
                             l−1
                                l−1
                        A l−1 ∈ R S ×(N+1)×(N+1) . 在此,   N  分别表示注意力头的数目和图像块特征嵌入的数目. 为了保留局部信息
                 分数矩阵                      S  与
                 的完整性并减少计算复杂度, 通过累加操作融合                S  个注意力头的权重, 可得到该层的综合注意力分数矩阵                  ˆ A l−1 ∈
   407   408   409   410   411   412   413   414   415   416   417