Page 413 - 《软件学报》2026年第5期
P. 413
2292 软件学报 2026 年第 37 卷第 5 期
R (N+1)×(N+1) . 显而易见, ˆ A l−1 中的第 1 行展示了在第 l−1 层编码器中, 分类标记嵌入 x class 与自身以及 N 个图像块特
l−1
征嵌入间的语义关联程度. 如果图像块特征嵌入与分类标记嵌入的语义相似度较高, 意味着该图像块携带的视觉
信息对于模型输出正确预测类别更为重要. 为了避免仅依赖单一层次的注意力权重而忽略其他层级具有辨识性的
∑ l−1
局部信息, 通过累加前 l−1 层的注意力分数矩阵可得到图像块特征嵌入的综合注意力分数序列 A final = ˆ A i [0,1 :].
i=1
第 l−1 层编码器的输出 第 l 层编码器的输入
K
N …
…
基于注意力融合的
冗余信息过滤 …
…
取前 K 个 T 1 根据索
N 多层融合 最大值 T 2 引筛选
N …
T K
…
位置索引
l−1
N
多层注意力权重矩阵 重要性排序
图 3 基于注意力融合的冗余信息过滤模块流程展示图
3.1.3 冗余信息的过滤
为了更有效地过滤掉冗余噪声信息, 我们对 A final 中的注意力分数进行降序排序, 选择前 K 个最大值对应的位
置索引 [T 1 ,T 2 ,...,T K ]. 接着, 根据这些索引从 Z l−1 中挑选出与分类标记嵌入关联度较高的图像块特征嵌入与第
l−1 层的分类标记嵌入 x class , 组成新的序列 Z select , 输入至编码器的最后一层. 该过程可用公式 (5) 表示:
l−1 l−1
select
Z l−1 = [x class ;Z ;Z ;...;Z ] (5)
T 1
T K
T 2
l−1
l−1
l−1
l−1
与当前大多数基于 ViT x class 作为全局
的细粒度识别方法类似, 只需将编码器最后一层输出的分类标记嵌入
l
特征输入至由一个简单的全连接层构成的线性分类器 FC 1 中, 即可完成基于全局视图的细粒度识别. 预测的类别
P 1 由公式 (6) 计算得出:
概率
( )
P 1 = FC 1 x class (6)
l
其中, FC 1 (·) 表示应用在 x class 上的全连接层, 其输出为各类别的预测概率. 本文所提出的基于注意力融合的冗余信
l
息过滤是一种无参操作, 仅通过对编码器最后一层的输入进行微小改动, 就可以有效去除从背景区域提取的无效
特征. 这种方法不仅融合了不同层级间的局部辨识性信息, 还避免了最终输出的全局分类标记嵌入存在的冗余问
题, 提升对大多数简单样本的辨识能力.
3.2 基于注意力阈值的关键区域定位
3.2.1 关键区域定位的动机
在大多数自然图像中, 复杂的背景往往包含大量噪声信息. 尽管 ViT 模型通过将图像分割为序列化的图像块
来提供了新颖的视觉建模方法, 但很多图像块中可能仅包含背景信息或部分前景对象, 从而可能干扰 ViT 捕获关
键区域的注意力信息, 影响对细粒度类别的识别. 然而, 人类在识别类间差异微小的细粒度类别时, 通常会优先关
注关键对象或区域, 并忽略不重要的背景信息. 受到这种高效视觉处理策略 [33,34] 的启发, 本文提出了一种基于注意
力阈值的关键区域定位模块. 该模块通过对输入图像的注意力激活值进行分析, 自适应地定位和放大关键区域, 从
而构成新的局部视图, 使得模型能够更加近距离地观察细粒度目标. 特别是, 当放大关键区域时, 局部视图的细微

