Page 409 - 《软件学报》2026年第5期
P. 409
2288 软件学报 2026 年第 37 卷第 5 期
定位模块的设计和训练过程都较为复杂. 同时, 由于细粒度图像受到姿态、光照、背景遮挡等多种因素的影响, 基
于 CNN 的方法在提取深层特征时容易受到非特征区域噪声的干扰, 导致识别效果不佳.
近年来, 具有强大全局关系建模能力的视觉 Transformer (vision Transformer, ViT) [11] 成功地将 Transformer [12]
结构应用于视觉识别与检索领域 [13] , 展现出其在捕捉全局和局部特征方面的优势, 并在传统识别任务上的性能超
越了主流的卷积神经网络. ViT 通过将图像切分成固定大小的块, 依次将这些图像块输入至 Transformer 编码器,
并通过级联的自注意力模块提取图像块序列间的交互信息, 从而捕获全局上下文特征, 在大规模图像分类任务中
展示了巨大潜力. 然而, 当 ViT 被应用于细粒度图像识别任务时, 研究者们 [14−16] 发现其存在一些局限性: (1) 冗余
信息处理不足: 自注意力机制平等地处理所有图像块, 无法有效去除背景噪声和冗余信息, 从而影响分类标记特征
嵌入的表示能力, 进而降低识别准确性; (2) 细节信息的丢失: 由于图像分块的固定大小和序列长度的固定性, 这限
制了感受野的有效扩展, 重要的细粒度特征可能会被忽略或部分丢失; (3) 上下文关联不足: 分类标记嵌入与图像
块特征嵌入之间的关联建模不足, 容易忽视局部特征间的依赖关系, 无法捕捉细粒度特征的关键差异. 此外, 尽管
ViT 克服了 CNN 无法捕获长距离依赖方面的不足, 其归纳偏置能力相对较弱. 在细粒度图像识别任务中, 局部区
分性特征的表征对识别效果至关重要, 因此, 如何在 ViT 模型中有效地融合全局上下文信息和局部辨识性特征, 成
为提升细粒度图像识别准确率的关键挑战.
针对这些挑战及现有基于 ViT 方法的局限性, 本文提出了一种高效利用 ViT 模型的细粒度图像识别方法, 并
探索了融合全局视图和局部视图的双视图识别范式. 为了提高对背景冗余信息的处理能力, 本文设计了一个基于
注意力融合的冗余信息过滤模块, 该模块在 ViT 编码器内融合层级间的注意力权重, 筛选出含有丰富语义信息的
图像块特征嵌入, 从而显著提升全局分类标记嵌入的辨识性. 同时, 为了增强对关键局部区域的识别能力, 本文引
入了一个基于注意力阈值的关键区域定位模块, 该模块能够根据图像内容复杂度自适应地定位并放大重要的前景
区域, 提供更具辨识性的局部视图. 这一过程不仅有效减少了由背景带来的噪声干扰, 而且强化了局部关键区域的
特征表达. 进一步地, 针对基于局部视图的细粒度识别, 本文提出了一个局部区域特征自适应增强模块, 该模块通
过给图像块特征嵌入赋予相关性权重, 增强了对局部辨识性特征的关注. 如图 2 所示, 上述 3 个模块被整合到一个
双视图融合识别框架中, 以实现不同层次特征信息与预测结果的融合. 为进一步优化所提出的双视图融合识别框
架, 本文还设计了基于双视图相似度的对比损失函数和基于双视图置信度的自适应推理策略, 前者使 ViT 模型输
出的全局与局部特征更具辨识性, 而后者则进一步节约计算资源和缩短推理时间.
基于全局视图的细粒度识别
线性投影和位置嵌入 N+1 … 层归一化 多头自注意力层 层归一化 多层感知机 基于注意力融合的 冗余信息过滤 … 第 l 个编码器层 标记嵌入 线性分类器
全局视图 分类标 … 全局分类
记嵌入
…
编码器层×(l−1)
特征嵌入
视觉 Transformer 编码器
基于注意力阈值的 结构相同
关键区域定位 参数共享
视觉 Transformer 编码器
分类标
线性投影和位置嵌入 N+1 … … 编码器层×(l−1) 基于注意力融合的 冗余信息过滤 … 第 l 个编码器层 … 局部区域特征 自适应增强 线性分类器
记嵌入
局部视图 … 特征嵌入 局部区域
基于局部视图的细粒度识别 特征嵌入
图 2 基于全局视图和局部视图的细粒度图像双视图融合识别框架

