Page 415 - 《软件学报》2026年第5期
P. 415
2294 软件学报 2026 年第 37 卷第 5 期
利用边界框坐标, 通过适当的比例放大, 以与原始输入图像的尺寸保持一致, 并裁剪出相应的图像区域, 最终形成
细粒度图像的局部视图 X, 作为新的输入重新送入 ViT 编码器中进行分析.
3.3 局部区域特征自适应增强
在 ViT 的编码器中, 虽然通过冗余信息过滤模块可以增强分类标记嵌入表达关键特征的能力, 但基于分类标
记嵌入的细粒度识别主要通过自注意力机制捕获全局上下文信息, 在计算图像块特征嵌入注意力的过程中容易忽
略图像局部区域信息. 当通过关键区域定位生成图像的局部视图后, 辨识性区域在特征表示中的比重会增加. 因
此, 本文设计了一种局部区域特征自适应增强模块, 不再依赖基于分类标记嵌入的全局视图识别范式, 而是通过显
式地建模出局部区域之间的相互依赖性, 以提升对局部区域特征嵌入的有效利用, 进一步增强模型对局部视图的
关注度.
X 被重新输入至 ViT 编码器前, 首先对局部视图的图像块序列进行了基于随机擦除
值得注意的是, 局部视图
的数据增强. 具体而言, 本文随机生成与图像块数量一致的、值在 0–1 之间的随机噪声向量, 随后对这些噪声进行
排序, 并选择噪声值最小的 1/10 的图像块进行擦除, 即将这部分图像块的像素值设置为 0. 通过随机擦除图像块序
列中约 1/10 的图像块, 迫使 ViT 模型关注更多局部细节信息, 而不是过度拟合于某些显著特征, 从而提高模型的
2
1
泛化能力. 经过基于注意力融合的冗余信息过滤后, 最后一层编码器的输出可以表示为 Z l = [x class ;Z ;Z ;...;Z K local ],
l l l l
其中 Z K local ∈ R 1×D , K local 代表过滤后的局部区域特征嵌入个数, D 为向量维度. 移除分类标记嵌入 x class 后, 便可得到
l l
2
1
局部区域特征嵌入序列 Z local = [Z ;Z ;...;Z K local ]. 如图 5 所示, 为了让模型自行学习不同局部区域的权重而无需过
l l l l
多人工干预, 本文首先将所有局部区域特征嵌入串联拼接成一组输入向量 Z cat ∈ R 1×(K×D) , 然后通过一个注意力模块
l
捕获局部区域特征嵌入的相关性, 即局部上下文信息. 该注意力模块由两个全连接层和两个激活函数层组成, 输出
Z local K local 个局部区域特征嵌入的权重. 具体过程可
与局部区域特征嵌入数量相等的一组特征权值 s l , 用于刻画 l 中
以表示为:
cat
s l = σ(W 4 δ(W 3 Z )) (9)
l
其中, W 3 ∈ R K local ×(K local ×D) 与 W 4 ∈ R K local ×K local 是两个全连接层的线性变换矩阵, δ(·) 代表 ReLU [35] 非线性激活函数层,
σ(·) 代表 Sigmoid 激活函数层. 最后, 将得到的权值 s l 与对应输入向量加权相乘, 进而得到一系列增强后的局部区
[ ]
aug
2 2
1 1
s
域特征嵌入 Z = Z s ;Z s ;...;Z K local K local . 这种处理方式既抑制了不相关信息的表达, 又降低了注意力计算量.
l l l l l l l
局部区域
特征嵌入
序列
K 局部区域特征自适应增强 线性分类器
…
预测结果
串联 串联
拼接 特征重加权 拼接
…
…
注意力模块 注意力权重 …
局部特征嵌入
图 5 局部区域特征自适应增强模块结构展示图
Z aug 中的所有局部区域特征嵌
在基于局部视图的细粒度识别过程中, 为了进行最终的分类预测, 首先需要将 l
aug
x , 该过程可以通过公式 (10) 表示:
入进行串联拼接, 形成一个综合的特征向量
l
(
x aug = Concat Z aug ) (10)
l l

