Page 414 - 《软件学报》2026年第5期
P. 414

唐昊 等: 基于视觉    Transformer 的双视图融合细粒度图像识别                                         2293


                 特征, 如纹理、形状和颜色变化, 将变得更加明显, 这对于区分仅具有微妙差异的细粒度子类别至关重要.
                  3.2.2    注意力阈值的生成
                    考虑到自然图像中目标的视角和大小经常发生变化, 直接采用固定的注意力响应阈值在目标区域定位中往往
                 效果不理想. 基于此, 本文提出一种基于注意力累积分布的自适应阈值生成策略, 用于动态调整图像前景区域的定
                 位, 同时抑制对背景的响应. 在第         3.1.2  节中构建层级注意力机制时, 通过叠加编码器不同层的注意力分数矩阵                     ˆ A i ,
                                         A final ∈ R 1×N  . 该序列有效表征了局部区域的特征响应. 如图      4  所示, 为精准筛选关键
                 即可生成综合注意力分数序列
                 区域, 本文引入了累积分布阈值方法以确定注意力阈值                  τ. 具体地, 首先对   A final  中的所有元素按注意力的大小进行
                 排序, 然后计算每个位置       i 上的累计注意力值      G(i):

                                                            i ∑
                                                                 [ ]
                                                      G(i) =  A final j                                (7)
                                                            j=0

                                                     基于注意力阈值的         裁剪与放大
                                                       关键区域定位





                                                                                  选取最
                                                    累积分布                          大连通
                           N             多层融合        计算  自适应阈值 τ      N            区域
                                                   N
                                                 …
                                                         二值化处理
                           l−1                                                        关键区域掩码
                                   N                                         N
                           多层注意力权重矩阵         重要性排序                      图像块掩码矩阵
                                       图 4 基于注意力阈值的关键区域定位模块流程展示图

                                G(i) 表示从排序后的列表中位置                            τ, 此处设定了一个预定义的阈值参
                    累积注意力值                                0–  i 的总和. 为确定阈值
                 数   u, 当   G(i) 的值首次大于或等于   u 时, 对应的   A final [i] 即为整张图片所需的注意力阈值   τ, 即  τ = A final [i]. 这种自适
                                             u 的取值可以控制通过层级注意力机制从图像块序列中筛选出的关键区域比
                 应阈值生成策略使得累积分布阈值
                 例. 在训练和推理阶段, 根据图像内容和复杂度, 以及累积分布阈值                   u, 本文方法可灵活确定       A final  中的自适应阈值
                 τ, 有效地提升了模型对不同尺度目标的识别能力.
                  3.2.3    关键区域的定位
                    自适应阈值生成策略允许模型更精准高效地定位并关注图像中的关键区域. 在处理不同复杂度的细粒度图像
                 时, 根据所生成的自适应阈值动态地对图像进行注意力裁剪和放大, 从而形成细粒度图像的局部视图. 具体过程如
                 图  4  所示, 首先根据图像块序列的位置信息, 将综合注意力分数序列                 A final  重塑为二维矩阵形状. 然后, 通过对矩阵
                                                                 √  √
                                                             I ∈ R  N× N  , 具体操作定义如下:
                 中各元素   A final (i, j) 进行二值化处理, 生成图像块掩码矩阵

                                                       
                                                        1,  if A final (i, j) > τ
                                                       
                                                       
                                                 I (i, j) =                                          (8)
                                                         0,  otherwise
                                                       
                                                       
                                   τ 的元素值设为    1, 代表判别性关键区域; 小于或等于阈值的元素值设为                 0, 表示背景噪声.
                 其中, 大于自适应阈值
                                                                                 I
                 在生成图像块掩码矩阵        I  后, 具体定位最小边界框的步骤如下: (1) 首先将掩码矩阵   中所有值为                1  的元素对应的
                                                            S  中各元素的坐标信息, 分别求解横坐标和纵坐标的最小
                 位置索引提取出来, 得到坐标索引集合            S ; (2) 根据集合
                                             ,
                                     ,
                                         ,
                 值和最大值, 分别记作       x min x max y min y max ; (3) 最终将上述坐标作为边界框的  4  个顶点, 从而确定出覆盖掩码矩阵
                                                     [            ]
                 中大多数重要区域的最小边界框, 即矩形区域               x min ,y min , x max ,y max . 通过这种方法确定的边界框能够高效地覆盖图
                 像中注意力最高、最具辨识性的区域, 同时适当忽略某些分散的低注意力区域, 从而有效地抑制背景噪声的干扰.
                 这种设计确保了边界框的紧凑性, 集中捕捉了高权重的区域特征, 有助于提升模型的识别性能和计算效率. 最后,
   409   410   411   412   413   414   415   416   417   418   419