Page 480 - 《软件学报》2026年第2期
P. 480

童彪 等: 基于边缘增强的宽解码器显著性目标检测方法                                                       959


                 重点加强边缘特征. 将       4  种特征在维度方向上进行拼接, 再使用卷积降维, 通过跳跃连接与原始特征相加后输出.
                 通过将差分特征与原始特征进行加权相加, 可以进一步增强图像的局部细节和边缘特征, 提高预测图像的视觉质
                 量和对比度.
                    本文提出的差分卷积模块使用           3  种不同类型的差分卷积, 分别是中心差分卷积、环形差分卷积和径向差分卷
                 积. 差分卷积的计算原理是基于各自预先设计的差分模块进行像素差异的计算, 3                         种不同的差分模板如图         7  所示.
                 首先, 对于每个像素点, 差分模块会计算其与相邻像素之间的差值, 从而突出边缘特征的变化. 接下来, 得到的像素
                 差值图像会与卷积内核的权重逐个相乘, 然后将所有相乘得到的结果进行求和. 最终, 这个求和结果会形成特征图
                 中的数值, 反映了图像中不同位置的特征强度或变化程度. 计算过程可以用公式表示为:

                                                         k×k
                                                         ∑
                                                              (    )
                                                      y =  w i · x i − x ′                            (2)
                                                                  i
                                                         i=1
                 其中,   x i  和  x  表示输入图像的像素,   w i  表示尺寸为  k×k 卷积核的权重. 采用并行结构叠加不同类型的差分卷积, 并
                          ′
                          i
                 通过卷积和短接结构重新调整这些不同类型细节信息在最终特征中的表达权重, 从而实现更符合显著性目标检测
                 任务的差分卷积结构.






                                        中心差分模板                           环形差分模板











                                                                 径向差分模板

                                                  图 7 3  种类型的差分模板

                  2.3   多尺度注意力模块
                    注意力机制是      Vision Transformer 成功的重要因素之一. 传统的卷积操作在处理远距离像素之间的依赖关系
                 时存在困难, 而自注意力机制能够通过学习到的权重动态地调整不同位置之间的关系, 使得模型能够更好地捕捉
                 到图像中不同位置之间的长距离依赖关系. 本节提出多尺度注意力模块来计算不同分辨率下的注意力特征.
                    如图  8  所示, 输入特征首先经过连续的卷积池化操作, 获得了               4  层不同尺度的特征      {F i |i = 2,3,4,5}. 从最深层
                 的特征开始, 逐层将相邻尺度的特征送入注意力计算模块. 在这个过程中, 低分辨率的深层特征被变换成二维向量
                 键序列   (key), 而高分辨率的浅层特征被转换成二维向量查询序列                (query) 和值序列  (value). 通过注意力计算, 利用
                 深层特征中的语义信息来指导浅层特征, 以保留显著目标的细节信息. 计算过程用公式表示为:

                                                  (        )       (    K T  )
                                                       K
                                                                     Q
                                                    Q
                                            Attention F ,F ,F V  = Softmax F · F  · F V               (3)
                                                    i  j  i          i  j   i
                 其中,  F  Q   和  F  V  分别是浅层特征经过展平得到二维向量查询序列与值序列,           F  K   是深层特征展平得到的键序列, 根
                       i   i                                                 j
                 据自注意力机制的类似原理, 首先计算查询序列和键序列的相似度, 然后使用                         Softmax 激活函数对相似度进行归
                 一化处理, 得到注意力权重. 接下来, 将注意力权重与值序列相乘, 得到加权的值序列. 最后, 将获得的注意力特征
                 通过跳跃连接与原始特征相加后输出.
   475   476   477   478   479   480   481   482   483   484   485