Page 478 - 《软件学报》2026年第2期
P. 478

童彪 等: 基于边缘增强的宽解码器显著性目标检测方法                                                       957


                 耗. 因此, 本文使用双流主干网络结构来解决上述矛盾. 具体而言, 采用残差网络                      ResNet 来进行高分辨率图像的细
                 节特征提取, 随后对图像进行下采样, 并借助             Swin Transformer 网络提取全局语义特征. 通过这种方式, 既保证了
                 模型具有高质量的检测性能, 又避免了过高的计算开销.

                                    残差网络
                                    ResBlock                                     DCB

                                    ResBlock                      DCB
                     1024×1024×3
                                    ResBlock
                                    ResBlock
                                  监督
                                       C   MSA     MLWD   MSA     MLWD   MSA    MLWD
                                  监督
                                               监督            监督             监督
                                    SwinBlock
                                    SwinBlock
                                                                                       DCB 差分卷积模块
                                    SwinBlock
                                                                                       MSA 多尺度注意力
                                    SwinBlock                                          MLWD 多级宽解码器

                                  Swin Transformer
                        224×224×3
                                                     图 4 模型整体框架

                    为了提高不同尺度目标的检测能力, 这里选择残差网络的                    4  层特征进行输出, 表示为      {R i |i = 2,3,4,5}. 得益于

                 卷积的独特计算机制, 前两层的浅层特征             R 2  和  R 3  包含丰富的图像细节信息, 如纹理、颜色和边缘形状等信息, 在
                 这里通过引入差分卷积操作, 能够在浅层特征中增加更丰富的边缘信息, 使得网络能够更准确地捕捉物体的边界
                 和轮廓, 从而提高了最终模型的分割质量. 这种方法不仅可以有效地改善图像分割任务中的边缘检测效果, 还可以
                 提升整体的分割性能, 为更精准的目标识别和定位提供了有力支持.
                    同样地, 选择    Swin Transformer 网络的后  4  层特征  {S i |i = 2,3,4,5} 进行尺寸调整后输出. 为了融合残差网络和
                 Swin Transformer 网络输出的对应层相同维度的特征, 需要解决两者之间特征类型差异的问题. 残差网络更倾向于
                 提取细节信息, 而     Swin Transformer 则更擅长提取语义信息. 为此, 引入多尺度注意力模块, 通过学习不同尺度下
                 的特征关系, 对两种特征进行重新对齐和修正. 这样做可以实现细节信息与语义信息的互补, 并抑制其中多余的背
                 景噪声, 提高最终模型的性能.
                    经过多尺度注意力模块的精修后, 特征被输入到多级宽解码器模块进行特征解码. 与传统的显著性目标检测
                 方法中的经典解码范式不同, 多级宽解码器模块在逐级上采样的过程中加入了大尺寸卷积核. 这些大卷积核能够
                 获得更大范围的原始感受野, 从而捕获更加全面的上下文信息. 因此, 网络能够更有效地提取抽象的高级特征, 从
                 而使得其能够更好地理解图像中的语义内容.
                    与  PGNet 方法不同的是, 本文虽然采用了相同的编码器结构, 但在解码器结构上有显著区别. PGNet 解码器
                 通过对交叉注意力矩阵进行显式监督来完成特定任务, 利用设计的                      CMGM  模块接受编码器的输入特征并计算交
                 叉注意力矩阵. 而本文的解码器则主要依靠多尺度注意力和多级宽解码器, 深入关注编码器输出的丰富细节特征
                 信息. 通过计算不同层之间的融合特征信息, 不断修正语义细节和相关联的信息部分, 有效抑制背景噪声.
                    此外, 在模型的训练阶段, 采用了逐层监督方法. 当特征流处于不同尺度时, 将真实标注按照相同大小进行放
                                                   [8]
                 缩, 然后通过对特征进行卷积并应用           Sigmoid 激活函数进行计算, 将特征值转换为每个像素对应前景或背景的分
                 类概率. 最后, 通过计算预测图与标注之间的损失来产生梯度. 而逐层监督通过在网络的中间层添加监督信号, 可
   473   474   475   476   477   478   479   480   481   482   483