Page 478 - 《软件学报》2026年第2期
P. 478
童彪 等: 基于边缘增强的宽解码器显著性目标检测方法 957
耗. 因此, 本文使用双流主干网络结构来解决上述矛盾. 具体而言, 采用残差网络 ResNet 来进行高分辨率图像的细
节特征提取, 随后对图像进行下采样, 并借助 Swin Transformer 网络提取全局语义特征. 通过这种方式, 既保证了
模型具有高质量的检测性能, 又避免了过高的计算开销.
残差网络
ResBlock DCB
ResBlock DCB
1024×1024×3
ResBlock
ResBlock
监督
C MSA MLWD MSA MLWD MSA MLWD
监督
监督 监督 监督
SwinBlock
SwinBlock
DCB 差分卷积模块
SwinBlock
MSA 多尺度注意力
SwinBlock MLWD 多级宽解码器
Swin Transformer
224×224×3
图 4 模型整体框架
为了提高不同尺度目标的检测能力, 这里选择残差网络的 4 层特征进行输出, 表示为 {R i |i = 2,3,4,5}. 得益于
卷积的独特计算机制, 前两层的浅层特征 R 2 和 R 3 包含丰富的图像细节信息, 如纹理、颜色和边缘形状等信息, 在
这里通过引入差分卷积操作, 能够在浅层特征中增加更丰富的边缘信息, 使得网络能够更准确地捕捉物体的边界
和轮廓, 从而提高了最终模型的分割质量. 这种方法不仅可以有效地改善图像分割任务中的边缘检测效果, 还可以
提升整体的分割性能, 为更精准的目标识别和定位提供了有力支持.
同样地, 选择 Swin Transformer 网络的后 4 层特征 {S i |i = 2,3,4,5} 进行尺寸调整后输出. 为了融合残差网络和
Swin Transformer 网络输出的对应层相同维度的特征, 需要解决两者之间特征类型差异的问题. 残差网络更倾向于
提取细节信息, 而 Swin Transformer 则更擅长提取语义信息. 为此, 引入多尺度注意力模块, 通过学习不同尺度下
的特征关系, 对两种特征进行重新对齐和修正. 这样做可以实现细节信息与语义信息的互补, 并抑制其中多余的背
景噪声, 提高最终模型的性能.
经过多尺度注意力模块的精修后, 特征被输入到多级宽解码器模块进行特征解码. 与传统的显著性目标检测
方法中的经典解码范式不同, 多级宽解码器模块在逐级上采样的过程中加入了大尺寸卷积核. 这些大卷积核能够
获得更大范围的原始感受野, 从而捕获更加全面的上下文信息. 因此, 网络能够更有效地提取抽象的高级特征, 从
而使得其能够更好地理解图像中的语义内容.
与 PGNet 方法不同的是, 本文虽然采用了相同的编码器结构, 但在解码器结构上有显著区别. PGNet 解码器
通过对交叉注意力矩阵进行显式监督来完成特定任务, 利用设计的 CMGM 模块接受编码器的输入特征并计算交
叉注意力矩阵. 而本文的解码器则主要依靠多尺度注意力和多级宽解码器, 深入关注编码器输出的丰富细节特征
信息. 通过计算不同层之间的融合特征信息, 不断修正语义细节和相关联的信息部分, 有效抑制背景噪声.
此外, 在模型的训练阶段, 采用了逐层监督方法. 当特征流处于不同尺度时, 将真实标注按照相同大小进行放
[8]
缩, 然后通过对特征进行卷积并应用 Sigmoid 激活函数进行计算, 将特征值转换为每个像素对应前景或背景的分
类概率. 最后, 通过计算预测图与标注之间的损失来产生梯度. 而逐层监督通过在网络的中间层添加监督信号, 可

