Page 476 - 《软件学报》2026年第2期
P. 476
童彪 等: 基于边缘增强的宽解码器显著性目标检测方法 955
数据预处理 特征计算 结果输出
图像输入 数据增强 特征编码 特征解码 后处理 预测输出
图 2 显著性目标检测系统框架
显著性目标检测系统的输入是一张或一系列图像, 这些图像可能来自摄像头、视频文件或其他图像源. 这些
图像经过统一的缩放、旋转、翻转和归一化等数据增强 [5] 操作之后, 系统才可以使用显著性目标检测算法进行特
征计算.
特征计算的过程通常包含特征编码和特征解码两个步骤. 作为显著性目标检测的第 2 步, 其目的是将输入图
像转换为更高层次、更抽象的特征表示. 这些特征可以是图像的低层特征 (如颜色、纹理等), 或者是高层语义特
征 (如形状、物体边界等). 特征编码器通过学习数据的有效表示, 可以帮助模型更好地理解输入数据的结构和语
义信息, 从而提高模型在各种任务上的性能.
在特征编码之后, 网络中的特征解码器负责对提取的特征进行处理, 将编码器提取的高级抽象特征重新映射
到原始数据的空间, 再采用基于图像对比度、颜色差异、空间先验等方法来计算每个像素的显著性得分或显著性
预测. 通过特征解码器的重建过程, 模型可以学习到输入数据的有效表示, 并且能够保留数据的重要信息. 在获得
图像的显著性得分之后, 通常会使用边缘细化、平滑、阈值设置等方法对显著性预测图进行后处理, 以进一步提
高检测的准确性和鲁棒性. 最后, 系统将对显著性预测图进行阈值处理和区域分割, 以提取出显著性目标的位置信
息, 从而确定图像中的显著性目标的位置.
1.2 Swin Transformer 网络
[6]
随着深度学习的不断发展, Transformer 在自然语言处理领域的成功应用吸引了在计算机视觉领域深耕的研
究人员, Dosovitskiy 等人 于 [7] 2020 年提出了一种基于 Transformer 架构的视觉感知模型 Vision Transformer (ViT). ViT
的主要思想是将图像分割成固定大小的图像块 (patch), 然后将这些图像块转换成序列形式, 并输入到 Transformer
编码器中进行处理.
然而, 当 ViT 网络的输入图像尺寸较大时, 切分出的图像块数量会随之成平方倍地增加, 导致模型参数的数量
呈现出平方级别的增长, 使得模型的空间复杂度过高. 为了解决 ViT 模型存在的问题, Liu 等人 [4] 于 2021 年提出一
种新型网络 Swin Transformer, 该模型使用了一种新的分块策略和层次化的结构, 能够有效地处理大尺寸图像, 并
在多个计算机视觉任务中取得了优异的性能. 首先, Swin Transformer 引入了跨阶段的分块策略, 将输入的大尺寸
图像分解为一系列具有相同大小的小图像块, 但与传统的固定大小的图像块不同, Swin Transformer 采用了一种动
态的分块策略, 即跨阶段分块. 该策略允许图像中不同位置的图像块之间存在重叠, 并且不固定于特定的图像块大
小. 通过重叠区域, Swin Transformer 模型能够在不同图像块之间共享信息, 并允许图像中不同位置的信息得到充
分的利用.
如图 3 所示, 原始的大尺寸图像会通过 Patch partition 模块被划分成一系列大小相同的图像块. 每个图像块会
经过 Linear embedding 层, 将其映射到一个高维的向量空间中, 以便进行后续的处理. 这个过程通常包括一个线性
变换操作, 将每个图像块中的像素值转换成一个特征向量. 经过 Linear embedding 层处理的特征向量将被送入
Swin Transformer block 层进行处理. Swin Transformer block 是 Swin Transformer 中的核心模块, 它由多个
Transformer 层组成. 在这一阶段, 模型会利用自注意力机制来捕捉图像中不同位置之间的关系, 并通过 MLP 层来
实现特征的非线性变换和整合. 最后, 在 Swin Transformer 的最后一个阶段, 经过 Swin Transformer block 处理的特
征向量将通过 Patch merging 层进行整合. Patch merging 层会将不同图像块之间的特征向量进行合并, 以得到整个
图像的全局特征表示. 如图 3 右侧所示, W-MSA 结构首先使用大小相同的窗口对输入特征进行分割, 获得数个特
征集合, 每个特征向量只需要与自身集合内部的其他成员做注意力计算. W-MSA 结构允许模型在不同窗口之间

