Page 476 - 《软件学报》2026年第2期
P. 476

童彪 等: 基于边缘增强的宽解码器显著性目标检测方法                                                       955



                                数据预处理                     特征计算                     结果输出

                           图像输入       数据增强          特征编码       特征解码           后处理       预测输出


                                                图 2 显著性目标检测系统框架

                    显著性目标检测系统的输入是一张或一系列图像, 这些图像可能来自摄像头、视频文件或其他图像源. 这些
                 图像经过统一的缩放、旋转、翻转和归一化等数据增强                   [5] 操作之后, 系统才可以使用显著性目标检测算法进行特
                 征计算.
                    特征计算的过程通常包含特征编码和特征解码两个步骤. 作为显著性目标检测的第                             2  步, 其目的是将输入图
                 像转换为更高层次、更抽象的特征表示. 这些特征可以是图像的低层特征                         (如颜色、纹理等), 或者是高层语义特
                 征  (如形状、物体边界等). 特征编码器通过学习数据的有效表示, 可以帮助模型更好地理解输入数据的结构和语
                 义信息, 从而提高模型在各种任务上的性能.
                    在特征编码之后, 网络中的特征解码器负责对提取的特征进行处理, 将编码器提取的高级抽象特征重新映射
                 到原始数据的空间, 再采用基于图像对比度、颜色差异、空间先验等方法来计算每个像素的显著性得分或显著性
                 预测. 通过特征解码器的重建过程, 模型可以学习到输入数据的有效表示, 并且能够保留数据的重要信息. 在获得
                 图像的显著性得分之后, 通常会使用边缘细化、平滑、阈值设置等方法对显著性预测图进行后处理, 以进一步提
                 高检测的准确性和鲁棒性. 最后, 系统将对显著性预测图进行阈值处理和区域分割, 以提取出显著性目标的位置信
                 息, 从而确定图像中的显著性目标的位置.
                  1.2   Swin Transformer 网络
                                                  [6]
                    随着深度学习的不断发展, Transformer 在自然语言处理领域的成功应用吸引了在计算机视觉领域深耕的研
                 究人员, Dosovitskiy 等人 于 [7]  2020 年提出了一种基于  Transformer 架构的视觉感知模型   Vision Transformer (ViT). ViT
                 的主要思想是将图像分割成固定大小的图像块                (patch), 然后将这些图像块转换成序列形式, 并输入到            Transformer
                 编码器中进行处理.
                    然而, 当  ViT  网络的输入图像尺寸较大时, 切分出的图像块数量会随之成平方倍地增加, 导致模型参数的数量
                 呈现出平方级别的增长, 使得模型的空间复杂度过高. 为了解决                   ViT  模型存在的问题, Liu   等人  [4] 于  2021  年提出一
                 种新型网络    Swin Transformer, 该模型使用了一种新的分块策略和层次化的结构, 能够有效地处理大尺寸图像, 并
                 在多个计算机视觉任务中取得了优异的性能. 首先, Swin Transformer 引入了跨阶段的分块策略, 将输入的大尺寸
                 图像分解为一系列具有相同大小的小图像块, 但与传统的固定大小的图像块不同, Swin Transformer 采用了一种动
                 态的分块策略, 即跨阶段分块. 该策略允许图像中不同位置的图像块之间存在重叠, 并且不固定于特定的图像块大
                 小. 通过重叠区域, Swin Transformer 模型能够在不同图像块之间共享信息, 并允许图像中不同位置的信息得到充
                 分的利用.
                    如图  3  所示, 原始的大尺寸图像会通过         Patch partition  模块被划分成一系列大小相同的图像块. 每个图像块会
                 经过  Linear embedding  层, 将其映射到一个高维的向量空间中, 以便进行后续的处理. 这个过程通常包括一个线性
                 变换操作, 将每个图像块中的像素值转换成一个特征向量. 经过                     Linear embedding  层处理的特征向量将被送入
                 Swin Transformer block  层进行处理. Swin Transformer block  是  Swin Transformer 中的核心模块, 它由多个
                 Transformer 层组成. 在这一阶段, 模型会利用自注意力机制来捕捉图像中不同位置之间的关系, 并通过                        MLP  层来
                 实现特征的非线性变换和整合. 最后, 在           Swin Transformer 的最后一个阶段, 经过   Swin Transformer block  处理的特
                 征向量将通过     Patch merging  层进行整合. Patch merging  层会将不同图像块之间的特征向量进行合并, 以得到整个
                 图像的全局特征表示. 如图        3  右侧所示, W-MSA  结构首先使用大小相同的窗口对输入特征进行分割, 获得数个特
                 征集合, 每个特征向量只需要与自身集合内部的其他成员做注意力计算. W-MSA                        结构允许模型在不同窗口之间
   471   472   473   474   475   476   477   478   479   480   481