Page 477 - 《软件学报》2026年第2期
P. 477

956                                                        软件学报  2026  年第  37  卷第  2  期


                 进行交互和整合, 以更好地捕捉图像的全局信息. 对于每个窗口内部的特征向量, 首先计算出其内部的注意力矩
                 阵, 接着将不同窗口之间的注意力矩阵进行加权求和, 得到最终的注意力权重. 最后, 利用注意力权重对特征向量
                 进行加权求和, 得到每个窗口的输出特征向量. 而               SW-MSA  结构在  W-MSA  结构的基础上进行了改进, 将每个窗
                 口的特征向量进行平移操作, 从而使得相邻窗口之间的特征能够重叠和共享, 增强了不同窗口之间的信息交互和
                 整合能力.

                                      输入
                                                                   输入
                                     Patch partition
                                                                  标准化
                                    Linear embedding                          标准化
                                                                  W-MSA
                                                                              W-MSA
                                        Swin
                                      Transformer                  相加
                                        block                                  相加
                                                                  标准化
                                                                              标准化
                                     Patch merging
                                                                  感知机
                                                                              感知机
                                        Swin
                                      Transformer                  相加
                                       block                                   相加

                                          输出                                   输出
                                                图 3 Swin Transformer 网络结构

                  1.3   研究难点与挑战
                    随着互联网技术的不断发展, 显著性目标检测作为计算机视觉上游任务中的关键一环, 受到了许多学者的关
                 注和研究, 显著性目标检测算法的精度也在不断提高. 但是, 目前显著性目标检测领域仍然存在许多研究难点和挑
                 战, 主要表现在以下两个方面. 一是针对高分辨率图像的有效检测. 现有大多数显著性目标检测算法在处理高分辨
                 率图像时, 为了避免出现计算量过高的问题, 选择将图像压缩到统一的低分辨率尺寸后再输入网络. 然而在图像下
                 采样的过程中, 会丢失大量的细节信息, 从而导致最终预测的粒度过粗, 降低了预测分割的质量. 因此, 如何在保持
                 计算效率的同时, 实现对高分辨率图像的精确显著性目标检测成为当前的研究重点. 二是面向复杂场景下的精细
                 像素分割. 在现实世界中, 图像往往会包含复杂的背景, 其中可能包含大量干扰信息, 使得显著目标的检测变得更
                 加困难. 这些复杂的背景可能会掩盖目标, 导致显著性目标检测的精度下降, 例如对人体进行检测时头发丝的分
                 割. 这些细节部分的分割对于显著性目标检测至关重要, 但由于其复杂性, 使得分割过程变得困难. 如何有效地识
                 别和分割这些细微的像素是当前研究中的一个重要挑战.
                  2   本文方法

                    本节主要介绍提出的基于边缘增强的宽解码器显著性目标检测方法, 整体架构由残差网络                                 ResNet、Swin
                 Transformer、差分卷积模块、多尺度注意力模块和多级宽解码器模块组成. 后续将首先详细介绍差分卷积模块,
                 接着介绍多尺度注意力模块和多级宽解码器模块, 最后介绍本网络中使用到的损失函数.
                  2.1   网络结构
                                                                                     [2]
                    基于边缘增强的宽解码器显著性目标检测方法的整体架构如图                       4  所示. 受到  PGNet 模型的启发, 针对高分
                 辨率显著性目标检测任务, 如果单独采用规模较小的模型, 例如残差网络, 则会面临着模型编解码能力不足的限
                 制, 从而无法实现高质量的检测分割结果. 而采用规模稍大的模型, 如                    Vision Transformer, 则会带来巨大的算力消
   472   473   474   475   476   477   478   479   480   481   482