Page 483 - 《软件学报》2026年第2期
P. 483
962 软件学报 2026 年第 37 卷第 2 期
( ( ) )
D
F = Up WC F D + F D (11)
i i i
R
S
i
其中, F 表示残差网络第 层输出的特征, F 表示 Swin Transformer 网络第 i 层输出的特征, Up(·) 表示双线性插
i
i
值上采样操作, F D i 表示第 i 层解码器输出的特征, Concat(·) 表示在通道方向上进行特征拼接操作, WC(·) 表示宽卷
积, Conv(·) 表示普通卷积.
3 实验分析
3.1 数据集和评价指标
目前, 主流的显著性目标检测数据集包括两个低分辨率数据集, 分别是 DUTS [20] 和 DUT-OMRON [21] , 以及 3
个高分辨率数据集, 包括 HRSOD [22] 、DAVIS-S [23] 和 UHRSD . 这 5 个数据集包含了显著性目标检测任务中常见
[2]
情形, 覆盖了多种类别的显著物体, 同时也包含多种场景, 例如城市、森林、沙滩、室内等, 十分适合对显著性目
标检测算法进行训练和评估.
评价指标能够提供客观的性能度量标准, 避免了主观评价的偏差, 使得不同研究方法的比较更加公平和准确.
在此次实验中, 选用 4 种不同的评价指标, 从不同角度去衡量显著性目标检测模型的性能, 分别是 F-measure 指标 [24] 、
S-measure 指标 [25] 、E-measure 指标 [26] 和平均绝对误差 (mean absolute error, MAE) [27] . 其中, F-measure 是通过调和
精确率 (precision) 和召回率 (recall) 的值来综合评价模型的性能; S-measure 指标可以衡量目标检测结果与真实标
注之间的结构相似性; E-measure 指标从结构相似性和细节差异两个方面综合衡量模型性能; 平均绝对误差用于衡
量模型预测值与真实值之间的平均绝对偏差.
3.2 实验设置
实验平台的操作系统为 Ubuntu 20.04.4 LTS, 配置 Python 3.8 环境, 基于 PyTorch 框架实现网络模型, 使用一
张 RTX 2080Ti 显卡来加速训练. 网络结构方面按照前文所述设计依次搭建. 整个网络使用随机梯度下降法 (SGD) [28]
进行端到端训练. 将两个编码器的最大学习率设置为 0.000 1, 解码器的最大学习率设置为 0.001. 训练过程中采用
余弦退火 (cosine annealing) 学习率衰减 [29] 策略, Momentum 和权重衰减分别设置为 0.9 和 0.000 5. 批量化大小
(batch size) 设置为 4, 最大迭代次数 (epoch) 设置为 50.
本次实验采用两种不同的数据集组合方式来训练模型, 以探究其对模型性能的影响. 首先是单独使用低分辨
率数据集 DUTS 进行训练, 这有助于评估模型在处理普通分辨率图像时的性能表现, 并验证其在常见场景下的适
用性. 其次, 采用低分辨率数据集 DUTS 和高分辨率数据集 HRSOD 的组合进行训练. 这种组合训练方式可以使模
型在更广泛的场景下学习特征, 提高其对不同分辨率图像的泛化能力. 在测试过程中, 需要对每个图像的大小进行
统一调整, 将其调整为相同的大小. 这一步骤的目的是确保在输入到网络中之前, 所有图像都具有相同的尺寸, 以
便模型能够统一处理, 减少因图像大小差异而引入的偏差.
测试实验分为两组. 一组在低分辨率数据集 DUTS 和 DUT-OMRON 上进行性能测试. 这组实验旨在评估模
型在处理普通分辨率图像时的性能, 并验证其在常见场景下的泛化能力. 另一组实验则在高分辨率数据集 DAVIS-S、
HRSOD 和 UHRSD 上测试模型在处理高分辨率图像时的性能表现. 通过这两组实验, 可以全面了解模型在不同分
辨率图像上的表现, 为实际应用提供更全面的参考依据.
3.3 整体性能评估
为了验证基于边缘增强的宽解码器显著性目标检测方法的有效性, 选择了几种常用的对比网络, 包括 CPD [30] 、
3
[2]
SCRN [31] 、DAS [32] 、F Net [33] 、GCPA [34] 、ITSD [35] 、LDF [36] 、CTD [37] 、PFS [38] 、SelfReformer [39] 和 PGNet , 这些对
比方法代表了当前显著性目标检测领域的一些主流模型架构. 对所有网络进行了训练, 并将它们在 5 个公共数据
集上的指标值进行了对比, 并给出具体结果. 其中, 标注“D”表示模型在 DUTS 数据集上进行训练, “DH”表示在
DUTS 和 HRSOD 数据集上混合训练, 粗体数字表示每个数据集上的最优性能值. F max 表示多个 F-measure 值中的
最大值, S m 和 E m 分别表示 S-measure 和 E-measure 指标的取值, 符号“↑”表示该指标值越大性能越好, 符号“↓”表示

