Page 418 - 《软件学报》2026年第5期
P. 418
唐昊 等: 基于视觉 Transformer 的双视图融合细粒度图像识别 2297
其他常用细粒度识别数据集, 具有背景复杂、拍摄角度多变、类别数量庞大以及类别间长尾分布明显等特点.
4.2 实验细节
本文选择了含有 12 层编码器的 ViT 基础模型 ViT-B_16 [11] 作为基准网络, 并采用加载来自 ImageNet 预训练
的参数进行模型初始化, 以便确保性能对比的公平性. 遵循细粒度图像识别任务的标准数据增强策略, 所有输入图
像首先被统一调整到 600×600 分辨率. 训练阶段, 采用随机水平翻转作为数据增广手段, 通过随机裁剪得到
448×448 分辨率的图像作为网络输入. 测试阶段, 则仅采用中心裁剪方式, 以最大程度保留样本信息. 实验中, 所有
图像均被划分成 784 个 16×16 大小的图像块. 训练过程中, 双视图相似度对比损失函数的超参数 α 被设定为 0.3,
并使用随机梯度下降法 (SGD) 进行网络训练和优化, 动量 (momentum) 设置为 0.9, 批次大小设为 32. 鉴于
Stanford Dogs 数据集的图片内容复杂度与其他 3 个数据集有所不同, 在该数据集上的训练将学习率初始化为
0.003, 而在其他 3 个数据集上则将学习率初始化为 0.03, 并采用余弦退火策略控制学习率下降. 测试过程中, 自适
应推理策略中的置信度阈值在 4 个数据集上均被设定为 0.8. 本文所有实验都是在配备有 NVIDIA GeForce RTX
3090 GPU (4 张)、Intel Xeon Gold 6330 CPU @ 2.00 GHz 和 256 GB RAM 的高性能服务器上进行. 所使用的操作
系统为 Ubuntu 20.04 LTS, 实验中所有的算法均在 Python 3.7 环境下开发, 依赖深度学习框架 PyTorch 1.10 和
CUDA Toolkit 11.2.
4.3 对比方法定量分析
为了全面验证本文方法的优越性, 本文选取了近年来细粒度图像识别领域的主流方法进行了对比分析. 在
CUB-200-2011、Stanford Dogs、NABirds 和 iNaturalist2017 这 4 个广泛使用的公开数据集上的对比结果展现在
表 1 中, 其中加粗字体的数据表示在相应指标上取得的最佳结果. 这些结果不仅验证了本文方法的有效性, 还展示
了其在不同数据集上的泛化能力.
表 1 不同弱监督细粒度图像识别方法在 CUB-200-2011、Stanford Dogs、NABirds 和 iNaturalist2017 数据集上的
识别准确率对比 (%)
数据集 对比方法 基础网络 Top-1 准确率 数据集 对比方法 基础网络 Top-1 准确率
MSHQP [8] ResNet-50 - MSHQP [8] ResNet-50 90.4
ViT [11] ViT-B_16 90.2 ViT [11] ViT-B_16 90.2
TransFG [14] ViT-B_16 91.1 TransFG [14] ViT-B_16 90.5
[15] [15]
SIM-Trans ViT-B_16 91.3 SIM-Trans ViT-B_16 -
[16] [16]
IELT ViT-B_16 90.9 IELT ViT-B_16 90.6
[29] [29]
API-Net ResNet-101 - API-Net ResNet-101 90.3
[36] [36]
ResNet ResNet-50 84.5 ResNet ResNet-50 82.7
[37] [37]
MA-CNN ResNet-50 86.5 MA-CNN ResNet-50 -
[38] [38]
NTS-Net ResNet-50 87.5 NTS-Net ResNet-50 87.5
[39] [39]
Cross-X ResNet-50 87.7 Cross-X ResNet-50 88.9
[40] [40]
CUB-200-2011 DCL ResNet-50 87.8 Stanford Dogs DCL ResNet-50 -
[41] [41]
MRDMN ResNet-50 88.8 MRDMN ResNet-50 89.1
[42] [42]
FDL DenseNet-161 89.1 FDL DenseNet-161 -
[43] [43]
PRIS ResNet-101 90.0 PRIS ResNet-101 90.7
[44] [44]
CAL ResNet-101 90.6 CAL ResNet-101 88.7
[45] [45]
AA-Trans ViT-B_16 91.4 AA-Trans ViT-B_16 90.8
[46] [46]
ACC-ViT ViT-B_16 91.8 ACC-ViT ViT-B_16 91.3
[47] [47]
MP-FGVC ViT-B_16 91.8 MP-FGVC ViT-B_16 91.0
[48] [48]
MpT-Trans ViT-B_16 92.0 MpT-Trans ViT-B_16 91.4
[49] [49]
CGL ViT-B_16 92.0 CGL ViT-B_16 -
本文方法 ViT-B_16 92.1 本文方法 ViT-B_16 91.7

