Page 50 - 《软件学报》2026年第5期
P. 50

唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法                                                     1929


                                 表 1    本方法与其他代表性方法在        KITTI 测试集上的对比结果       (%)(续)

                                                          汽车 (IoU=0.7)
                          方法                                                                  mAP
                                             简单               中等              困难
                        PA3DNet [59]         90.49            82.57           77.88           83.64
                        ACF-Net [60]         90.80            84.67           80.14           85.20
                       URFormer [61]         89.64            83.40           78.62           83.89
                       SFD (基准) [48]         91.73            84.76           77.92           84.80
                         本文方法                90.98            85.07           80.16           85.40
                          提升                 −0.75           +0.31            +2.24            +0.6
                    此外, 本研究还进一步在其余交通要素检测方面进行了探究, 表                    2  展示了本文方法与 SFD 方法的检测效果对
                 比, 从表中可以看出, 本文方法的检测精度在各个类别的检测精度上均有提升, 特别是对于遮挡严重的困难种类的
                 目标, 提升幅度更大, 这也一定程度上表明本研究所提方法的有效性.

                                     表 2 本方法在 KITTI 数据集上骑行者和行人的检测效果               (%)

                                                 骑行者                           行人
                              方法
                                        简单        中等        困难        简单       中等        困难
                              SFD       89.56     72.83     63.29     72.41    65.39     58.39
                            本文方法        90.35     73.67     65.84     72.68    66.87     60.19
                              提升        +0.79     +0.84     +1.55    +0.27     +1.48     +1.80

                    为进一步验证本文方法的先进性和鲁棒性, 本研究基于                  nuScenes 数据集进行了对比实验, 其结果如表          3  所示
                 (↑表示指标越高效果越好, ↓表示指标越低效果越好). 从表               3  可以看出, 本文方法在 nuScenes 数据集上表现十分出
                 色. 尤其在平均精度      (mAP) 和 nuScenes 检测分数  (NDS) 这两项关键指标上, 本文方法的性能尤为突出. 这表明我
                 们的模型在处理 nuScenes 数据集的复杂场景和多样目标时, 具备较高的精度和鲁棒性. 这些结果进一步证明, 本
                 文方法不仅在 KITTI 数据集上表现优异, 在更具挑战性的 nuScenes 数据集上也能保持高水平性能, 充分展现了其
                 良好的泛化能力和实际应用潜力.

                                     表 3 本文方法与现有方法在          nuScenes 验证集上的结果对比

                       方法         mAP↑ (%)    NDS↑ (%)   mATE↓     mASE↓     mAOE↓     mAVE↓     mAAE↓
                     BEVDet         42.2        48.2      0.529     0.236    0.396     0.979     0.152
                    BEVFormer       44.5        53.5      0.582     0.256    0.375     0.378     0.129
                      Far3D         51.0        59.4      0.551     0.258    0.372     0.238     0.195
                     VoxelNeXt      60.5        66.7      0.301     0.252    0.405     0.216     0.185
                    CenterPoint     60.3        67.3      0.262     0.239    0.361     0.288     0.136
                    TransFusion     64.5        69.6      0.269     0.249    0.292     0.266     0.189
                    SparseFusion    70.4        72.8      0.273     0.258    0.342     0.277     0.138
                      CMT           70.3        72.9      0.294     0.260    0.323     0.271     0.131
                   FocalFormer3D    71.6        73.9      0.257     0.248    0.334     0.232     0.134
                       EVT          72.1        74.6      0.250     0.245    0.311     0.201     0.123
                     本文方法           73.1        74.8      0.237     0.231    0.287     0.251     0.128

                  4.5   消融实验结果
                    本节集中对各个提出模块的作用开展深入研究与分析. 所有实验结果均基于 KITTI 验证集获取, 沿用 KITTI
                 测试集的相同评估指标, 并依据 Recall 40       标准进行计算.
                  4.5.1    不同设计组件的使用效果
                    本节研究了每个所提模块对性能的影响. 表              4  中的实验结果表明, 可变形注意力模块提高了检测性能. 它使中
   45   46   47   48   49   50   51   52   53   54   55