Page 48 - 《软件学报》2026年第5期
P. 48

唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法                                                     1927


                    除特征融合外, 受     CaSA  方法中的后融合策略与        Box Voting  算法启发, 我们提出一种高效轻量化的多模态后
                 融合算法——多模态        Box Voting  算法. 该方法通过融合不同模态特征的预测结果生成最终检测结果, 其中各模态
                 检测结果的融合采用简单的均值计算方法, 具体定义如下:

                                                                i
                                                           i
                                                        box +box +box  i
                                                      i
                                                   box =   p    v    f                                (6)
                                                               3
                        i
                 其中,  box  表示第  1  个检测框的伪点云特征预测结果, 包含目标置信度及边界框参数等数据;                      box  表示体素特征
                                                                                            i
                                                                                            v
                        p
                             i
                 的预测结果;    box  表示融合特征的预测结果.
                              f
                  4   实验结果与分析
                  4.1   实验数据集
                    (1) KITTI 数据集
                    KITTI 数据集是智能驾驶领域最常用的数据集, 其提供了包括目标检测、目标跟踪、语义分割、深度补全、
                 深度估计等方面的任务的标签以及评估方案, 可应用于各个与智能驾驶相关的视觉任务. KITTI 数据集中包含了
                 多视角相机采集的彩色图像和灰度图像, 以及激光雷达采集的点云数据和各个传感器之间的标定参数, 图                                  9  展示
                 了  KITTI 数据采集车辆的坐标系以及各个传感器间的位置关系. 数据集的采集场景主要包括城市道路、高速场景
                 以及乡村道路. 数据以采集时间的形式进行组织, 共包含                 7 481  帧训练数据和   7 581  帧测试数据. 训练数据包含标
                 签, 测试数据不包含标签, 需将预测结果提交至官方服务器才可获得相关指标结果.


                             Velodyne HDL-64E laserscanner
                                     z                               All heights wrt. road surface
                        Point gray flea 2  x  y
                         video cameras  x
                                  z  y     z                         All camera heights: 1.65 m
                                                                       Cam 1 (gray)
                                            y             Wheel axis  Cam 3 (color)  0.06 m
                                        x                (height: 0.30 m)
                                           OXTS                      Cam-to-CamRect  Velodyne laserscanner
                                           RT 3003              0.54 m  & Camrect-  x  (height: 1.73 m)  0.05 m
                                                                       to-Image
                                          GPS/IMU    1.60 m           Cam 0 (gray)  y  x  z  IMU-to-Velo
                                                          0.06 m            z
                                                                     Cam 2 (color)  y
                                                                                                0.32 m
                                                                             Velo-to-Cam  GPS/IMU  x
                                                                    1.68 m          (height: 0.93 m)  z
                                                                                             y
                                                                   0.80 m            0.81 m       0.48 m
                                                                              0.27 m
                                                                           2.71 m
                                         图 9 KITTI 数据集传感器坐标以及相对位置关系

                    在目标检测任务方面, KITTI 提供了二维图像数据的边界框标注和三维点云数据的边界框标注. 其中, 二维边
                 界框包含目标在二维图像中的中心点位置以及尺寸等信息, 三维边界框除了包含目标在三维点云中的位置以及尺
                 寸之外, 还包括目标的航向角. 此外, KITTI 数据集还对目标是否被截断以及是否被遮挡等进行标注. 在评估过程
                 中, 根据目标的尺寸, 截断程度和遮挡程度, 将目标分为简单、中等、困难这                      3  种难度, 并分别计算不同难度下的
                 平均精度. 最终, 官方网站会以中等难度下的检测精度进行排序展示. 在三维检测任务中, 除了对三维边界框的检
                 测精度进行评估之外, 还会对鸟瞰图视角下的检测框和航向角的回归精度进行评估.
                    (2) nuScenes 数据集
                    nuScenes 数据集是一个面向自动驾驶领域的大规模的公开数据集. 该数据集的场景来自新加坡和波士顿这两
                 个车辆众多、交通环境复杂的城市, 共包含              1 000  个交通场景, 每个场景时长为       20 s. 这些场景经过精心挑选, 涵
                 盖了多样化的驾驶行为、复杂的交通状况以及突发情况. nuScenes 数据集的丰富性和复杂性为研究者提供了开发
                 新方法的机会, 以应对城市环境中每个场景可能包含数十个物体的挑战, 从而实现安全驾驶.
                    nuScenes 数据集总计包含约      15 h  的驾驶数据, 驾驶路线经过精心设计, 以捕捉具有挑战性的场景. 为了平衡
   43   44   45   46   47   48   49   50   51   52   53