Page 48 - 《软件学报》2026年第5期
P. 48
唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法 1927
除特征融合外, 受 CaSA 方法中的后融合策略与 Box Voting 算法启发, 我们提出一种高效轻量化的多模态后
融合算法——多模态 Box Voting 算法. 该方法通过融合不同模态特征的预测结果生成最终检测结果, 其中各模态
检测结果的融合采用简单的均值计算方法, 具体定义如下:
i
i
box +box +box i
i
box = p v f (6)
3
i
其中, box 表示第 1 个检测框的伪点云特征预测结果, 包含目标置信度及边界框参数等数据; box 表示体素特征
i
v
p
i
的预测结果; box 表示融合特征的预测结果.
f
4 实验结果与分析
4.1 实验数据集
(1) KITTI 数据集
KITTI 数据集是智能驾驶领域最常用的数据集, 其提供了包括目标检测、目标跟踪、语义分割、深度补全、
深度估计等方面的任务的标签以及评估方案, 可应用于各个与智能驾驶相关的视觉任务. KITTI 数据集中包含了
多视角相机采集的彩色图像和灰度图像, 以及激光雷达采集的点云数据和各个传感器之间的标定参数, 图 9 展示
了 KITTI 数据采集车辆的坐标系以及各个传感器间的位置关系. 数据集的采集场景主要包括城市道路、高速场景
以及乡村道路. 数据以采集时间的形式进行组织, 共包含 7 481 帧训练数据和 7 581 帧测试数据. 训练数据包含标
签, 测试数据不包含标签, 需将预测结果提交至官方服务器才可获得相关指标结果.
Velodyne HDL-64E laserscanner
z All heights wrt. road surface
Point gray flea 2 x y
video cameras x
z y z All camera heights: 1.65 m
Cam 1 (gray)
y Wheel axis Cam 3 (color) 0.06 m
x (height: 0.30 m)
OXTS Cam-to-CamRect Velodyne laserscanner
RT 3003 0.54 m & Camrect- x (height: 1.73 m) 0.05 m
to-Image
GPS/IMU 1.60 m Cam 0 (gray) y x z IMU-to-Velo
0.06 m z
Cam 2 (color) y
0.32 m
Velo-to-Cam GPS/IMU x
1.68 m (height: 0.93 m) z
y
0.80 m 0.81 m 0.48 m
0.27 m
2.71 m
图 9 KITTI 数据集传感器坐标以及相对位置关系
在目标检测任务方面, KITTI 提供了二维图像数据的边界框标注和三维点云数据的边界框标注. 其中, 二维边
界框包含目标在二维图像中的中心点位置以及尺寸等信息, 三维边界框除了包含目标在三维点云中的位置以及尺
寸之外, 还包括目标的航向角. 此外, KITTI 数据集还对目标是否被截断以及是否被遮挡等进行标注. 在评估过程
中, 根据目标的尺寸, 截断程度和遮挡程度, 将目标分为简单、中等、困难这 3 种难度, 并分别计算不同难度下的
平均精度. 最终, 官方网站会以中等难度下的检测精度进行排序展示. 在三维检测任务中, 除了对三维边界框的检
测精度进行评估之外, 还会对鸟瞰图视角下的检测框和航向角的回归精度进行评估.
(2) nuScenes 数据集
nuScenes 数据集是一个面向自动驾驶领域的大规模的公开数据集. 该数据集的场景来自新加坡和波士顿这两
个车辆众多、交通环境复杂的城市, 共包含 1 000 个交通场景, 每个场景时长为 20 s. 这些场景经过精心挑选, 涵
盖了多样化的驾驶行为、复杂的交通状况以及突发情况. nuScenes 数据集的丰富性和复杂性为研究者提供了开发
新方法的机会, 以应对城市环境中每个场景可能包含数十个物体的挑战, 从而实现安全驾驶.
nuScenes 数据集总计包含约 15 h 的驾驶数据, 驾驶路线经过精心设计, 以捕捉具有挑战性的场景. 为了平衡

