Page 49 - 《软件学报》2026年第5期
P. 49
1928 软件学报 2026 年第 37 卷第 5 期
目标类别的分布, 数据集中特别增加了包含稀有目标 (如自行车) 的场景. 基于这些标准, 研究团队手动筛选了
1 000 个时长为 20 s 的场景, 并对其进行了精细的人工标注.
在传感器配置方面, nuScenes 数据集配备了 6 个摄像头 (camera), 分别位于车辆的前方 (front)、右前方 (front
right)、左前方 (front left)、后方 (back)、右后方 (back right) 和左后方 (back left). 此外, 车顶 (top) 安装了一个激光
雷达 (LiDAR) 以及 5 个毫米波雷达, 分别位于前方 (front)、右前方 (front right)、左前方 (front left)、右后方 (back
right) 和左后方 (back left). 为了确保多传感器数据集的高质量, 研究团队还对每个传感器的外参 (extrinsics) 和内
参 (intrinsics) 进行了精确校准. 这种严格的校准流程为融合多传感器的数据提供了可靠的基础.
4.2 实验评价指标
在三维目标检测任务中, KITTI 数据集对于三维边界框的评价指标为平均精度 (average precision, AP), 该指标
是将模型在不同的召回率阈值下的平均精度作为最终的衡量指标. 此外, 在 KITTI 数据集中, 不同类别的目标 IoU
阈值设置也不同, 对于体积较大的目标, 例如汽车等, 其 IoU 阈值被设置为 0.7; 对于体积较小的目标, 例如行人等,
其 IoU 阈值被设置为 0.5. 在平均精度的计算方面, KITTI 选用 40 个不同的召回率阈值计算平均精度. 除了三维检
测精度之外, KITTI 数据集还提供了将三维检测框投影到鸟瞰图视角下的检测精度计算以及航向角回归的精度等.
4.3 实现细节
在实验中, 我们将学习率设定为 0.001, 批量大小设定为 6, 且在单个 RTX 3090 GPU 上开展 40 个训练周期的
训练工作, 最终选取召回率最高的检测结果用于测试集的提交. 非极大值抑制的置信度阈值 (该阈值对模型性能有
着显著影响) 被设定为 0.5. 而其他所有参数均维持 OpenPCDet [52] 中的默认设置不变.
4.4 对比实验结果
在本节中, 我们将所提方法与现有的先进多模态三维目标检测算法进行比较, 以验证其有效性. 我们在公开的
KITTI 数据集和 nuScenes 数据集上验证所提方法, 彰显出其有效性.
如表 1 所示, 所提方法在 KITTI 测试集上的性能优于所有现有方法. 其中, Graph-VoI 是 Graph R-CNN 通用框
架与 SECOND (Voxel-based RPN) 及跨模态融合模块结合的多模态变体. 与基准方法 SFD 相比, 我们的方法显著
提高了中等难度样本和高难度样本的检测精度. 然而, 对于简单样本, 检测精度略有下降. 这可能是因为简单样本
的大量伪点云导致最大池化过程中丢失特征更多, 从而影响了检测性能.
表 1 本方法与其他代表性方法在 KITTI 测试集上的对比结果 (%)
汽车 (IoU=0.7)
方法 mAP
简单 中等 困难
[53]
ContFuse 83.68 68.78 61.67 71.38
[38]
MV3D 74.97 63.63 54.00 64.20
[39]
AVOD 83.07 71.76 65.73 73.52
[44]
F-PointNet 82.19 69.79 60.59 70.86
[46]
F-ConvNet 85.88 76.51 68.08 76.82
[54]
MMF 88.40 77.43 70.22 78.68
[40]
3D-CVF 89.20 80.05 73.11 80.79
[33]
EPNet 89.81 79.28 74.59 81.23
[41]
CLOCs 88.94 80.67 77.15 82.25
[55]
MSF-MC 89.63 80.06 75.83 81.84
[56]
Focals Conv 90.55 82.28 77.59 83.47
[47]
VPFNet 91.02 83.21 78.20 84.14
[57]
Graph-VoI 91.89 83.27 77.78 84.31
[34]
EPFNet++ 91.37 81.96 76.71 83.35
[58]
MLF-DET 91.18 82.89 77.89 83.99

