Page 52 - 《软件学报》2026年第5期
P. 52
唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法 1931
的提升更加显著. 本节还深入研究了深层特征计算过程中邻居体素的数量 K 对于性能的影响. 其中, K=1 表示直
接使用伪点云所属体素对应的真实点云的体素特征作为深层次特征, 不进行插值. K=6 表示使用距离伪点云体素
最近的 6 个真实点云的体素特征进行插值, 依次类推. 实验结果表明, 本研究所使用的插值技术显著提升了模型的
检测性能, 特别是当 K=6 时, 相比于不使用特征插值技术, 中等难度的检测样本提升近 1 个百分点, 其余类别的样
本提升在 0.5 个百分点左右. 此外, 通过实验结果还观察到, 随着 K 值的增加, 模型检测性能稍有下降, 分析原因可
能是因为参与计算的体素特征较多, 造成了一定的特征模糊.
此外, 我们还将提出的二维稀疏卷积方法 (SPConv2D) 与 SFD 中的 CPConv 方法以及直接使用 PointNet 的方
法在检测精度、推理时间、计算复杂度和参数量方面进行了比较. 表 7 所示的实验结果表明, 与其他两种方法相
比, PointNet 展现出较低的检测性能和推理效率. 这主要是由于伪点云数量众多, 以及 PointNet 的邻域搜索复杂度
较高. 此外, 结果还表明, 我们提出的二维稀疏卷积方法在检测精度、效率、计算复杂度和参数量方面均优于 CPConv.
表 7 伪点云特征提取方法对模型性能的影响
方法 简单 (%) 中等 (%) 困难 (%) 每帧推理时间 (ms) 计算复杂度 (GFLOPs) 参数量 (M)
PointNet 95.06 87.91 85.01 504 42.6 8.8
CPConv 95.47 88.56 85.74 98 28.3 5.2
SPConv2D 95.86 88.71 86.28 53 19.7 4.9
4.5.4 两阶段迭代融合方法的效果
本节关注特征层面和结果层面的集成. 表 8 中的结果表明, 基于网格点的网格级融合因保留了更详细的感兴
趣区域 (RoI) 特征, 其性能优于实例级融合. 在融合方法中, 基于拼接的融合优于基于相加的融合, 但这两者都因
参数和深度补全误差而存在对齐问题. 所提出的两阶段迭代融合方法显著优于上述两种方法.
表 8 多模态特征融合对模型性能的影响 (%)
融合级别 拼接 相加 交叉注意力 简单 中等 困难
√ - - 94.74 87.72 85.49
实例级别
- √ - 94.67 86.89 84.36
√ - - 95.67 88.48 85.87
网格点级别 - √ - 95.49 88.19 85.71
- - √ 95.86 88.71 86.28
在结果融合领域, 本研究主要探究整合不同来源的检测结果对检测性能的影响. 实验结果如表 9 所示. 研究发
现, 对于单个模态的检测结果, 伪点云数据由于比真实点云数据更密集, 因此在直接使用时可以产生具有竞争力的
检测结果. 此外, 通过融合来自不同传感器的检测结果, 模型的检测性能得到进一步提升.
表 9 多模态结果融合对模型性能的影响 (%)
点云域结果 伪点云域结果 融合域结果 简单 中等 困难
√ - - 89.55 86.27 83.83
- √ - 91.33 87.02 85.31
- - √ 95.27 88.12 85.37
√ - √ 95.39 88.48 85.46
- √ √ 95.42 88.53 85.46
√ √ √ 95.86 88.71 86.28
4.6 结果可视化分析
为了更好地评估所提方法, 我们将其检测性能与 Voxel R-CNN 进行比较. 如图 10 所示, 其中红色边界框为基
准框, 绿色边界框为本文方法检测框, 蓝色边界框为对比方法检测框, 红色虚线框为漏检的具体目标. 可以看出, 传

