Page 43 - 《软件学报》2026年第5期
P. 43

1922                                                       软件学报  2026  年第  37  卷第  5  期


                 态投影机制实现图像语义分割结果与点云几何特征的逐点关联. PointAugmenting                  [36] 方法利用预训练的二维检测模
                 型提取的点状特征来修饰点云, 之后进行三维物体检测. MVP                 [37] 方法提出虚拟点云生成策略, 将检测结果转换为三
                 维空间伪点云, 实现稀疏点云的密度补偿. 此类方法虽提升特征表达精度, 但由于逐点运算特性导致实时性受限.
                    特征级融合方法通过特征空间映射实现高效信息融合. MV3D                   [38] 方法在俯视图特征空间进行跨模态特征拼接,
                 在计算效率与信息完整间取得平衡. AVOD            [39] 方法借鉴特征金字塔方法, 提取出的特征更加高效. 3D-CVF             [40] 使用
                 自校准模块将图像特征转换为鸟瞰图视角, 再通过自适应门控融合模块进行融合. CLOCs                          [41] 使用二维卷积处理稀
                 疏矩阵以学习剔除错误预测. Fast-CLOCs         [42] 则引入 3D-Q-2D 模块, 使方法无需运行两个独立检测器即可工作.
                                                                                           [44]
                      [43]
                 GOOD  提出一种基于优化的晚期融合方法, 对不同维度的结果匹配进行分类和优化. F-PointNet 、PointFusion                     [45]
                 和 F-ConvNet [46] 使用二维检测器生成检测框, 将其投影到平截头体中进行点云裁剪. VPFNet                [47] 将感兴趣区域划分
                 为网格并投影到立体图像特征上, 再将生成的图像特征与体素特征融合. SFD                      [48] 方法提出双流编码架构, 通过区域
                 建议网络生成高置信度三维候选框, 继而分别在点云体素空间与图像像素空间执行双流特征编码, 实现特征空间
                 的几何一致性对齐. TransFusion   [49] 方法引入交叉注意力机制, 以点云候选框为查询实现图像特征动态聚合. Deep-
                 Fusion  [50] 方法构建双向特征交互通道, 通过激光雷达与图像双向投影建立空间对应关系. 通过引入特征金字塔、
                 自适应加权融合等技术, 持续优化跨模态特征对齐精度.
                  3   基于双阶反馈的多模态三维目标检测模型

                    如图  1  所示为我们提出方法的流程架构. 现有基于体素的三维目标检测方法首先被用于生成多传感器信息融
                 合的感兴趣区域      (RoI). 这些感兴趣区域通过提取完整的点云特征并裁剪伪点云, 实现了处理负载与生成误差的双
                 重降低. 此外, 本文引入了一种两阶段迭代融合方法, 以自适应地集成多模态特征与结果, 进而提升检测性能. 主干
                 网络、特征提取以及多模态融合的具体细节将在后续章节中展开论述.

                                      体素
                                      化                           可变形注意力感兴趣
                                                                  区域特征提取模块                  类别
                            点云数据                                                            三维线框
                                       区域提议生成模块      感兴趣                         纯点云
                                                      区域                          特征
                                                   对伪点云
                                                   进行裁剪           多模态交叉注意力
                               深度补全                                  融合模块                   类别
                                                 重投影至二维空间
                                                                                           三维线框
                                                                                多模态特征
                                        伪点云
                                         数据
                                                                 二维稀疏卷积感兴趣                  类别
                                                                  区域特征提取模块
                                                                                            三维线框
                          RGB 图像数据
                                                                                伪点云特征
                                              感兴趣区域伪点云数据                                 多模态结果
                                                                                          融合模块
                                       图 1 多模态双阶反馈的三维目标检测算法整体流程图

                  3.1   数据处理流程
                    本方法的输入数据包括点云、对应视角的 RGB 图像、传感器间的校准参数以及相机的内参和外参, 以实现
                 高效的传感器融合.
                    在点云处理方面, 我们采用 SECOND 网络作为骨干网络, 该网络首先对点云进行体素化, 然后通过三维稀疏
                 卷积和二维卷积生成区域建议           (region proposal). 对于生成的大量区域建议, 我们使用与 Voxel R-CNN 相同的参数
                 设置, 通过非极大值抑制       (non-maximum suppression, NMS) 过滤冗余建议, 筛选后的建议称为感兴趣区域          (RoI), 作
                 为第  2  阶段的输入.
   38   39   40   41   42   43   44   45   46   47   48