Page 41 - 《软件学报》2026年第5期
P. 41

1920                                                       软件学报  2026  年第  37  卷第  5  期


                 multi-layer  feature  extraction  that  adaptively  expands  the  receptive  field  to  target  regions;  (2)  2D  sparse  convolution  for  efficient  pseudo-
                 point  cloud  feature  extraction  leveraging  their  regular  distribution  in  the  image  domain;  and  (3)  a  two-stage  feedback  mechanism
                 employing  multi-modal  cross-attention  at  the  feature  level  to  solve  data  alignment  issues  and  an  efficient  fusion  strategy  at  the  decision
                 level  for  interactive  training  across  different  stages.  These  innovations  effectively  resolve  the  trade-off  between  pseudo-point  cloud
                 accuracy  and  computational  load  while  significantly  enhancing  both  feature  extraction  efficiency  and  detection  accuracy.  Experimental
                 results  on  the  KITTI  dataset  demonstrate  the  superior  performance  of  the  proposed  method  in  3D  traffic  object  detection,  validating  its
                 effectiveness and offering a new approach for multi-modal fusion in autonomous driving environmental perception.
                 Key words:  3D object detection; multi-modal fusion; attention mechanism; point cloud processing; traffic scenario

                  1   引 言

                    在智能交通系统       [1] 飞速发展的当下, 无人车作为其核心组成部分, 正逐渐从概念走向现实应用. 无人车要在
                 复杂的交通场景中安全、高效地运行, 精准的环境感知是其关键前提                        [2] . 环境感知旨在实时、准确地获取车辆
                 周边的各类信息, 包括目标物体的位置、形态、运动状态等, 从而为后续的路径规划、决策控制等模块提供可
                 靠依据.
                    近年来, 随着智能驾驶技术的不断演进, 使用多传感器进行环境感知的场景日益增多                           [3] . 多传感器融合能够综
                 合利用不同传感器的优势, 如激光雷达提供的高精度三维空间信息、摄像头捕获的丰富纹理色彩信息等, 从而为
                 无人车构建更全面、准确的环境模型. 然而, 这也使得有效的传感器融合成为该领域的关键研究挑战. 若融合过程
                 处理不当, 不同传感器数据之间会产生干扰, 进而对感知精度产生负面影响, 严重威胁无人车的行驶安全. 因此, 设
                 计鲁棒的融合算法, 以实现最优检测性能, 对于推动智能交通和无人车技术的发展至关重要.
                    当前, 主流的点云三维目标检测方法在一些常用的基准数据集上已经能够实现较为理想的召回率, 表明这些
                 方法已经具备了一定的粗略定位目标的能力. 但是, 由于点云数据自身稀疏性、不规则性等特性以及现有方法的
                 局限性, 现有技术在实现更高精度的检测方面仍面临显著挑战. 为了突破这一局限, 研究者们开始探索引入其他传
                 感器信息, 如摄像头所捕获的图像信息, 以此对点云数据进行补充, 从而有望获得更高精度的检测结果.
                    近期, 诸多研究者尝试利用图像深度补全              [4] 等任务对图像数据进行处理, 并将图像数据生成的伪点云与真实
                 点云数据进行融合, 以此生成高质量的三维目标检测结果. 此类方法的优势在于可以沿用处理三维点云数据的方
                 法来处理伪点云数据, 且与以往基于投影的方法不同, 其能够充分挖掘图像数据中稠密的上下文信息. 但不可忽视
                 的是, 该方法也存在一些问题: 一方面, 相比于真实点云数据, 伪点云数据更加稠密, 数量更多, 这无疑大幅增加了
                 处理所需的计算量, 对硬件设备的计算能力提出了更高要求; 另一方面, 由于深度补全过程中不可避免地存在误
                 差, 导致伪点云难以精确地反映场景的三维真实分布, 从而影响检测的准确性.
                    基于上述观察与分析, 我们提出一种结合伪点云与体素特征的新型两阶段迭代融合方法. 该方法以点云与
                 RGB 图像为输入, 首先从真实点云生成粗检测结果, 随后对 RGB 图像进行深度补全以生成伪点云, 并利用感兴趣
                 区域  (region of interest, RoI) 对其进行裁剪, 进而提取并融合不同传感器数据的特征. 值得一提的是, 除特征融合
                 外, 我们设计的带多层次反馈的多模态融合算法可以进一步优化多模态结果, 有效提升检测的精度与稳定性.
                    本文主要贡献总结如下.
                    (1) 针对真实点云, 提出基于可变形注意力的多层次 RoI 特征提取方法, 将点特征扩展至 RoI 内部之外并自适
                 应融入周围区域信息.
                    (2) 针对图像数据生成的伪点云特征提取, 提出基于二维稀疏卷积的高效 RoI 特征提取方法, 利用伪点云的二
                 维分布规律性提升处理效率.
                    (3) 针对多模态融合, 提出两阶段迭代融合方法, 分别对特征和结果进行融合. 在特征融合阶段, 引入基于交叉
                 注意力的方法解决数据错位导致的融合歧义问题; 同时提出一种简单高效的多模态检测结果融合方法以提升模型
                 性能.
                                                                  [5]
                    (4) 所提方法在车辆检测任务中展现出卓越性能, 在               KITTI 测试集上中等难度平均精度超越众多先进算法,
   36   37   38   39   40   41   42   43   44   45   46