Page 42 - 《软件学报》2026年第5期
P. 42

唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法                                                     1921


                 并在推理时间方面达到了最先进           (state-of-the-art, SOTA) 水平.

                  2   相关工作

                  2.1   基于点云的三维目标检测方法
                    基于原始点云的处理方法通常采用             PointNet 系列  [6,7] 进行逐点特征提取. 在此基础上, VoteNet 方法   [8] 揭示了
                 表面点云分布导致的几何中心表征缺失问题, 提出基于偏移矢量场估计的特征重定位机制, 通过空间坐标变换将
                                                                          [9]
                 表面特征向潜在中心区域进行概率密度迁移. 两阶段方法如 PointRCNN 先进行前景分割, 再进行边界框回归.
                 CT3D [10] 则进一步通过通道注意力机制提升检测性能. 3DSSD            方法  [11] 发现特征传播解码层的计算冗余, 构建基于
                 集合抽象层的轻量化预测头, 通过消除层级式特征融合机制, 在确保测量准确性的前提下提升计算效率. 针对深层
                 网络采样性能退化问题, IASSD       方法  [12] 提出双重感知采样策略, 结合目标空间位置与类别先验信息改进采样鲁棒
                 性. SASA  方法  [13] 则通过预测采样点置信度权重, 构建语义引导的加权采样算法, 增强关键区域特征保留能力.
                    在基于体素的方法中, 早期研究聚焦于空间离散化策略优化. 其中, PointPillars 方法                [14] 提出柱状单元空间离散
                 化策略, 通过投影将三维点云压缩至伪二维表征空间. 并通过点云特征提取模块聚合柱状单元内的几何信息, 构建
                 适用于二维卷积处理的特征矩阵. 针对特征矩阵中存在的稀疏分布问题, PillarNet                   [15] 与  PillarNeXt [16] 方法采用稀疏
                 卷积替代常规卷积进行运算, 有效降低计算开销. VoxelNet 方法               [17] 采用均匀体素划分方案, 配合三维卷积神经网
                 络实现结构化特征学习, 其分层特征聚合机制为后续研究奠定重要基础. 为提升计算效率, SECOND                             方法  [18] 使用
                 稀疏卷积, 仅对非空网格执行特征计算. 在检测范式革新方面, CenterNet               [19] 与  AFDet  [20] 方法提出去锚框预测, 消除
                 传统方法中预定义锚框的几何约束. SASSD            方法  [21] 引入点云语义分割辅助任务, 通过多任务联合训练强化网络对
                 目标表面几何结构的感知能力. CIASSD          方法  [22] 提出任务解耦补偿机制, 设计独立的交并比校准分支, 实现分类置
                 信度与定位精度的动态对齐, 有效缓解因任务目标冲突导致的性能衰减问题. PVT-SSD                      方法  [23] 则尝试融合原始点处理
                                                                                        [24]
                 与体素化策略, 构建混合特征表征体系以提升检测精度. 在两阶段网格处理方法中, Pillar R-CNN  和 Voxel R-CNN                   [25]
                 通过添加感兴趣区域检测头和体素池化方法进行特征提取. Casa                   [26] 和 TED [27] 则引入级联预测和旋转不变特征提
                 取以增强检测性能.
                    基于体素的方法通过离散化点云构建结构化特征表示, 其端到端架构在保留局部几何位移特征的同时, 有效
                 平衡了信息完整性, 在运算效率与检测精度方面展现出较强的竞争力. 基于点云的方法虽可实现端到端训练并取
                 得可观的检测精度, 但其核心依赖的最远点采样机制因本质为序列化采样流程, 存在并行计算受限问题.
                    受  Transformer 在视觉领域成功应用     [28] 的启发, 其泛化迁移能力引发三维感知领域的研究变革. DSVT              [29] 方法
                 首次构建面向稀疏体素特征的自适应注意力学习框架, 其设计动态窗口自注意机制, 通过可变形窗口生成器动态
                 划分非空体素区域, 减小计算复杂度. 针对基于              DETR [30] 方法中三维检测器因对象查询监督模糊导致的局部假阳
                 性问题, ConQueR [31] 方法提出查询对比监督机制, 通过抑制非匹配查询置信度并强化最优匹配特征表达, 提升目标
                 检测鲁棒性. OcTr   [32] 方法提出一种基于八叉树层级的注意力机制, 首层通过全局自注意力筛选关键特征标记构建
                 动态八叉树结构, 采用递归式特征广播实现由粗到精的上下文建模, 在保证计算效率的同时增强全局表征能力.
                  2.2   基于多传感器融合的三维目标检测方法
                    基于多传感器融合的方法将来自不同传感器的数据进行融合, 以生成综合信息的表示. 当前主流方法多采用
                 激光雷达与视觉传感器的跨模态融合策略. 其中, 激光雷达提供精确的三维几何表征, 构建具有绝对尺度的空间结
                 构. 而视觉传感器则捕获高分辨率的纹理语义信息, 形成细粒度的场景上下文理解. 基于多模态融合的方法通过构
                 建鲁棒的跨模态对齐机制, 可有效克服单模态存在的几何歧义与语义缺失的双重局限性, 进而构建鲁棒性更强的
                 环境感知系统.
                    点级融合方法通过跨模态特征对齐实现细粒度特征增强, 但面临计算复杂度较高的问题. EPNet                           [33] 方法设计无
                 监督跨模态融合单元, 通过逐点级联图像语义特征优化点云表征, 无需依赖图像标注信息. EPNet++                          [34]  将点云数据
                 投影到图像特征图上进行融合, 并利用融合后的点云特征对图像特征进行重新加权. PointPainting                       [35] 方法通过跨模
   37   38   39   40   41   42   43   44   45   46   47