Page 42 - 《软件学报》2026年第5期
P. 42
唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法 1921
并在推理时间方面达到了最先进 (state-of-the-art, SOTA) 水平.
2 相关工作
2.1 基于点云的三维目标检测方法
基于原始点云的处理方法通常采用 PointNet 系列 [6,7] 进行逐点特征提取. 在此基础上, VoteNet 方法 [8] 揭示了
表面点云分布导致的几何中心表征缺失问题, 提出基于偏移矢量场估计的特征重定位机制, 通过空间坐标变换将
[9]
表面特征向潜在中心区域进行概率密度迁移. 两阶段方法如 PointRCNN 先进行前景分割, 再进行边界框回归.
CT3D [10] 则进一步通过通道注意力机制提升检测性能. 3DSSD 方法 [11] 发现特征传播解码层的计算冗余, 构建基于
集合抽象层的轻量化预测头, 通过消除层级式特征融合机制, 在确保测量准确性的前提下提升计算效率. 针对深层
网络采样性能退化问题, IASSD 方法 [12] 提出双重感知采样策略, 结合目标空间位置与类别先验信息改进采样鲁棒
性. SASA 方法 [13] 则通过预测采样点置信度权重, 构建语义引导的加权采样算法, 增强关键区域特征保留能力.
在基于体素的方法中, 早期研究聚焦于空间离散化策略优化. 其中, PointPillars 方法 [14] 提出柱状单元空间离散
化策略, 通过投影将三维点云压缩至伪二维表征空间. 并通过点云特征提取模块聚合柱状单元内的几何信息, 构建
适用于二维卷积处理的特征矩阵. 针对特征矩阵中存在的稀疏分布问题, PillarNet [15] 与 PillarNeXt [16] 方法采用稀疏
卷积替代常规卷积进行运算, 有效降低计算开销. VoxelNet 方法 [17] 采用均匀体素划分方案, 配合三维卷积神经网
络实现结构化特征学习, 其分层特征聚合机制为后续研究奠定重要基础. 为提升计算效率, SECOND 方法 [18] 使用
稀疏卷积, 仅对非空网格执行特征计算. 在检测范式革新方面, CenterNet [19] 与 AFDet [20] 方法提出去锚框预测, 消除
传统方法中预定义锚框的几何约束. SASSD 方法 [21] 引入点云语义分割辅助任务, 通过多任务联合训练强化网络对
目标表面几何结构的感知能力. CIASSD 方法 [22] 提出任务解耦补偿机制, 设计独立的交并比校准分支, 实现分类置
信度与定位精度的动态对齐, 有效缓解因任务目标冲突导致的性能衰减问题. PVT-SSD 方法 [23] 则尝试融合原始点处理
[24]
与体素化策略, 构建混合特征表征体系以提升检测精度. 在两阶段网格处理方法中, Pillar R-CNN 和 Voxel R-CNN [25]
通过添加感兴趣区域检测头和体素池化方法进行特征提取. Casa [26] 和 TED [27] 则引入级联预测和旋转不变特征提
取以增强检测性能.
基于体素的方法通过离散化点云构建结构化特征表示, 其端到端架构在保留局部几何位移特征的同时, 有效
平衡了信息完整性, 在运算效率与检测精度方面展现出较强的竞争力. 基于点云的方法虽可实现端到端训练并取
得可观的检测精度, 但其核心依赖的最远点采样机制因本质为序列化采样流程, 存在并行计算受限问题.
受 Transformer 在视觉领域成功应用 [28] 的启发, 其泛化迁移能力引发三维感知领域的研究变革. DSVT [29] 方法
首次构建面向稀疏体素特征的自适应注意力学习框架, 其设计动态窗口自注意机制, 通过可变形窗口生成器动态
划分非空体素区域, 减小计算复杂度. 针对基于 DETR [30] 方法中三维检测器因对象查询监督模糊导致的局部假阳
性问题, ConQueR [31] 方法提出查询对比监督机制, 通过抑制非匹配查询置信度并强化最优匹配特征表达, 提升目标
检测鲁棒性. OcTr [32] 方法提出一种基于八叉树层级的注意力机制, 首层通过全局自注意力筛选关键特征标记构建
动态八叉树结构, 采用递归式特征广播实现由粗到精的上下文建模, 在保证计算效率的同时增强全局表征能力.
2.2 基于多传感器融合的三维目标检测方法
基于多传感器融合的方法将来自不同传感器的数据进行融合, 以生成综合信息的表示. 当前主流方法多采用
激光雷达与视觉传感器的跨模态融合策略. 其中, 激光雷达提供精确的三维几何表征, 构建具有绝对尺度的空间结
构. 而视觉传感器则捕获高分辨率的纹理语义信息, 形成细粒度的场景上下文理解. 基于多模态融合的方法通过构
建鲁棒的跨模态对齐机制, 可有效克服单模态存在的几何歧义与语义缺失的双重局限性, 进而构建鲁棒性更强的
环境感知系统.
点级融合方法通过跨模态特征对齐实现细粒度特征增强, 但面临计算复杂度较高的问题. EPNet [33] 方法设计无
监督跨模态融合单元, 通过逐点级联图像语义特征优化点云表征, 无需依赖图像标注信息. EPNet++ [34] 将点云数据
投影到图像特征图上进行融合, 并利用融合后的点云特征对图像特征进行重新加权. PointPainting [35] 方法通过跨模

