Page 44 - 《软件学报》2026年第5期
P. 44
唐文能 等: 交通场景多模态双阶反馈的三维目标检测方法 1923
对于图像数据, 我们采用 TWISE 方法 [51] 对 RGB 图像进行深度补全, 并将其投影到激光雷达坐标系. 该方法
为图像数据提供了与点云可比的深度信息, 便于特征提取与融合. 此外, 通过将图像数据保持在三维空间中, 相比
二维投影能够更好地利用密集的上下文信息.
在上述步骤的基础上, 我们利用点云生成的 RoI 对伪点云 (通过 RGB 图像深度补全技术生成的模拟点云数
据) 进行裁剪, 确保后续阶段仅处理裁剪后的伪点云区域. 随后, 对各模态的 RoI 进行特征提取与融合, 最终利用多
模态特征对 RoI 进行进一步优化.
3.2 点云特征提取
目前, 大多数现有方法在特征提取过程中往往仅聚焦于固定区域, 这一局限性使得区域提议网络 (region
proposal network, RPN) 生成的粗略预测难以实现有效的检测调整. 具体而言, 由于模型未能充分考虑目标周围区
域的上下文特征, 导致初始提议框的空间依赖性利用不足, 难以在后续处理中对目标的位置和类别进行精细化修
正. 针对这一关键问题, 我们提出了一种基于可变形注意力的特征提取方法. 该方法突破了传统固定区域的约束,
赋予模型动态聚焦邻近物体特征的能力, 并通过自适应权重机制对不同位置的特征进行差异化聚合. 通过这种方
式, 模型能够捕捉目标区域与周围环境之间多尺度的空间关联, 有效提取包含丰富细节和结构信息的精细化上下
文特征. 这些经过增强的空间上下文特征为后续感兴趣区域 (RoI) 的调整提供了更具判别性的依据, 显著提升了
边界框回归和分类的准确性. 图 2 展示了两种方法的对比原理.
(a) 体素池化方法原理图 (b) 可变形注意力方法原理图
网格点 非空体素 体素池化搜索区域 体素池化关注的区域 可变形注意力关注的区域
图 2 体素池化方法与可变形注意力方法原理对比
为了充分捕捉感兴趣区域 (RoI) 的环境上下文信息, 本方法将边界框按比例扩大, 以纳入更多周围环境信息.
随后, 系统在该扩展后的边界框内生成规则网格点, 与直接进行 RoI 特征聚合的方法相比, 此方式能够保留更多结
G×G×G 大小的网格 G 设为 6), 并以网格质
构细节. 具体而言, 本方法将 RoI 在三维空间中均匀划分为 (本实验中
心 P i 处的体素特征作为可变形注意力机制的查询向量. 通过可变形注意力机制, 模型将周围环境信息聚合为特征
向量, 随后将这些特征向量组合, 生成适用于 RoI 的点云表示. 图 3 展示了可变形注意力机制的具体原理.
l
网格点的初始特征 f 被设置为其对应的体素特征. 每个网格点配备 K 个采样点, 采样位置初始时分布在网格
i
点周围. 具体初始化方法如图 4 所示.
本方法利用位置嵌入和网格点特征来计算这些采样点的偏移量和注意力权重, 从而在特征聚合过程中实现对
关键采样位置和特征的自适应聚焦. 采样点的偏移量通过两个多层感知机 (multi-layer perceptron, MLP) 层进行计
算, 具体如下所示:
( ( ( ( ( )))))
l
l
∆P = MLP MLP ReLU MLP f + PE C l (1)
i k i i
( )
其中, ∆P 表示采样点相对于其初始位置的三维坐标偏移量, PE C l 表示网格点坐标的位置嵌入. 此步骤的输出
l
i k i
维度为 3, 而输入特征维度与特征图层级相对应. 基于采样点偏移量及其初始坐标, 可确定最终的采样点坐标, 进
而检索对应的体素特征图特征.

