Page 45 - 《软件学报》2026年第5期
P. 45
1924 软件学报 2026 年第 37 卷第 5 期
网格点坐标嵌入 PE(C i ) l f i l ˆ
网格点输出特征
线性层 线性层
网格点初始特征
l
l ΔP i k
f i
采样点坐标偏移 Softmax
l
W i
采样点权重
l
P i
网格点坐标
l
x 函数
三维稀疏特征图 采样点三维特征 特征聚合
图 3 可变形注意力方法提取网格点特征具体原理
网格点
采样点
K=4 K=6 K=26
图 4 采样点初始化方法
对于采样点的注意力权重, 本方法利用一个多层感知机 (MLP) 层生成各采样点的权重, 并最终通过 Softmax
函数对生成的权重进行归一化处理. 具体方法定义如下:
( ( ))
l
l
W = Softmax MLP ReLU (MLP( f )) (2)
i
i
l
l
其中, W 为特征图 F 上网格点 P i 对应采样点的权重矩阵, 其维度大小为 K 且权重和为 1. 因此, 基于采样点的特
i
征与注意力权重, 可通过计算采样点特征向量的加权和得到网格点的特征, 具体计算方法定义为:
K
∑( ( ))
l
ˆl
l
l
f = Concat L W · x P +∆P l (3)
i l=1 i k i i k
k=1
l
f 为最终得到的网格点特征,
其中, ˆl Concat L 表示对各层级网格点获取的特征向量进行拼接操作, W 为特征图 L
i l=1 i k
上感兴趣区域 (RoI) 内网格点 i 的采样点 计算得到的注意力权重, x 为利用采样点在特征图 F 上的坐标获取对
l
l
k
应特征的方法.
可变形注意力方法通过捕捉 RoI 内各层级的网格点特征, 自适应调整采样位置与权重, 从而降低对初始预测
的依赖. 然而, 由于点云数据的稀疏性, 这些特征可能缺乏足够细节以支持高质量预测. 针对这一问题, 本方法将
RGB 图像信息集成到 RoI 表示中, 以实现更全面的多模态特征提取.
3.3 图像特征提取
针对密集且精度有限的伪点云, 我们借助真实点云的粗定位能力进行处理. 首先基于真实点云数据生成 RoI,

