Page 176 - 《软件学报》2026年第3期
P. 176
刘孟怡 等: 基于大语言模型的空间数据库自然语言查询转换方法 1139
第 1 组性能验证实验结果表明, NALSpatial 在多种空间查询任务下均表现出良好的稳定性. 空间范围查询、
最近邻居查询、空间 Join 查询和聚合查询的参数调整未对系统的整体可翻译性、翻译精度和响应时间造成显著
影响.
● 数据集规模扩展. 分别将 chinawater 数据集中的地点数量扩展至 4 个不同规模, 即 10 000 (10k)、100 000
(100k)、1 000 000 (1M) 和 10 000 000 (10M). 使用测试用例对每组数据进行测试, 计算平均语义理解时间. 实验结
果表明, 随着数据集规模的增大, 平均语义理解时间始终保持在 2.35–2.55 s 之间, 如图 8(a) 所示. 得益于为知识库
构建的高效哈希表结构, NALSpatial 在进行地点和空间关系查找时具备 O(1) 的时间复杂度, 从而在大规模数据集
上可以实现快速的语义理解.
2.6 2.6
平均语义理解时间 (s) 2.4 平均语义理解时间 (s) 2.5
2.5
2.4
2.3
2.2 2.3
2.2
10k 100k 1M 10M 10 20 40 80
chinawater 数据集规模 测试用例规模
(a) 数据集规模扩展 (b) 测试用例规模扩展
图 8 NALSpatial 的第 2 组性能验证实验结果
● 测试用例规模扩展. 固定 chinawater 数据集中的地点数量为 10k, 考察不同测试用例规模对系统性能的影
响. 设置测试用例的规模分别为 10、20、40 和 80 条查询, 记录并分析平均语义理解时间, 结果如图 8(b) 所示. 实
验结果表明, 无论测试用例规模如何变化, 平均语义理解时间保持在 2.35–2.55 s 间, 验证了 NALSpatial 在高负载
测试用例条件下的响应性能.
第 2 组性能验证实验结果表明, 自然语言理解过程的时间成本主要取决于哈希表的索引效率和实体信息提取
算法, 与数据集和测试用例的规模并无直接线性关系. 因此, NALSpatial 具备良好的横向扩展能力, 能够适应大规
模空间数据集的应用需求.
此外, 为了验证 BiLSTM 在查询类型识别任务中的表现, 对 TextCNN、LSTM、BiLSTM、DistilBERT 和
BERT 模型进行对比实验. 将语料库以 8:2 的比例划分为训练集和测试集, 记录每个模型的平均每轮训练时间和测
试集准确率, 实验结果如表 6 所示. 对比准确率, BiLSTM、DistilBERT 与 BERT 均显著优于 LSTM 和 TextCNN,
其中, BiLSTM 在传统模型中表现最佳, 准确率接近预训练模型水平. 对比训练时间, TextCNN 最短, 但准确率最
低, 难以满足语义理解需求. 与 LSTM 相比, BiLSTM 的训练时间略长, 但准确率提升显著, 在性能与效率之间实现
了更优的平衡. DistilBERT 和 BERT 的准确率虽高, 但训练时间很长, 不利于语料库的持续更新. 相比之下,
BiLSTM 在保持高准确率的同时具备较低训练开销, 综合性能最优, 是训练语料库的最优选择.
表 6 查询类型识别模型的性能对比
模型 平均每轮训练时间 (s) 测试集准确率 (%)
TextCNN 2.43 88.50
LSTM 3.35 94.29
BiLSTM 5.03 98.57
DistilBERT 78.86 99.49
BERT 134.58 99.58

