Page 174 - 《软件学报》2026年第3期
P. 174

刘孟怡 等: 基于大语言模型的空间数据库自然语言查询转换方法                                                  1137



                                                         T   TP  RT
                                          100                               2.60
                                           75                               2.55
                                         T和TP (%)  50                       2.50  RT (s)


                                           25                               2.45

                                           0                                2.40
                                            NALSpatial −KB  −Corpus  −MR  −SLM
                                                  空间数据自然语言查询转换框架
                                               图 6 NALSpatial 的消融实验结果

                    实验发现, 当去除知识库模块时, NALSpatial 只能依赖基础的自然语言处理工具和算法完成语言理解. 这种情
                 况下, 系统无法提取出空间关系. 测试用例包含空间范围查询、最近邻居查询、空间                           Join  查询和聚合查询, 在生
                 成数据库可执行语言时均依赖对空间关系的精准提取. 由于缺少知识库模块支撑, 自然语言查询转换框架在测试
                 用例中的可翻译性和翻译精度均为            0, 无法生成任何可执行语言.
                    当去除语料库模块时, NALSpatial 无法依赖数据驱动的查询类型预测, 而是使用随机分配方式推测查询类型.
                 此策略导致系统的查询类型识别精度显著下降, 仅能正确识别出                     15  条自然语言查询的类型, 其中由于未能准确提
                 取测试用例    Q6  和  Q41  的实体信息, 最终系统仅能成功转换        13  条自然语言查询为可执行语言, 且所有转换结果均
                 符合预期. 因此, 此配置下的可翻译性和翻译精度均为                13%, 显著低于完整的转换框架.
                    Q6: Can you give me details about the districts that intersect with Lingrui Road?
                    转换失败的原因是系统错将          Road  识别为一个空间关系, 没有识别出         Lingrui Road  地点.
                    Q41: Which POIs are located within a one kilometer radius of each POI?
                    转换失败的原因是系统错将          radius 识别为  POI 关系中的一个地点     Radis.
                    当去除映射规则模块时, NALSpatial 只能将提取出的实体信息随机映射到结构化语言模型中, 在一定程度上
                 降低了翻译性能. 实验中, 系统正确映射了            19  条查询, 但其中一条查询      Q21  的转换结果不符合预期, 最终系统只
                 能成功生成    18  条符合预期的数据库可执行语言. 因此, 此配置下的可翻译性为                 19%, 翻译精度为    18%.
                    Q21: What are the top 10 POIs closest to the boundary line of Nanjing?
                    不符合预期的原因是系统误将该查询的意图理解为求距离南京市中心最近的                           10 个  POI, 而不是南京市边界线.
                    当去除结构化语言模型时, NALSpatial 完全失去生成可执行语言的能力. 尽管仍能提取查询中的关键语义信
                 息, 但缺乏语言生成能力的系统无法完成自然语言查询的最终转换. 因此, 在该配置下, 系统的可翻译性和翻译精
                 度均为   0.
                    此外, 无论是否去除模块, 系统的响应时间始终保持在                 2.45–2.55 s 之间, 表明单个模块的缺失不会对系统的
                 实时性产生明显影响. 消融实验结果表明, 知识库模块对空间关系提取至关重要, 缺失直接导致系统无法生成任何
                 有效的可执行语言. 语料库模块显著影响查询类型识别的准确性, 缺失使系统的翻译性能大幅下降. 映射规则模块
                 是生成精确数据库查询的关键, 缺失会导致系统映射准确率降低, 进而影响整体翻译精度. 结构化语言模型模块是
                 实现查询转换的核心, 缺失使系统完全失去可执行语言生成能力. 完整的                      NALSpatial 框架能够通过各模块的协同
                 工作, 全面实现高精度、高可翻译性和高效能的空间数据自然语言查询转换功能.
                  5.4   性能验证实验
                    为了验证    NALSpatial 的性能稳定性, 设计并实施了两组性能验证实验.
                    (1) 通过调整范围查询、最近邻居查询、空间              Join  查询和聚合查询中的关键参数, 分析可翻译性             T、翻译精
                 度  TP  和响应时间  RT  的变化情况, 从而评估     NALSpatial 对多样化查询任务的适应能力.
                    (2) 通过扩展数据集的规模和调整测试用例的数量, 分析平均语义理解时间的变化情况. 实验数据集选用
   169   170   171   172   173   174   175   176   177   178   179