Page 165 - 《软件学报》2026年第3期
P. 165

1128                                                       软件学报  2026  年第  37  卷第  3  期


                 据库查询.
                    ● 数据增强. 利用    GPT-4o  通过替换查询中的关键数据实体、改变语句结构或使用不同的语言风格来进行数
                 据增强, 将语料库扩展至       3 500  条查询. 表  1  展示了部分数据增强示例. GPT-4o     能够快速生成多样化的查询, 显著
                 加快了语料库的构建速度. 其次, GPT-4o         生成的查询在语法和语言风格上具有一致性, 确保了语料库的统一性和
                 专业性. 在此步骤中, 制定了多维度的增强策略, 具体包含如下几个方面.

                                                     表 1 数据增强示例

                   查询类型                    原始查询                                 数据增强示例
                 基础空间查询 Calculate the distance from Mount Huang to Mount Tai.  What’s the distance from Mount Huang to Mount Tai?
                                                                  Could you provide a list of restaurants located in Jiangning
                   范围查询       What restaurants are located in Jiangning District?
                                                                  District?
                 最近邻居查询          Find the two nearest lakes to West Lake.  Find the five nearest lakes to West Lake.
                            What restaurants are within 2 kilometers of each subway
                 空间Join查询                                         What parks are within 2 kilometers of each subway station?
                            station?
                   聚合查询       How many amusement parks are there in Nanjing?  Please provide the number of amusement parks in Nanjing.

                    NLQ 5 : Calculate the distance from Mount Tai to Mount Huang.
                    NLQ 6 : Find the two nearest lakes to West Lake.
                    (1) 数据实体替换: GPT-4o   通过替换查询中的关键实体, 如地理位置和空间对象, 生成多种查询变体. 例如, 对
                 于  NLQ 5 , 将 “Mount Tai” 和 “Mount Huang” 替换为其他地理位置, 可创建不同的查询.
                    (2) 语言结构转换: 利用     GPT-4o  生成表达同一含义的多样化语言结构, 从而增强语料库的语言多样性. 例如,
                 将  NLQ 5 转化为 “What’s the distance from Mount Tai to Mount Huang?”, 可以保证查询在不同语言风格下的表达一
                 致性和连贯性. 语言结构转换能够提升模型对自然语言表达的鲁棒性.
                    (3) 查询属性的数量参数调整: 对于数量相关的查询属性, 如最近邻居数和距离阈值, 通过调整参数来生成多
                 种样例. 例如   NLQ 6 可通过调整数量来生成新的查询, 如 “Find the five nearest lakes to West Lake.”.
                    ● 查询检查. 在语料库构建的最终阶段, 为确保             GPT-4o  生成的空间数据查询能够有效支持自然语言到数据库
                 查询的转化过程, 挑选了       3  位具备丰富经验的专家对查询进行严格检查. 这些专家均熟悉自然语言查询的构造原
                 则、查询类型的分类标准以及空间数据可执行语句的设计规范. 因此, 他们不仅能够确保生成的查询在学术和技
                 术上的高质量, 还能够对查询在实际应用场景中的可操作性做出专业判断. 通过严格的人工检查和校对, 最终构建
                 的语料库具备高质量和广泛适用的特点, 不仅可以用于空间数据查询类型识别模型的训练, 还能作为微调模型或
                 领域适配的关键资源, 从而帮助大语言模型理解空间语义.
                    在训练空间数据查询语料库时, 任务特点是小样本、多类别、短文本分类. 这类任务对模型的准确性和训练
                 效率提出了很高的要求, 以适应语料库的持续扩展与更新. TextCNN                  结构简单、训练速度快, 适合短文本分类任
                 务, 但基于卷积的局部特征提取机制难以建模查询语句中的上下文依赖, 在语义理解方面存在明显的局限. LSTM
                 通过引入记忆单元, 有效捕捉语句中的时序信息, 弥补了                 TextCNN  的不足. BiLSTM  在  LSTM  基础上进一步引入
                 双向建模能力, 可同时捕捉前后语义依赖, 显著提升了对查询语句语法结构与空间语义关系的理解能力, 在语料库
                 持续更新场景中具有很强的泛化能力与适应性. 虽然                 BERT  在自然语言处理任务中的表现十分强大, 但庞大的参
                 数量导致训练时间显著增加, 不适合小样本任务. DistilBERT              作为轻量级预训练模型, 具备较强的语义建模能力,
                 但参数规模依然较大, 训练时间显著高于传统模型, 不利于语料库持续更新下的快速训练. 理论上, BiLSTM                              在保
                 持较强上下文理解能力的同时具备良好的训练效率, 特别适合应对空间数据查询语料库持续扩展与动态更新的需
                 求, 是本任务的优选模型结构.
                    基于查询实体的提取结果, 当一个           NLQ  中包含超过两个空间关系, 且被识别为空间             Join  查询时, 系统将调用
                 GPT-4o  来判断各对空间关系之间的连接逻辑是基于空间拓扑 (如包含、相交) 还是基于距离约束 (如 “within 1.5
                 kilometers”“within a 15-minute walk”), 并将生成的连接信息作为输入传递至可执行语言生成阶段.
   160   161   162   163   164   165   166   167   168   169   170