Page 346 - 《软件学报》2026年第2期
P. 346

姬涛 等: AI 赋能的关系型数据库系统研究: 标准化、技术与挑战                                                825


                    基于微调的方法通过任务特定的微调, 使大语言模型更好地适应                      Text2SQL  任务. 这类方法通常利用标注的
                 问题和   SQL  对数据集, 对预训练的大语言模型进行有监督训练, 以优化其在                  SQL  生成任务上的表现. 例如, DAIL-
                 SQL [62] 设计为上下文学习框架, 采用采样策略提升少样本实例的效果. CodeS                [63] 则通过  ChatGPT [64] 辅助的双向生
                 成增强训练数据, 其预训练阶段分为           3  个增量阶段, 从基础的代码特定        LLM  开始, 逐步在包含     SQL  相关数据、自
                 然语言到代码数据及自然语言相关数据的混合语料库上进行训练, 显著提升了文本到                            SQL  的理解与生成性能. 此
                 外, DTS-SQL [53] 提出了一个两阶段分解的文本到        SQL  微调框架, 并设计了模式链接预生成任务, 以优化最终               SQL
                 的生成.
                  2.2   表格问题回答
                    表格问题回答      (table question answer, TableQA) 是另一种用户访问并向数据库发出查询的方法. 旨在从结构化
                 表格数据中提取信息并回答用户提出的问题. 它结合了自然语言理解和表格数据的查询能力, 能够理解用户的问
                 题, 定位表格中的相关数据, 并生成准确的答案.
                    如图  3  抽象出了   TableQA  的标准化流程, 首先, 用户通过自然语言提出问题. 系统随后将这些自然语言问题
                 与数据库中的表格数据进行关联. 模型部分负责处理和理解这些数据, 进行问题消歧以确保准确理解用户意图. 接
                 下来, 系统通过搜索检索机制在数据库中查找相关信息, 并通过迭代调优不断优化检索结果. 结果精炼阶段进一步
                 处理和优化检索到的数据, 以提高答案的准确性和相关性. 最后, 模型微调步骤对系统进行精细调整, 以确保生成
                 的答案符合用户需求.

                                                                   模型
                                                                 问题消歧
                                  用户           自然语言问题                             模型微调
                                                                 搜索检查

                                                                 迭代调优
                                               数据库表格                                答案

                                                                 结果精炼

                                                图 3 表格问题回答标准化架构

                  2.2.1    问题消歧
                    问题消歧是     TableQA  方法中的关键步骤, 旨在将用户输入的自然语言问题转化为一系列明确的中间操作或
                 调整问题以消除歧义. TableGPT     [65] 引入了链式命令的概念, 通过微调大语言模型            (LLM) 将用户输入转换为一系列
                 中间命令操作. 具体而言, TableGPT      利用大模型首先检查任务是否需要检索、数学推理、表格操作等, 并在问题
                 过于模糊时提示用户无法回答. PACIFIC         [66] 将问题消歧分为两部分: 需求预测和问题生成. 需求预测用于判断是否
                 需要进一步澄清问题的不确定性, 而问题生成则生成一个澄清问题以响应用户. 这些方法通过引入多轮对话和上
                 下文理解, 显著提高了问题消歧的准确性.
                  2.2.2    搜索检索
                    搜索和检索是从结构化数据中提取相关信息以回答用户问题的核心过程. DocMath-Eval                        [67] 发现, 检索模块能
                 否发现最相关的结构化信息在很大程度上决定了                 LLM  在  TableQA  中的准确性. 该方法使用现有的检索器从源文
                 档中提取前    n  个最相关的文本和表格证据, 并将其作为输入上下文提供给模型以生成答案. Tap4LLM                       [68] 探索了多
                 种表采样方法     (如行和列采样) 和表打包技术         (基于令牌限制参数). 实验表明, 基于查询的采样方法能够检索与问
                 题具有最高语义相似性的行, 显著优于随机采样、聚类采样等方法. cTBLS                     [69] 设计了一个  3  步架构来检索并生成
                 基于表格信息的对话响应. 首先, 基于双编码器的密集表检索模型标识与查询最相关的表. 接着, 利用基于三元组
                 损失训练的系统状态跟踪模块, 对候选单元格进行相关性排序. 最后, GPT-3.5                   [70] 生成以表格单元格为条件的自然
   341   342   343   344   345   346   347   348   349   350   351