Page 310 - 《软件学报》2026年第4期
P. 310

王骞玥 等: 大语言模型驱动的可信政务问答技术                                                         1751



                                                     Q&A CollectionTemplate
                      你的任务是基于提供的政务文档内容, 生成一个用户可能提出的问题及其对应的规范回答.
                      注意:
                      1. 生成的问题需涵盖具体的政策细节, 确保与文档内容紧密相关;
                      2. 生成的回答需严格遵循文档表述, 不添加主观解释或推测.
                      回答的参考样例:
                      问题: XX补贴的申请条件是什么?
                      回答: 根据政务文档规定, XX补贴的申请条件包括…
                      问题: 异地办理身份证的流程是什么?
                      回答: 根据政务文档要求, 异地办理身份证的流程为…
                      以下是你要参考的政务文档内容: </指令>
                      {{document}}

                                         图 9 使用   ChatGPT 构造问答对时使用的提示模板

                  5   实验分析

                  5.1   实验数据及资源
                    本文从政务公开信息数据集中挑选了              1 200  条官方问答对构成初步训练集, 并另选          220  条官方问答对为模型
                 训练时的验证集. 政务问答系统有两个常见的使用场景: 为领域内人士提供政务公开信息查询服务, 以及为市民提
                 供政务服务的办理建议或答疑. 本文称前者为专家问答, 后者为市民问答. 综合考虑其他开源专业性数据集中测试
                 集的规模   [25–27] 及本文训练数据集规模, 为了验证本文使用的政务大语言模型的领域对话能力, 以及基于前述方法
                 实现的原型系统在专家问答场景下的服务质量, 本文挑选了                   220  条官方问答为测试集, 用于模拟专家问答场景. 为
                 了验证原型系统在市民问答场景下的服务质量, 本文挑选                  220  条口语化问答为测试集, 用于模拟市民问答场景. 本
                 文代码基于     PyTorch 2.1.2  和  Langchain 0.2.1  实现. 本文所有实验在  4  张  NVIDIA A800 GPU  上完成, 并使用
                 CUDA 11.3  作为计算架构.
                  5.2   评价指标及评估参考模型
                    由于本文使用的问答对数据均包含参考回答, 因此我们比较生成回答和参考回答在划分成不同长度的词组
                 后, 通过词组间的重叠度来评价两者间的一致性, 以衡量生成回答表述的准确性和规范性. 具体来说, 本文采用了
                 ROUGE (recall oriented understudy for gisting evaluation) 系列  [28] 和  BLEU (bilingual evaluation understudy) 系列  [29]
                 的评估指标. ROUGE     系列指标包含      ROUGE-1, ROUGE-2, ROUGE-L. BLEU  系列指标有    BLEU-1、BLEU-2、
                 BLEU-3、BLEU-4. 同时, 本文使用    BERTScore [30] 评估生成回答与参考回答之间的语义相似度, 以评价生成回答的
                 咨询针对性. BERTScore   [30] 是一种用于衡量文本间语义相似度的指标. 该指标基于               BERT [31] 计算两个句子的嵌入
                 式表示, 并通过嵌入式表示之间的余弦相似度评估句子间的相似度. 基于                       BERT  计算的嵌入式表示能表达上下文
                 语境, 因此能更准确地衡量表达方式不同的句子间的语义相似度.
                    为了验证原型系统在各政务咨询服务场景下的生成回答效果, 本文将                        ChatGLM2-6B  和  Qwen-72B  在各测试
                 集上的评估结果作为评估参考. ChatGLM2-6B          是构建政务大语言模型的预训练大语言模型, Qwen-72B               的参数量
                 是政务大语言模型的       10  倍以上, 具有更强的语义理解和生成能力. 使用这两个通识大语言模型的评估结果作为对
                 比, 能有效说明原型系统在政务咨询领域的优势. 同时, 本文在各服务场景下针对原型系统各模块进行消融实验,
                 以说明系统各模块的有效性.
                  5.3   专家问答场景下实验结果分析
                    为了评估原型系统在专家问答场景下生成回答的质量, 我们将原型系统及评估参考模型在由官方问答对组成
                 的测试集上进行了评估. 在该测试集上, 我们进行了原型系统的模块消融实验, 以说明在专家问答场景下系统各模
                 块的有效性. 实验结果如表        1  所示.
   305   306   307   308   309   310   311   312   313   314   315