Page 310 - 《软件学报》2026年第4期
P. 310
王骞玥 等: 大语言模型驱动的可信政务问答技术 1751
Q&A CollectionTemplate
你的任务是基于提供的政务文档内容, 生成一个用户可能提出的问题及其对应的规范回答.
注意:
1. 生成的问题需涵盖具体的政策细节, 确保与文档内容紧密相关;
2. 生成的回答需严格遵循文档表述, 不添加主观解释或推测.
回答的参考样例:
问题: XX补贴的申请条件是什么?
回答: 根据政务文档规定, XX补贴的申请条件包括…
问题: 异地办理身份证的流程是什么?
回答: 根据政务文档要求, 异地办理身份证的流程为…
以下是你要参考的政务文档内容: </指令>
{{document}}
图 9 使用 ChatGPT 构造问答对时使用的提示模板
5 实验分析
5.1 实验数据及资源
本文从政务公开信息数据集中挑选了 1 200 条官方问答对构成初步训练集, 并另选 220 条官方问答对为模型
训练时的验证集. 政务问答系统有两个常见的使用场景: 为领域内人士提供政务公开信息查询服务, 以及为市民提
供政务服务的办理建议或答疑. 本文称前者为专家问答, 后者为市民问答. 综合考虑其他开源专业性数据集中测试
集的规模 [25–27] 及本文训练数据集规模, 为了验证本文使用的政务大语言模型的领域对话能力, 以及基于前述方法
实现的原型系统在专家问答场景下的服务质量, 本文挑选了 220 条官方问答为测试集, 用于模拟专家问答场景. 为
了验证原型系统在市民问答场景下的服务质量, 本文挑选 220 条口语化问答为测试集, 用于模拟市民问答场景. 本
文代码基于 PyTorch 2.1.2 和 Langchain 0.2.1 实现. 本文所有实验在 4 张 NVIDIA A800 GPU 上完成, 并使用
CUDA 11.3 作为计算架构.
5.2 评价指标及评估参考模型
由于本文使用的问答对数据均包含参考回答, 因此我们比较生成回答和参考回答在划分成不同长度的词组
后, 通过词组间的重叠度来评价两者间的一致性, 以衡量生成回答表述的准确性和规范性. 具体来说, 本文采用了
ROUGE (recall oriented understudy for gisting evaluation) 系列 [28] 和 BLEU (bilingual evaluation understudy) 系列 [29]
的评估指标. ROUGE 系列指标包含 ROUGE-1, ROUGE-2, ROUGE-L. BLEU 系列指标有 BLEU-1、BLEU-2、
BLEU-3、BLEU-4. 同时, 本文使用 BERTScore [30] 评估生成回答与参考回答之间的语义相似度, 以评价生成回答的
咨询针对性. BERTScore [30] 是一种用于衡量文本间语义相似度的指标. 该指标基于 BERT [31] 计算两个句子的嵌入
式表示, 并通过嵌入式表示之间的余弦相似度评估句子间的相似度. 基于 BERT 计算的嵌入式表示能表达上下文
语境, 因此能更准确地衡量表达方式不同的句子间的语义相似度.
为了验证原型系统在各政务咨询服务场景下的生成回答效果, 本文将 ChatGLM2-6B 和 Qwen-72B 在各测试
集上的评估结果作为评估参考. ChatGLM2-6B 是构建政务大语言模型的预训练大语言模型, Qwen-72B 的参数量
是政务大语言模型的 10 倍以上, 具有更强的语义理解和生成能力. 使用这两个通识大语言模型的评估结果作为对
比, 能有效说明原型系统在政务咨询领域的优势. 同时, 本文在各服务场景下针对原型系统各模块进行消融实验,
以说明系统各模块的有效性.
5.3 专家问答场景下实验结果分析
为了评估原型系统在专家问答场景下生成回答的质量, 我们将原型系统及评估参考模型在由官方问答对组成
的测试集上进行了评估. 在该测试集上, 我们进行了原型系统的模块消融实验, 以说明在专家问答场景下系统各模
块的有效性. 实验结果如表 1 所示.

