Page 312 - 《软件学报》2026年第4期
P. 312
王骞玥 等: 大语言模型驱动的可信政务问答技术 1753
指标上均无明显优势. 这说明在该场景下, 政务大语言模型生成的回答缺乏针对性且在用词上与参考回答的一致
性不足, 导致回答的准确性不足. 分析原因, 是由于该场景下的咨询输入与政务大语言模型微调时的输入在语言组
织方式上存在明显差异, 致使政务大语言模型无法有效理解咨询内容, 从而导致生成的回答在针对性和用词一致
性上与参考回答有一定差异.
表 2 市民问答场景下的评估结果 (%)
模型/系统 BERTScore ROUGE-1 ROUGE-2 ROUGE-L BLEU-1 BLEU-2 BLEU-3 BLEU-4
ChatGLM2-6B 63.05 21.32 4.88 12.24 16.60 6.94 3.56 2.31
Qwen-72B 65.61 22.04 5.21 14.87 20.10 8.40 4.24 2.74
政务大语言模型 64.60 23.28 5.76 13.66 17.82 7.99 4.32 2.89
政务大语言模型+领域知识库模块 64.16 24.64 6.24 15.87 18.77 8.81 5.65 3.79
政务大语言模型+分析引导模块 66.37 26.36 8.04 18.00 20.97 10.35 6.42 4.79
原型系统 67.31 27.02 8.84 19.74 23.30 11.22 6.46 4.54
(2) 市民问答场景中的原型系统具有政务咨询服务优势. 表 2 的结果显示, 原型系统在市民问答场景下的各项
评估指标均取得最优. 与 ChatGLM2-6B 相比, 原型系统在 BERTScore 上提升了 4.26%, 在 ROUGE 系列指标上的
平均提升为 5.72%, 在 BLEU 系列指标上的平均提升为 4.03%. 与 Qwen-72B 相比, 原型系统在 BERTScore 上提升
了 1.7%, 在 ROUGE 系列指标上的平均提升为 4.49%, 在 BLEU 系列指标上的平均提升为 2.51%. 实验结果表明,
原型系统生成的回答和参考回答在语义和用词上更一致, 说明生成回答的准确性和规范性较好, 这证明了原型系
统在市民问答场景中有政务咨询服务优势.
(3) 市民问答场景下, 分析引导模块有助于提升回答的针对性. 表 2 的结果显示, 政务大语言模型在分析引导
模块辅助后在各评估指标上均取得明显提升. 相比于仅使用政务大语言模型, 分析引导模块辅助后的政务大语言
模型在 BERTScore 上提升了 1.77%, 在 ROUGE 系列指标上的平均提升为 3.23%, 在 BLEU 系列指标上的平均提
升为 2.38%. 其原因为分析引导模块能够引导政务大语言模型逐步分析咨询内容, 将市民口语化咨询内容中的关
键信息转述为对应的规范表达, 从而缓解了口语化咨询内容对政务大语言模型语义理解上的阻碍, 提升了政务大
语言模型生成回答的咨询针对性. 同时, 由于政务大语言模型具备一定生成规范内容的能力, 所以针对咨询生成的
回答在语言组织上与参考回答的一致性得到了提升.
(4) 市民问答场景下, 领域知识库模块需要分析引导模块的辅助以保障其有效性. 在市民问答场景下, 当领域
知识库模块单独辅助本文使用的政务大语言模型后, 各评估指标上的提升不明显, 甚至在 BERTScore 上的评估结
果反而下降. 这是因为市民问答场景下的市民口语化的咨询输入在语言组织方式上与领域知识库中的内容差别较
大, 导致直接使用咨询检索相关领域知识的成功率低. 政务大语言模型在生成回答时能参考的相关知识不足甚至
受到无关信息的干扰, 影响了生成回答与参考回答在语义上的一致性 [12] , 且在用词规范上缺乏参考, 导致在 ROUGE
系列和 BLEU 系列的指标上提升不明显. 使用分析结果检索领域知识后 (评估结果见表 2 最后一行), 相较于未使
用分析结果的政务大语言模型, 在 ROUGE 系列和 BLEU 系列的指标上提升明显. 这是因为分析引导模块中由咨
询凝练出的政务领域关键词和知识库中的内容在语言组织方式上相似, 进而提升了咨询相关领域知识的检索成功
率. 因此, 在该服务场景下, 政务大语言模型在生成内容时能同时参考咨询分析结果和与咨询相关的领域知识, 实
现针对咨询生成内容组织规范的准确回答.
(5) 原型系统具有提供可信政务服务优势. 对比表 1 和表 2 结果, 在市民问答场景下, 原型系统和政务大语言
模型在各评估指标上的结果均有不同程度的下降, 但原型系统的降低程度较政务大语言模型更缓. 相较于专家问
答场景, 原型系统在市民问答场景下 BERTScore 下降 1.29%, 而本文使用的政务大语言模型在市民问答场景下
BERTScore 下降 1.83%. 原型系统在市民问答场景下 ROUGE 系列指标上平均下降 4.26%, 在 BLEU 上平均下降
2.51%. 政务大语言模型在市民问答场景下 ROUGE 系列指标上平均下降 5.13%, 在 BLEU 系列指标上平均下降
3.02%. 这说明, 在各服务场景下原型系统能生成与参考回答在语义和用词规范性上更一致的回答, 即其生成的回
答更准确且规范. 综上所述, 原型系统能在不同服务场景下针对用户咨询生成内容组织规范的准确回答并提供回
答依据以增强回答的可解释性, 证明原型系统具备提供可信政务咨询服务的优势.

