Page 311 - 《软件学报》2026年第4期
P. 311
1752 软件学报 2026 年第 37 卷第 4 期
表 1 系统在专家问答场景下的评估结果 (%)
模型/系统 BERTScore ROUGE-1 ROUGE-2 ROUGE-L BLEU-1 BLEU-2 BLEU-3 BLEU-4
ChatGLM2-6B 63.82 24.58 7.76 14.58 17.5 8.51 5.16 3.78
Qwen-72B 67.27 24.86 7.02 16.48 21.88 10.03 5.62 3.81
政务大语言模型 66.43 29.15 10.78 18.17 21.00 11.20 7.28 5.65
政务大语言模型+领域知识库模块 67.15 28.97 13.06 21.30 23.55 13.46 9.71 8.10
政务大语言模型+分析引导模块 68.15 30.35 11.55 21.48 22.42 12.16 8.17 6.31
原型系统 68.60 31.01 13.39 23.22 24.21 13.86 9.70 7.80
(1) 政务大语言模型在政务咨询对话方面展现出优势. 表 1 结果表明, 政务大语言模型在各项评估指标上均明
显优于同参数规模的 ChatGLM2-6B. 这说明政务大语言模型的生成结果在语义和用词上与参考回答更接近, 其回
答的准确性更高. 然而, 政务大语言模型在 BERTScore 上的评估结果略低于 Qwen-72B. 这是因为政务大语言模型
的语义理解受参数规模限制, 其对咨询的理解程度不足, 导致回答的针对性不足. 表 1 结果显示, 政务大语言模型
在 ROUGE 和 BLEU 这类基于词重叠度的评估指标上相较 Qwen-72B 有明显优势. 这表明政务大语言模型生成回
答与参考回答在用词上更一致, 其生成的回答表述更规范. 综上, 虽然本文使用的政务大语言模型的参数规模有
限, 但通过领域数据微调, 在领域对话中能针对咨询生成表述更规范的回答, 更适应政务对话场景.
(2) 专家问答场景中, 原型系统展现出政务咨询服务优势. 在各类评估指标上, 原型系统均有明显优势. 结果如表 1
所示, 原型系统相较于 ChatGLM2-6B 在 BERTScore 上提升了 4.78%, 在 ROUGE-L 上提升了 8.64%. 而相较于
Qwen-72B, 原型系统在 BERTScore 上提升了 1.33%, 在 ROUGE-L 上提升了 6.74%. 这表明相较于通识大语言模
型, 原型系统生成的回答在语义和用词上都更接近参考回答, 即其生成的回答具有更高的准确性和规范性. 这些评
估结果揭示了原型系统在专家问答场景中的几个关键优势: 首先, 其产生的回答在语义上更贴近参考回答, 这意味
着它能够有效理解咨询内容并针对性地产生回答; 其次, 其生成的回答使用更符合领域规范的用词和表达, 表述更
规范; 最后, 这些优势共同体现了原型系统在政务信息咨询场景中提供政务咨询服务的能力.
(3) 专家问答场景中分析引导模块能提升系统的回答针对性. 表 1 结果表明, 政务大语言模型结合分析引导模
块后, 在 BERTScore 指标上相较于仅使用政务大语言模型提高了 1.72%. 这表明在分析引导模块的辅助下, 政务
大语言模型生成的回答和参考回答在语义上更一致, 即生成回答更有问题针对性. 其原因为引导模块能逐步引导
政务大语言模型关注咨询输入的不同关键点, 加强了政务大语言模型对咨询内容的理解和对咨询意图的挖掘. 当
咨询分析结果作用于回答生成时, 政务大语言模型对咨询内容和咨询意图的理解加深, 从而提升了回答的针对性.
政务大语言模型结合分析引导模块后, 在 ROUGE 系列和 BLEU 系列指标上也有一定提升. 分析其原因, 为该模块
辅助后, 政务大语言模型生成回答的针对性提升且大语言模型本身具备一定生成领域规范内容的能力, 因此回答
的部分语言组织与参考回答一致, 使得 ROUGE 系列和 BLEU 系列指标有一定提升.
(4) 专家问答场景中领域知识库模块能提升回答内容的规范性. 表 1 结果表明, 使用领域知识库辅助政务大语
言模型后, 在 BLEU 系列指标上相较于未使用前有明显提升. 这说明领域知识库辅助政务大语言模型后, 生成的回
答在用词上与参考回答更一致, 回答的规范性和准确性得到提升. 分析其原因, 在专家问答场景下, 咨询输入的语
言组织符合领域规范, 基于用户咨询检索相关领域知识的成功率较高. 因此, 政务大语言模型在生成回答时能参考
咨询相关的领域知识, 能针对用户咨询生成内容表述与事实一致的准确规范的咨询回答.
5.4 系统在市民问答场景下的服务质量评估
为了评估原型系统在市民咨询场景下生成回答的质量, 我们将原型系统及评估参考模型在由口语化问答对组
成的测试集上进行评估. 在该测试集上进行了原型系统的模块消融实验, 以说明在市民问答场景下系统各模块的
有效性. 实验结果如表 2 所示.
(1) 政务大语言模型的回答质量受限于咨询内容的组织规范性. 表 2 的结果表明, 在市民问答场景下, 政务大
语言模型在各评估指标上均优于同参数规模的 ChatGLM2-6B. 但与 Qwen-72B 相比, 政务大语言模型在所有评估

