Page 313 - 《软件学报》2026年第4期
P. 313
1754 软件学报 2026 年第 37 卷第 4 期
5.5 原型系统问答案例分析
本节分析了系统在专家问答和市民问答场景下, 原型系统的成功案例和失败案例.
在各服务场景下的典型成功案例可以在公开数据集链接 (https://doi.org/10.57760/sciencedb.24847) 中查看. 原
型系统的成功案例在不同场景下都能有效提取咨询政务领域关键词并总结用户咨询意图, 进而针对用户咨询产生
准确可解释的回答内容. 实际的有效案例说明了验证系统的实用性.
分析发现, 系统在各服务场景下因咨询问题复杂而失效. 在各服务场景下的典型失败案例可以在公开数据集
链接 (https://doi.org/10.57760/sciencedb.24847) 中查看. 系统在不同服务场景下, 面对复杂咨询时失效的原因及失
效现象如下: 1) 专家问答场景下, 系统面对一类需要综合多条相关信息以形成概括性的回答的咨询问题时失效. 这
是由于系统中的大型模型有限的上下文窗口, 本文设计的检索方法仅保留了与政务关键词最相关的前 3 条领域知
识, 这限制了对相关问题相关信息的覆盖范围, 从而导致了系统生成回答的内容不全面. 2) 市民问答场景下, 系统
在多政务领域关联的咨询时失效. 这是因为系统分析方式的局限性, 未能识别出复杂咨询问题中多个政务话题之
间的联系以及由此衍生的用户咨询需求. 系统的分析模块仅能识别部分政务话题并给出部分回答, 导致回答不全
面, 未能满足用户的实际咨询需求.
5.6 微调数据量边际效应探究
为了探究 LoRA 方法在本文所探讨的微调场景下需要的微调数据量, 本文从初步训练集中划分构造了包含
900 条、1 000 条、1 100 条以及 1 200 条数据的训练数据集. 将 ChatGLM2-6B 模型分别在上述训练数据集上使用
LoRA 方法进行微调训练, 并在由官方问答对组成的测试集上对各微调后的大语言模型进行评估. 选择在测试集
上综合表现最佳的微调结果作为本文所使用的政务大语言模型. 表 3 记录了微调训练时主要超参数的设置情况.
图 10 展示了 ChatGLM2-6B 模型以及经过不同训练量微调后得到的大语言模型在测试集上的评估情况. 其中,
“GovGLM (0.9k)”表示由 ChatGLM2-6B 经过 900 条问答对微调得到的政务大语言模型. 图中各评估结果均以百分
数形式展示. 实验结果表明, ChatGLM2-6B 在 1 000 条和 1 100 条数据集上的微调结果在各项评估指标上展现出了
明显的性能提升. 在综合考虑评估结果后, 选择在 1 100 条问答对上微调后的大语言模型作为本文所采用的政务大
语言模型.
表 3 LoRA 微调关键超参数记录表
ChatGLM2-6B
GovGLM (0.9k)
超参数名 参数值 BLEU-1
GovGLM (1k)
Learning rate 1.00×10 −5 GovGLM (1.1k)
Warmup ratio 5.00×10 −2 ROUGE-1 GovGLM (1.2k)
Weight decay 5.00×10 −2
Eval steps 50
BERTScore
LoRA rank 8
per_device_train_batch_size 4
0 10 20 30 40 50 60 70 (%)
per_device_eval_batch_size 4
图 10 微调数据量边际效应实验结果
图 10 的实验结果表明, 在该微调场景下 LoRA 微调方法对数据量的要求较低, 只需要 1 000 条左右的微调数
据, 就能得到明显超越同参数规模下通识大语言模型的领域对话能力. 实验结果验证了 LoRA 方法参数微调的高
效性. 分析其原因, 在 LoRA 方法的训练过程中, 预训练模型的全部参数被冻结, 仅调整旁路网络中的参数. 训练时
冻结预训练大语言模型的参数既能有效降低训练成本, 又能一定程度保留大语言模型原有的语义理解和生成能
力, 从而降低大语言模型在训练后退化甚至崩溃的概率.
6 相关讨论
6.1 系统多场景可用性分析
本文通过分析引导模块提取并转述咨询涉及的关键政务信息, 确保领域知识库模块和政务大语言模型在不同

