Page 302 - 《软件学报》2026年第4期
P. 302
王骞玥 等: 大语言模型驱动的可信政务问答技术 1743
言模型产生且回答依据不足, 导致回答的可解释性不足.
综上所述, 目前政务问答系统的构建技术仍无法使政务问答系统生成可信回答. 在本文方法中, 分析引导模块
的多步分析可以提升方法对咨询的理解, 增强回答的针对性. 同时, 本文方法还可在多服务场景下生成准确且可解
释的回答. 通过对咨询进行多维分析和参考材料检索, 保障在多服务场景下, 政务大语言模型能在理解咨询的前提
下生成表述正确的准确回答. 生成回答时参考的内容可作为回答依据, 提升回答的可解释性.
1.2 可信问答技术
Liu 等人 [11] 从 7 个维度定义大语言模型回答的可信, 即可靠性 (reliability)、安全性 (safety)、公平性 (fairness)、
抵抗滥用 (resistance to misuse)、解释性和推理 (explainability & reasoning)、遵循社会规范 (social norm) 和稳健性
(robustness), 并指出通常情况下, 回答的可信度与回答实用性正相关. 本文从政务问答系统生成回答的可靠性、可
解释性和稳定性这 3 方面提升回答可信度. 以下将分别介绍关注大语言模型这 3 种特性的相关工作.
回答的可靠性, 是对信息、事实和结果的准确表示 [11] . 研究人员主要从控制大语言模型推理阶段的行为来加
强回答的可靠性. Dhuliawala 等人 [12] 提出了 CoV (chain of verification) 框架通过大语言模型自证回答正确的方式
加强最终回答表述的正确性. Wei 等人 [13] 提出思维链 (chain of thought, CoT) 通过大语言模型自主分析并回答的方
式, 增加回答的准确性. Wen 等人 [14] 提出的 MindMap 方法使得大语言模型能够生成思维导图, 基于思维导图进行
推理并最终总结得出回答.
回答的稳健性体现系统在各种情况下保持其性能水平的能力 [11] . 研究人员在推理阶段主要基于提示学习, 通
过加强大语言模型对同一事物不同表述的对齐能力, 以提升其回答的稳健性. Jiang 等人 [15] 证明了使用合适的提示
加强回答约束, 有效增强语言模型对同一事物不同表述的对齐能力. Zhou 等人 [16] 还提出了根据问题难度使用不同
提示的方法, 增强回答稳健性.
回答的可解释性, 用于说明生成回答是否有理有据 [11] . 为使回答有据可依, 常用的方法是通过知识库提供语
言模型生成时的回答参考并将其作为生成回答依据. 知识库的形式可以是知识图谱 [14] 或向量数据 [17] . Guu 等人 [18] ,
将这类在大语言模型推理时根据外接知识库提供参考的方法, 总结为检索增强语言建模 (retrieval-augmented
language modeling, RALM).
本文方法综合考虑回答的可靠性、稳健性和可解释性, 通过加强这 3 方面的特性来提升回答的可信度. 首先,
领域知识库在政务大语言模型生成回答时提供咨询相关领域的知识, 这使得政务大语言模型能够参考领域知识的
语言组织规范和事实, 生成表述规范且与事实一致的可靠回答. 其次, 该方法对咨询内容进行多步主动分析, 通过
提取并转述咨询关键信息的方式, 加强了对不同语言组织方式下咨询内容的理解, 保障多服务场景下政务大语言
模型生成回答的针对性. 领域知识库模块提供的咨询相关领域知识, 结合咨询分析结果, 共同作为政务大语言模型
针对咨询生成回答时的参考材料, 使得政务大语言模型能够针对咨询生成对应表述正确的准确回答, 保障了回答
的可靠性. 同时, 参考材料 (包括分析结果和检索知识) 作为回答的依据, 可提升回答的可解释性. 分析过程中对非
规范咨询的关键信息进行转述, 保障了政务大语言模型和领域知识库模块在多服务场景下的稳定性, 实现了在多
服务场景下生成准确且可解释的回答, 保障了回答的稳健性.
2 问题定义及方法概述
2.1 问题定义
政务问答系统既能有效缓解政务咨询专员的工作压力, 又能提供全天候、多渠道、全方位的智能政务服务.
X
政务问答系统 S 对于用户咨询内容 , 会给出回复 A. 整个过程的形式化表示为:
A = S (X) (1)
由于政务问答系统面对的咨询对象不是特定群体, 因此咨询的语言组织规范性无法保证, 即输入内容的分布
与政务大语言模型的训练数据存在偏差 [19] . 记输入内容为 {X} n i=1 ∼ P , 领域模型的训练数据为 {Y} n i=1 ∼ Q . 其中 P n
n
n
n
和 Q 表示不同分布. 大语言模型独立理解训练分布外数据的能力有限, 因此容易出现答非所问的现象.

