Page 302 - 《软件学报》2026年第4期
P. 302

王骞玥 等: 大语言模型驱动的可信政务问答技术                                                         1743


                 言模型产生且回答依据不足, 导致回答的可解释性不足.
                    综上所述, 目前政务问答系统的构建技术仍无法使政务问答系统生成可信回答. 在本文方法中, 分析引导模块
                 的多步分析可以提升方法对咨询的理解, 增强回答的针对性. 同时, 本文方法还可在多服务场景下生成准确且可解
                 释的回答. 通过对咨询进行多维分析和参考材料检索, 保障在多服务场景下, 政务大语言模型能在理解咨询的前提
                 下生成表述正确的准确回答. 生成回答时参考的内容可作为回答依据, 提升回答的可解释性.
                  1.2   可信问答技术
                    Liu 等人  [11] 从  7 个维度定义大语言模型回答的可信, 即可靠性 (reliability)、安全性 (safety)、公平性 (fairness)、
                 抵抗滥用 (resistance to misuse)、解释性和推理 (explainability & reasoning)、遵循社会规范 (social norm) 和稳健性
                 (robustness), 并指出通常情况下, 回答的可信度与回答实用性正相关. 本文从政务问答系统生成回答的可靠性、可
                 解释性和稳定性这       3  方面提升回答可信度. 以下将分别介绍关注大语言模型这                3  种特性的相关工作.
                    回答的可靠性, 是对信息、事实和结果的准确表示                 [11] . 研究人员主要从控制大语言模型推理阶段的行为来加
                 强回答的可靠性. Dhuliawala 等人    [12] 提出了  CoV (chain of verification) 框架通过大语言模型自证回答正确的方式
                 加强最终回答表述的正确性. Wei 等人          [13] 提出思维链 (chain of thought, CoT) 通过大语言模型自主分析并回答的方
                 式, 增加回答的准确性. Wen      等人  [14] 提出的  MindMap  方法使得大语言模型能够生成思维导图, 基于思维导图进行
                 推理并最终总结得出回答.
                    回答的稳健性体现系统在各种情况下保持其性能水平的能力                      [11] . 研究人员在推理阶段主要基于提示学习, 通
                 过加强大语言模型对同一事物不同表述的对齐能力, 以提升其回答的稳健性. Jiang                       等人  [15] 证明了使用合适的提示
                 加强回答约束, 有效增强语言模型对同一事物不同表述的对齐能力. Zhou                    等人  [16] 还提出了根据问题难度使用不同
                 提示的方法, 增强回答稳健性.
                    回答的可解释性, 用于说明生成回答是否有理有据                 [11] . 为使回答有据可依, 常用的方法是通过知识库提供语
                 言模型生成时的回答参考并将其作为生成回答依据. 知识库的形式可以是知识图谱                           [14] 或向量数据  [17] . Guu 等人  [18] ,
                 将这类在大语言模型推理时根据外接知识库提供参考的方法, 总结为检索增强语言建模 (retrieval-augmented
                 language modeling, RALM).
                    本文方法综合考虑回答的可靠性、稳健性和可解释性, 通过加强这                       3  方面的特性来提升回答的可信度. 首先,
                 领域知识库在政务大语言模型生成回答时提供咨询相关领域的知识, 这使得政务大语言模型能够参考领域知识的
                 语言组织规范和事实, 生成表述规范且与事实一致的可靠回答. 其次, 该方法对咨询内容进行多步主动分析, 通过
                 提取并转述咨询关键信息的方式, 加强了对不同语言组织方式下咨询内容的理解, 保障多服务场景下政务大语言
                 模型生成回答的针对性. 领域知识库模块提供的咨询相关领域知识, 结合咨询分析结果, 共同作为政务大语言模型
                 针对咨询生成回答时的参考材料, 使得政务大语言模型能够针对咨询生成对应表述正确的准确回答, 保障了回答
                 的可靠性. 同时, 参考材料 (包括分析结果和检索知识) 作为回答的依据, 可提升回答的可解释性. 分析过程中对非
                 规范咨询的关键信息进行转述, 保障了政务大语言模型和领域知识库模块在多服务场景下的稳定性, 实现了在多
                 服务场景下生成准确且可解释的回答, 保障了回答的稳健性.

                  2   问题定义及方法概述

                  2.1   问题定义
                    政务问答系统既能有效缓解政务咨询专员的工作压力, 又能提供全天候、多渠道、全方位的智能政务服务.
                                            X
                 政务问答系统     S  对于用户咨询内容  , 会给出回复        A. 整个过程的形式化表示为:

                                                         A = S (X)                                    (1)
                    由于政务问答系统面对的咨询对象不是特定群体, 因此咨询的语言组织规范性无法保证, 即输入内容的分布
                 与政务大语言模型的训练数据存在偏差              [19] . 记输入内容为  {X} n i=1  ∼ P , 领域模型的训练数据为  {Y} n i=1  ∼ Q . 其中  P n
                                                                     n
                                                                                                 n
                    n
                 和  Q  表示不同分布. 大语言模型独立理解训练分布外数据的能力有限, 因此容易出现答非所问的现象.
   297   298   299   300   301   302   303   304   305   306   307