Page 66 - 《软件学报》2026年第2期
P. 66
沈庆超 等: 智能问答系统逻辑推理测试 545
题. 然而, 在引入逻辑关系的过程中通常会遇到两类问题, 分别为: (1) 引入的推理关系数量不可控: 在改变原始问
题逻辑时, 控制引入问题的推理关系数量是有必要的. 这样可以自主控制问题的难度, 从多个方面对智能问答系统
的逻辑推理能力进行测试; (2) 缺乏上下文: 某些复杂推理问题需要依赖于更广泛的背景知识和更全面的上下文信
息, 如何构造包含推理关系的合法测试用例极具挑战. 为此, 开发一种可以控制引入推理关系数量并能补充上下文
信息的方法用于测试智能问答系统的逻辑推理能力变得十分重要. 在提升测试方法泛用性和高效性的同时, 我们
也需要关注测试方法本身的自然性、误报率等关键特性. 其中, 自然性反映了检测到的缺陷在现实场景中出现的
可能性. 自然性越高表明测试方法发现的缺陷在实际应用中越常见, 其潜在危害也越大. 真阳性率则体现了测试方
法报告缺陷的准确性. 真阳性率越高说明测试方法的可信度越高.
为了弥补现有智能问答系统测试技术的不足, 本文提出了一种逻辑关系引导的蜕变测试方法 QALT. 与已有
研究方法类似 [16,17] , QALT 依托蜕变测试技术避免手动标注数据的局限性. 针对现有方法在测试智能问答系统逻
辑推理能力和测试场景覆盖方面的局限性, QALT 设计了一组逻辑推理相关的蜕变关系. 具体而言, QALT 借助语
言模型在原始测试输入中插入一条与问题相关的逻辑推理关系, 从而生成与原始测试输入语义等价的新测试输
入. 这种方式避免了新生成的测试用例依托于上下文和回答范式的局限性, 使得测试方法具有广泛适用性. 同时,
新引入的逻辑推理关系可以使得新问题需要综合上下文中的多处知识点来回答, 从而可以深度测试智能问答系统
的推理能力. 此外, 为了保证生成测试输入的自然性, QALT 分别提出了关键变异位置和关键名词词组的选择策
略. 其中, 关键变异位置选择策略通过使用语义相似度度量方法在上下文中找到与问题直接相关的语句作为变异
插入位点, 从而使得变异生成的上下文更加流畅自然. 同理, QALT 选择与上下文相关度高的名词词组进行变异能
够保证新生成推理句子与当前上下文所讨论话题直接相关, 从而使得最终生成的新测试输入更加自然真实. 最后,
对于所有的测试技术, 保证其拥有较低的误报率将会提升测试的自动化程度. 为此, QALT 采用基于依存句法分析
的选择策略对不合法的测试输入进行自动化过滤以降低测试的误报率.
[7]
为了验证 QALT 的有效性, 本文选择了 ChatGPT 和 ChatGLM-6B [18] 两款前沿的大型语言模型作为实验待测
[4]
软件. 3 种不同格式且被广泛使用的问答数据集 (即 BoolQ , SQuAD2 [19] 和 NarrativeQA [20] ) 被用作 QALT 的原始
测试输入. 作为目前最先进的智能问答系统测试技术, QAQA 与 QAAskeR 被选为本文的对比方法. 我们分别评估
了 QALT 缺陷检测能力, 不同组件的有效性和 QALT 生成的测试输入对修复智能问答系统缺陷修复的有效性. 实
验结果表明, QALT 在两类待测问答系统上分别比 QAQA 和 QAAskeR 多检测出 3 150 和 3 897 个缺陷. 同时,
QALT 的不同组件能够有效地保证生成测试输入的高质量 (高自然性和低误报率). 此外, 本文还观察到基于高阶变
异的蜕变关系可以检测到最多的缺陷, 证明基于高阶变异的蜕变关系有着更强的揭错能力. 最后, 使用 QALT 生成
的数据对智能问答模型进行微调, 成功地将开源的智能问答系统 ChatGLM 的错误率从 22.33% 减少到 14.37%.
本文第 2 节介绍智能问答系统测试的研究现状. 第 3 节介绍智能问答系统的背景知识. 第 4 节介绍本文构建
的逻辑引导的智能问答系统蜕变测试技术. 第 5 节通过对比实验验证所提方法的有效性和高效性. 第 6 节讨论影
响方法效度的因素. 最后总结全文.
2 相关工作
目前, 关于智能问答系统质量与安全问题的测试研究正受到越来越多研究者的关注. 根据质量评估的手段不
同, 已有的研究工作可以分为对抗样本攻击和测试技术.
对抗样本攻击方法通过对模型输入添加微小的扰动来试图引起系统输出的变化, 旨在探测系统的脆弱性和潜
在的安全漏洞. 一个经典的针对 NLP 模型的对抗样本攻击方法是 Eger 等人 [12] 提出的字符级别的对抗攻击方法.
该方法设计了单词内部字符顺序打乱 (inner-shuffle)、特殊符号插入 (intruders)、元音字符移除 (disemvoweling)
等 10 种字符级别变异算子, 用于测试 NLP 模型的鲁棒性. 该技术能够很好地评估 NLP 模型的单词识别鲁棒性.
除此之外, Sharma 等人 [21] 、Tang 等人 [22] 、Sheng 等人 [23] 和 Walmer 等人 [24] 通过对图片的像素进行微调实现针对
视觉问答系统的鲁棒性评测.
与对抗样本攻击的目的不同, 测试技术旨在生成强揭错能力的测试用例并构造相应的测试预言实现对智能问

