Page 80 - 《软件学报》2026年第2期
P. 80
沈庆超 等: 智能问答系统逻辑推理测试 559
所以研究问题 3 使用 ChatGLM-6B 作为修复方法的验证对象. 为了避免模型过拟合, 本文使用训练数据作为种子
池, 并为每个数据集生成 1 500 个新的问答对. 本实验总共使用 4 500 个新的问答对, 同时使用最先进的基于
LoRA 的微调方法, 实现了对 ChatGLM-6B 模型的微调. 然后, 本文在第 5.2.1 节中生成的测试输入上比较原始模
型和微调模型分别产生的错误率. 与揭错率不同, 错误率是对模型性能的评估指标, 然而揭错率则是对测试技术的
评价. 错误率等于模型在给定数据集上预测结果错误的比例. 本文使用 20% 的测试集作为验证集来指导模型训练,
剩下的测试集用来比较缺陷修复结果. 模型微调前后的错误率结果见表 6.
表 6 原始模型的错误率和使用 QALT 生成数据微调后模型的错误率 (%)
指标 BoolQ SQuAD2 NarQA 平均值
原始模型的错误率 17.64 24.31 25.03 22.33
微调后模型的错误率 12.17 16.07 14.87 14.37
缺陷修复的比率 22.19 27.97 35.43 29.32
从表 6 中可以看出, 微调后的模型相比于原始模型在错误率上有着显著的下降. 错误率平均下降了 29.32% (从
22.33% 下降至 14.37%). 同时, 本文使用公式 (4) 计算了缺陷修复比率. 计算结果显示, QALT 在 NarQA 数据集上
的修复能力最为显著, 修复了其中 35.43% 的缺陷. 模型微调的平均修复率为 29.32%, 这也证明了 QALT 生成测试
用例对模型修复的有效性.
(原始模型错误率−微调后模型错误率)
缺陷修复比率 = (4)
原始模型错误率
6 方法的效度威胁
在研究过程中, 效度威胁是指那些可能对研究结果的准确性、可靠性和泛化性构成潜在威胁的因素. 效度威
胁通常可以分为外部效度威胁和内部效度威胁两大类.
外部效度威胁主要涉及评估方法揭错能力的指标设计. 与传统软件中的缺陷不同, 由于智能问答系统的黑盒
特性, 多个测试用例的回答错误可能源于同一个缺陷, 也可能源于多个缺陷. 由于修复智能问答系统的缺陷需要调
整整个模型的参数, 因此无法对检测到的缺陷进行去重操作并统计去重后缺陷数量. 这对评估缺陷检测技术的效
度造成了一定影响. 为了最大程度地降低这一影响, 本文遵循已有的研究方法 [16,17] , 对每个原始的种子输入仅生成
一个新的测试变异体作为新的测试输入. 通过计算所有测试用例中能够揭露出智能问答系统缺陷的比例 (即, 测试
用例的揭错率) 来衡量缺陷检测技术的揭错能力. 这种方法可以最大程度地避免因同一个种子测试输入生成的多
个新的测试用例揭露同一个缺陷而被重复计算的情况.
内部效度威胁主要挑战在于对测试输入的自然性与是否为误报数据的人工标注过程可能存在的主观性和误
差. 为了减轻这些潜在威胁, 本研究采用了双重核查机制. 两位具有较高英文阅读理解水平的研究者分别独立对每
个随机筛选的数据进行标记. 当标记结果不一致时, 第 3 位研究人员会被邀请参与讨论, 直至所有标记结果达成一
致. 这种方法在最大程度上保证了数据标注结果的可靠性和准确性.
7 总 结
近年来, 智能问答系统的测试技术取得了显著进展, 其中 QAAskeR 与 QAQA 通过采用蜕变测试技术成功摆
脱了对人工标注数据的依赖. 然而, 这些方法在面对当前主流的基于大型语言模型的问答系统时, 暴露出明显的局
限性. 首先, 它们未能充分评估系统的逻辑推理能力. 其次, QAQA 依赖于待测问答系统的数据集, 当数据集不可
获取时, 该方法将无法实施. 而 QAAskeR 则受限于规则匹配机制, 其有效性高度依赖于模型输出的标准化程度,
当模型输出格式不统一时, 其测试效果会显著下降. 这些局限性使得现有方法在测试基于大型语言模型的问答系
统时表现欠佳. 针对上述问题, 本研究提出了一种基于逻辑关系引导的问答系统蜕变测试技术 QALT. QALT 首先
设计了 3 种逻辑蜕变关系来避免测试过程中对问答系统的数据集或回答范式产生依赖性, 从而提升了方法的泛用
性, 同时弥补了现有方法测试智能问答系统逻辑推理能力的不足. 接着, QALT 通过计算文本相似度的方式选择变

