Page 159 - 《软件学报》2026年第7期
P. 159
2844 软件学报 2026 年第 37 卷第 7 期
表 5 3 个数据集单轮训练时间对比 (s)
方法 HDFS BGL OpenStack
DeepLog 64 28 12
LogAnomaly 102 30 28
QLLog 34 16 10
PCLog 15 7 6
RQ3: 反馈数据对 PCLog 异常检测性能有何影响?
回答: 通过消融实验, 我们可以得出: 当移除反馈数据或减少反馈比例时, PCLog 的精确率和召回率均出现明
显下降; 而在引入反馈数据后, 检测性能得到持续提升. 这一结果证明了基于误判样本的行为克隆机制对于缓解模
型漂移、提升检测精度具有关键作用.
4.5 RQ4: 不同阈值 g 下 PCLog 的检测性能如何?
● 动机: 阈值 g 是序列异常判定核心参数, g 过小易误判正常事件, g 过大易漏检异常, 需明确各数据集最优 g
值及模型鲁棒性, 为部署提供参数依据.
● 评估方法: 在 HDFS、BGL、OpenStack 数据集上, 将 g 设为 8–16 的连续整数; 以精确率、召回率、F1 值
为指标, 每个 g 值重复实验 5 次取均值; 分析 F1 值峰值对应的最优 g 及阈值波动对性能的影响.
本节对不同阈值 g 下的检测性能进行对比分析. 图 9 展示了在 HDFS、BGL 和 OpenStack 这 3 个数据集上,
随着阈值 g 变化的实验结果. 如图 9 所示, 随着阈值 g 的增加, 3 个数据集上的召回率逐渐下降, 而精确率则呈上
升趋势. 这是因为阈值 g 决定了被判定为正常日志的概率范围. 当 g 增大时, 模型会将更多日志判定为正常, 从而
导致被正确识别为异常的日志数量减少, 召回率随之下降. 同时, 被识别为异常的日志数量减少, 异常样本中真正
异常的比例上升, 因此精确率提高. 实验结果表明, 当阈值 g 设置在 11 附近时, 模型在 3 个数据集上均达到了整体
最优的检测性能.
精确率 召回率 Fl 值
1.00 1.00 1.00
0.96 0.96 0.96
0.92 0.92 0.92
0.88 0.88 0.88
0.84 0.84 0.84
0.80 0.80 0.80
8 9 10 11 12 13 11 12 13 14 15 16 9 10 11 12 13 14
阈值 g 阈值 g 阈值 g
(a) HDFS 数据集 (b) BGL 数据集 (c) OpenStack 数据集
图 9 在不同阈值 g 下 3 个数据集的检测性能表现
RQ4: PCLog 在不同实验设置下的有效性如何?
回答: 参数敏感性分析表明, 当 g≈11 时, PCLog 在 3 个数据集上的性能最优, 且在相邻区间内波动较小. 这说
明该方法对阈值设置具有一定的鲁棒性, 能够在合理范围内保持稳定的检测效果.
5 总结与展望
5.1 总 结
本文提出了一种融合强化学习与模仿学习的日志异常检测方法 PCLog. 该方法首先将日志序列转换为适用于
强化学习的状态-动作表示形式, 并基于近端策略优化算法构建策略优化模型. 在该框架中, 检测模型被建模为智

