Page 148 - 《软件学报》2026年第7期
P. 148
周俊伟 等: PCLog: 近端策略优化与行为克隆自适应日志异常检测 2833
1) 高资源成本: 模型参数规模庞大, 训练与推理均需要大量计算资源, 难以在高并发的生产环境中实时部署.
2) 领域适应性差: 预训练模型语料主要来源于通用文本, 无法充分捕获系统日志的结构化语义与事件逻辑关
系, 导致领域迁移性能不稳定.
3) 缺乏持续自适应能力: 当系统环境变化或日志分布演化时, LLM 需要依赖人工微调或提示工程调整, 维护
代价高且响应滞后.
针对上述问题, 本文提出一种融合强化学习与模仿学习的自适应日志异常检测框架——PCLog. 该方法通过
近端策略优化 (proximal policy optimization, PPO) 实现检测策略的动态更新, 使模型能够在日志分布变化时自主
调整行为决策; 当检测性能下降时, 系统自动收集错误预测样本作为专家示范, 引入行为克隆 (behavior cloning,
BC) 机制进行策略微调, 从而在不依赖人工标注或重新训练的情况下快速恢复性能. 这种基于强化学习与模仿学
习协同的机制, 能够有效缓解静态模型的性能漂移问题, 提升检测的持续稳定性与鲁棒性.
综上, 本文的主要贡献如下.
1) 提出一种基于近端策略优化 (PPO) 算法的强化学习日志异常检测方法 PCLog, 能够在无需大量历史日志
的情况下学习系统的正常行为策略, 用于异常检测.
2) 融合模仿学习机制, 在检测性能下降时收集错误预测样本作为专家示范, 引入行为克隆算法对模型策略进
行调整, 有效降低误报率, 提升模型鲁棒性.
3) 在 HDFS、BGL 与 OpenStack 这 3 个公开日志数据集上进行充分实验, PCLog 在各数据集上均取得 99%
以上的召回率, 展现出对动态日志模式的良好适应性.
本文第 2 节介绍相关工作. 第 3 节阐述 PCLog 的设计与实现细节. 第 4 节描述并讨论评估实验. 第 5 节对本
文工作进行总结. PCLog 的源代码可在以下网址获取: https://github.com/whutwcl3093/PCLog.
2 相关工作
2.1 自适应日志异常检测方法
为了有效地应对日志模式的变化并实现自适应学习, 近年来学者们提出了多种具有代表性的方法. Wang 等
人 [46] 提出了一种名为 LogOnline 的半监督异常检测方法, 该方法通过在线学习机制不断从新生成的日志序列中学
习正常模式, 无需人工标注与干预, 较好地缓解了日志模式不稳定问题. Han 等人 [47] 提出了 ROEAD, 一种鲁棒的
在线演化异常检测框架, 通过引入鲁棒特征提取机制以削弱噪声干扰, 并采用在线演化机制实现模型参数的动态
更新. 理论分析表明该方法性能可逐步逼近最优. Yuan 等人 [48] 设计了 ADA, 一种基于 LSTM 的自适应深度日志
异常检测模型, 可实时捕捉新的日志模式, 并结合自适应模型选择策略以提高资源利用率, 同时采用动态阈值算
法, 根据近期检测结果优化阈值设置, 进一步提升检测性能. 然而, 这些基于深度学习的模型往往需要频繁重训练
或微调, 而在原始超参数配置下, 这些模型在新日志数据上的检测性能仍存在不确定性.
2.2 基于强化学习与模仿学习的日志异常检测方法
近年来, 强化学习 (reinforcement learning, RL) 在日志异常检测领域逐渐显示出其潜力. Duan 等人 [49] 最早将
强化学习引入该领域, 提出了基于 Q-learning 的 QLLog 方法. 该方法能够通过 Q-learning 算法自动学习日志行为
模式, 引入反馈机制与异常严重度评级, 并可检测多种异常类型, 同时实现对异常事件的严重程度排序. 实验证明,
该方法在多个公共数据集上具有良好的检测精确率与适应性. Zhou 等人 [50] 在此基础上提出了 DRLLog, 一个基于
深度强化学习的日志异常检测框架. DRLLog 以深度 Q 网络 (DQN) 为智能体, 在日志数据构建的环境中进行交
互, 通过动作选择与反馈学习, 实现对日志序列中模式变化的持续适应, 克服了传统静态检测模型的局限性.
总体来看, 强化学习在日志异常检测中的应用具有显著优势. 一方面, 日志数据天然具有时序性, 强化学习可
通过策略学习机制建模系统行为的执行路径, 从而提高对异常行为的识别能力 [51] ; 另一方面, 强化学习的动态学
习能力使智能体能够通过与环境的持续交互, 适应日志模式的不断演化, 显著增强检测模型的泛化性与鲁棒性.
此外, 模仿学习 (imitation learning, IL) 作为另一种决策策略学习范式, 通过专家示范学习状态-动作映射, 不依

