Page 148 - 《软件学报》2026年第7期
P. 148

周俊伟 等: PCLog: 近端策略优化与行为克隆自适应日志异常检测                                              2833


                    1) 高资源成本: 模型参数规模庞大, 训练与推理均需要大量计算资源, 难以在高并发的生产环境中实时部署.
                    2) 领域适应性差: 预训练模型语料主要来源于通用文本, 无法充分捕获系统日志的结构化语义与事件逻辑关
                 系, 导致领域迁移性能不稳定.
                    3) 缺乏持续自适应能力: 当系统环境变化或日志分布演化时, LLM 需要依赖人工微调或提示工程调整, 维护
                 代价高且响应滞后.
                    针对上述问题, 本文提出一种融合强化学习与模仿学习的自适应日志异常检测框架——PCLog. 该方法通过
                 近端策略优化 (proximal policy optimization, PPO) 实现检测策略的动态更新, 使模型能够在日志分布变化时自主
                 调整行为决策; 当检测性能下降时, 系统自动收集错误预测样本作为专家示范, 引入行为克隆 (behavior cloning,
                 BC) 机制进行策略微调, 从而在不依赖人工标注或重新训练的情况下快速恢复性能. 这种基于强化学习与模仿学
                 习协同的机制, 能够有效缓解静态模型的性能漂移问题, 提升检测的持续稳定性与鲁棒性.
                    综上, 本文的主要贡献如下.
                    1) 提出一种基于近端策略优化 (PPO) 算法的强化学习日志异常检测方法                     PCLog, 能够在无需大量历史日志
                 的情况下学习系统的正常行为策略, 用于异常检测.
                    2) 融合模仿学习机制, 在检测性能下降时收集错误预测样本作为专家示范, 引入行为克隆算法对模型策略进
                 行调整, 有效降低误报率, 提升模型鲁棒性.
                    3) 在  HDFS、BGL  与  OpenStack  这  3  个公开日志数据集上进行充分实验, PCLog      在各数据集上均取得        99%
                 以上的召回率, 展现出对动态日志模式的良好适应性.
                    本文第   2  节介绍相关工作. 第     3  节阐述  PCLog  的设计与实现细节. 第     4  节描述并讨论评估实验. 第      5  节对本
                 文工作进行总结. PCLog     的源代码可在以下网址获取: https://github.com/whutwcl3093/PCLog.
                  2   相关工作


                  2.1   自适应日志异常检测方法
                    为了有效地应对日志模式的变化并实现自适应学习, 近年来学者们提出了多种具有代表性的方法. Wang                                 等
                 人  [46] 提出了一种名为  LogOnline 的半监督异常检测方法, 该方法通过在线学习机制不断从新生成的日志序列中学
                 习正常模式, 无需人工标注与干预, 较好地缓解了日志模式不稳定问题. Han                     等人  [47] 提出了  ROEAD, 一种鲁棒的
                 在线演化异常检测框架, 通过引入鲁棒特征提取机制以削弱噪声干扰, 并采用在线演化机制实现模型参数的动态
                 更新. 理论分析表明该方法性能可逐步逼近最优. Yuan               等人  [48] 设计了  ADA, 一种基于  LSTM  的自适应深度日志
                 异常检测模型, 可实时捕捉新的日志模式, 并结合自适应模型选择策略以提高资源利用率, 同时采用动态阈值算
                 法, 根据近期检测结果优化阈值设置, 进一步提升检测性能. 然而, 这些基于深度学习的模型往往需要频繁重训练
                 或微调, 而在原始超参数配置下, 这些模型在新日志数据上的检测性能仍存在不确定性.
                  2.2   基于强化学习与模仿学习的日志异常检测方法

                    近年来, 强化学习 (reinforcement learning, RL) 在日志异常检测领域逐渐显示出其潜力. Duan           等人  [49] 最早将
                 强化学习引入该领域, 提出了基于           Q-learning  的  QLLog  方法. 该方法能够通过  Q-learning  算法自动学习日志行为
                 模式, 引入反馈机制与异常严重度评级, 并可检测多种异常类型, 同时实现对异常事件的严重程度排序. 实验证明,
                 该方法在多个公共数据集上具有良好的检测精确率与适应性. Zhou                    等人  [50] 在此基础上提出了    DRLLog, 一个基于
                 深度强化学习的日志异常检测框架. DRLLog             以深度  Q  网络 (DQN) 为智能体, 在日志数据构建的环境中进行交
                 互, 通过动作选择与反馈学习, 实现对日志序列中模式变化的持续适应, 克服了传统静态检测模型的局限性.
                    总体来看, 强化学习在日志异常检测中的应用具有显著优势. 一方面, 日志数据天然具有时序性, 强化学习可
                 通过策略学习机制建模系统行为的执行路径, 从而提高对异常行为的识别能力                          [51] ; 另一方面, 强化学习的动态学
                 习能力使智能体能够通过与环境的持续交互, 适应日志模式的不断演化, 显著增强检测模型的泛化性与鲁棒性.
                    此外, 模仿学习 (imitation learning, IL) 作为另一种决策策略学习范式, 通过专家示范学习状态-动作映射, 不依
   143   144   145   146   147   148   149   150   151   152   153