Page 160 - 《软件学报》2026年第7期
P. 160
周俊伟 等: PCLog: 近端策略优化与行为克隆自适应日志异常检测 2845
能体, 日志的语义向量作为环境状态, 日志事件被视为智能体的动作, 通过学习系统正常运行时的行为模式, 实现
对异常行为的精准识别.
针对实际系统中异常检测模型在长期运行过程中缺乏有效反馈、易出现性能退化的问题, PCLog 引入了一种
基于现有检测网络的自适应微调机制. 当系统检测到模型性能下降时, 自动收集部分模型预测结果构建专家示范
数据, 通过行为克隆方法对模型进行精调, 提升其鲁棒性和泛化能力, 从而增强系统在动态环境下的持续检测能力.
在 HDFS、BGL 和 OpenStack 这 3 个公开日志数据集上的实验证明, PCLog 相较于主流的基线方法, 在精确
率、召回率和 F1 值等指标上均取得了更优性能. 同时, 该方法在应对日志模式变化方面展现出良好的适应性, 具
备较高的实用价值和推广潜力, 能够为实际系统中的日志异常检测任务提供一种高效、可靠的解决方案. 任务提
供一种高效、可靠的解决方案.
5.2 未来展望
尽管 PCLog 在多个真实数据集上展现出优异的检测性能与较强的自适应能力, 但本文工作仍存在一些不足:
(1) 反馈数据依赖人工标注, 当前反馈样本需人工确认假阳性, 日均 10 亿条日志场景中, 0.5% 样本仍需 500 万条
标注, 成本较高; (2) 极端模板变更下性能波动, 系统新增 50% 以上新模板时, 反馈样本短期内难以覆盖, 模型微调
后召回率仍下降 1%–2%, 需 2–3 轮反馈恢复; (3) 超参数需人工调整: 阈值 g (序列异常判定) 与 λ (模仿学习权重)
需按数据集调整, HDFS 最优 g=11、 λ =0.5, BGL 最优 g=12、 λ =0.4, 无统一自适应机制.
针对上述不足, 我们未来的研究可从以下几个方面展开. 第一, 探索更加自动化和低成本的反馈数据收集方
式, 减少对人工标注的依赖. 结合规则引擎, 自动筛选高置信度正常样本 (如参数格式合规、时间间隔正常的假阳
性样本), 目标将人工标注比例从 0.5% 降至 0.1%, 降低标注成本与运维负担. 第二, 设计更具鲁棒性的自适应机制,
以提升模型在高噪声与开放环境下的稳定性. 引入日志领域预训练模型 (如 LogBERT), 先在大规模通用日志数据
集上完成预训练, 再在目标数据集上进行针对性微调, 缩短极端日志模板变更场景下的模型适应时间, 增强对动态
环境的适配能力. 第三, 引入自适应阈值或动态调参方法, 降低人工设定超参数对性能的影响. 设计基于强化学习
的超参数优化器, 实时根据模型输出的精确率、召回率动态调整序列异常判定阈值 g 与模仿学习平衡因子 λ, 实
现超参数的端到端优化, 避免人工调参的主观性与繁琐性. 第四, 结合预训练模型或图神经网络等新兴技术, 进一
步提升对未见模板和复杂日志模式的检测能力. 通过预训练模型的语义理解优势与图神经网络对事件关联关系的
建模能力, 强化对新型日志模板、复杂交互序列的异常识别效果. 我们相信, 上述方向的探索将有助于推动日志异
常检测方法向更加智能化、鲁棒化和可部署化的方向发展.
References
[1] He SL, Zhu JM, He PJ, Lyu MR. Experience report: System log analysis for anomaly detection. In: Proc. of the 27th IEEE Int’l Symp. on
Software Reliability Engineering. Ottawa: IEEE, 2016. 207–218. [doi: 10.1109/ISSRE.2016.21]
[2] You Y, Wang H, Ren T, Gu SH, Sun JL. Storage design of tracing-logs for application performance management system. Ruan Jian Xue
Bao/Journal of Software, 2021, 32(5): 1302–1321 (in Chinese with English abstract). http://www.jos.org.cn/1000-9825/6234.htm [doi: 10.
13328/j.cnki.jos.006234]
[3] Jia T, Li Y, Wu ZH. Survey of state-of-the-art log-based failure diagnosis. Ruan Jian Xue Bao/Journal of Software, 2020, 31(7):
1997–2018 (in Chinese with English abstract). http://www.jos.org.cn/1000-9825/6045.htm [doi: 10.13328/j.cnki.jos.006045]
[4] Bao HY, Yin KL, Cao L, Li SN, Sun YJ, Yin HF, Tang RM, Hou Y, Wang SQ, Pei D, Yang XQ, Wang LX. AIOps in practice: Status
Quo and standardization. Ruan Jian Xue Bao/Journal of Software, 2023, 34(9): 4069–4095 (in Chinese with English abstract). http://www.
jos.org.cn/1000-9825/6876.htm [doi: 10.13328/j.cnki.jos.006876]
[5] Jiang ZM, Hassan AE, Flora P, Hamann G. Abstracting execution logs to execution events for enterprise applications (short paper). In:
Proc. of the 8th Int’l Conf. on Quality Software. Oxford: IEEE, 2008. 181–186. [doi: 10.1109/QSIC.2008.50]
[6] Makanju AAO, Zincir-Heywood AN, Milios EE. Clustering event logs using iterative partitioning. In: Proc. of the 15th ACM SIGKDD
Int’l Conf. on Knowledge Discovery and Data Mining. Paris: ACM, 2009. 1255–1264. [doi: 10.1145/1557019.1557154]
[7] Du M, Li FF. Spell: Streaming parsing of system event logs. In: Proc. of the 16th Int’l Conf. on Data Mining. Barcelona: IEEE, 2016.
859–864. [doi: 10.1109/ICDM.2016.0103]

