Page 158 - 《软件学报》2026年第7期
P. 158

周俊伟 等: PCLog: 近端策略优化与行为克隆自适应日志异常检测                                              2843


                 目前通过离线数据集上的模拟验证了此流程, 而反馈机制在实际生产环境中的标注频率、数据量及其对人工的依
                 赖程度, 是未来工作中需要进一步研究和量化的重要方面.

                                                       无反馈      有反馈
                   1.00                         1.00                         1.00
                   0.99                         0.99                         0.99
                   0.98                         0.98                         0.98
                   0.97                         0.97                         0.97
                   0.96                         0.96                         0.96
                   0.95                         0.95                         0.95
                   0.94                         0.94                         0.94
                   0.93                         0.93                         0.93
                   0.92                         0.92                         0.92
                   0.91                         0.91                         0.91
                   0.90                         0.90                         0.90
                       精确率     召回率     F1 值         精确率     召回率     F1 值         精确率     召回率     F1 值
                          (a) HDFS 数据集                  (b) BGL 数据集                (c) OpenStack 数据集

                                               图 7 3  个数据集反馈前后性能比较

                    另一方面, 由于模型本身在识别异常样本方面已具备较强能力, 因此在优化前后召回率的变化较小. 总体来
                 看, 实验结果验证了      PCLog 在引入专家轨迹并结合模仿学习进行模型优化方面的有效性, 尤其是在减少误报和提
                 升检测精度方面表现尤为突出. 图           8  展示了  PCLog  在  HDFS、BGL  和  OpenStack  数据集上, 不同损失权重参数   λ
                 取值下的实验结果. 实验结果表明, 随着权重参数              λ 的增大, PCLog  模型逐渐更多地依赖专家数据分布, 所学习的
                 策略趋向于接近专家的决策过程. 这使得精确率呈现出持续上升的趋势, 表明利用专家知识能够显著提升检测的
                              λ 超过某一最优阈值后, 模型对专家数据的过度依赖反而削弱了其识别异常样本的能力, 导致召
                 准确性. 然而, 当
                 回率出现非单调变化——先升高后下降. 过大的                λ 可能使模型过于局限于专家知识, 降低了对新异常模式的适应
                 性, 从而影响整体性能表现.

                                                  精确率        召回率        Fl 值

                   1.00                         1.00                         1.00
                   0.96                         0.96                         0.96
                   0.92                         0.92                         0.92
                   0.88                         0.88                         0.88
                   0.84                         0.84                         0.84
                   0.80                         0.80                         0.80
                       0.1 0.2 0.3  0.4 0.5 0.6 0.7 0.8 0.9  0.1 0.2 0.3  0.4 0.5 0.6 0.7 0.8 0.9  0.1 0.2 0.3  0.4 0.5 0.6 0.7 0.8 0.9
                                 λ                            λ                            λ
                          (a) HDFS 数据集                  (b) BGL 数据集                (c) OpenStack 数据集
                                         图 8 不同   λ 取值下, 3  种数据集上的实验结果比较

                                                                                        λ 设定为约   0.5, 使模
                    为了解决上述问题, 训练过程中采用指数衰减策略动态调整参数                      λ 的取值. 起始阶段将
                 型能够充分利用专家知识, 在训练初期快速提升精确率. 随着训练的进行,                       λ 的值逐渐减小, 减少对专家数据的依
                 赖, 增强模型的泛化能力和识别新异常模式的能力.
                    为了评估    PCLog  在实际部署中的可行性, 本节还对比了           PCLog  与基线方法在    HDFS、BGL   和  OpenStack  数
                 据集上的训练时间开销, 具体结果如表            5  所示 (加粗数字为最优值). 实验结果表明, PCLog        通过融合强化学习与模
                 仿学习机制, 显著提升了训练效率. 首先, PPO           算法通过经验回放缓冲区实现了数据的复用, 提升了训练效率; 其
                 次, PCLog  的策略网络和价值网络结构相对简单, 仅由            3  层全连接层构成, 计算开销较小. 此外, 在引入模仿学习进
                 行微调时, 由于只需在少量专家数据上进行训练, 其额外时间开销极低. 这表明                        PCLog  具备应用于实际在线环境
                 的潜力.
   153   154   155   156   157   158   159   160   161   162   163