Page 100 - 《软件学报》2026年第4期
P. 100

李昱洁 等: 面向开放世界持续学习的任务敏感提示驱动混合专家模型                                                1541


                 组合, 将  TP-MoE  与这  20  个组合的基线模型进行比较. 另外, 在实验中还重点考虑了               2  个最新的开放世界持续学
                 习模型, 也将基准     MoE  模型纳入了对比. 下面简要介绍所涉及的持续学习方法、分布外样本检测算法和开放世界
                 持续学习模型.
                    • L2P [28] : 该方法基于提示的微调机制     (prompt-based fine-tuning), 高效地将预训练模型适配到持续学习任务
                 中, 充分利用了大规模预训练知识.
                    • DualPrompt [31] : 该方法提出双重提示调优策略, 分别面向任务特定提示与任务无关提示, 以增强在持续学习
                 场景中的泛化能力.
                    • CODA-P  [33] : CODA-P  结合对比学习与动态提示机制, 在适应新任务的同时保持已学知识, 有效提升持续学
                 习性能.
                    • RanPAC [40] : 这是一种内存高效的持续学习方法, 采用随机部分注意力机制                (randomized partial attention) 来
                 捕捉与任务相关的知识, 同时缓解灾难性遗忘.
                    • ADAM [41] : ADAM  重新审视基于注意力机制的持续学习范式, 提出一种利用动态注意力来更好地保持旧任
                 务知识的结构.
                             [4]
                    • OpenMax : 这是一种   OOD  检测方法, 通过调整      Softmax 输出层识别未知类别, 实现开放集识别           (open-set
                 recognition).
                    • MaxLogits [42] : 该方法使用最大  logit 值作为指标来检测分布外样本, 为持续学习提供一种简单可扩展的
                 OOD  识别技术.
                    • Entropy [43] : 该方法利用模型输出分布的熵值作为指标, 用于区分分布内与分布外数据, 进行                  OOD  检测.
                    • EnergyBased [44] : 该  OOD  方法基于神经网络输出计算能量分数, 以区分分布内样本与未见类别, 提升未知类
                 别的识别能力.
                    • MORE [12] : MORE  是一种  OWCL  方法, 提出了一种内存高效的正则化技术, 以更好地应对任务切换并避免
                 遗忘.
                           [9]
                    • Pro-KT : Pro-KT  是一种基于原型的持续学习方法, 利用原型结构促进任务间的知识迁移, 有效应对开放世
                 界学习场景.
                  5.3   主要实验结果与分析
                    为了评估    TP-MoE  的有效性, 我们针对性地解决了以下两个研究问题.
                    研究问题    1: TP-MoE  能否在开放世界持续学习的场景下比现有的模型在已知类别的分类上获得更好的结果?
                    研究问题    2: TP-MoE  能否在开放世界持续学习的场景下比现有的模型在未知类别的检测上获得更好的结果?
                    为了验证这两个问题的结果, 我们对比了所提出模型                  TP-MoE  与第  5.2  节提到的现有主流的持续学习方法在
                 两个基准数据集上使用不同的场景设定下的性能表现. 评估指标包括分类准确率                           ( ACC t )、开放检测能力   ( AUC t )
                 和误拒率   ( FPR t ), 对模型在所有任务上的性能进行全面评估.
                    从表  2  所示的实验结果中可以看出, 在         Split-CIFAR100  数据集上, TP-MoE  显著优于所有对比方法.      ACC t  为
                 0.876±0.023, 相比表现次佳的   Pro-KT (0.779±0.010) 高出约  9.7%;  AUC t  达到  0.915±0.016, 显著领先于其他方法的
                 平均水平, 反映出模型在识别未知类别时具备更强的辨别能力. 此外, TP-MoE                      在  FPR t  上也实现了相对较低的
                 0.280±0.101, 相比大多数传统方法    (如  L2P、DualPrompt、CODA-P) 普遍超过   0.9  的高误拒率, 有效减少了对已知
                 类别样本的误拒现象, 表明其在开放环境中保持较高保守性的同时, 仍能维持准确识别. 在更加复杂的                                  Open-
                 CORe25  数据集上, TP-MoE  依然保持优越的性能, 其        ACC t  为  0.797±0.087, 在所有方法中排名第一.   AUC t  达到
                 0.789±0.245, 显著高于  Pro-KT (0.675±0.125) 和  MORE (0.641±0.077) 等代表方法, 说明模型在面对大规模、复杂
                 场景下的开放类别具有良好的感知与区分能力.                FPR t  指标则为  0.320±0.074, 同样低于所有基线方法, 进一步验证
                 了  TP-MoE  在处理开放集样本时具备更低的误拒倾向.
                    并且, 由于   MoE  模块本身并不具备持续学习与开放识别机制, 我们构造了一个仅使用                       MoE  结构的  baseline
   95   96   97   98   99   100   101   102   103   104   105