Page 92 - 《软件学报》2026年第4期
P. 92

李昱洁 等: 面向开放世界持续学习的任务敏感提示驱动混合专家模型                                                1533


                 续学习方法大多仍是“开放集识别方法+持续学习方法”的简单策略叠加, 忽视了未知样本本身所蕴含的可迁移知识和
                 “开放识别”与“已知分类”的相互影响关系, 从而导致现有的开放世界持续学习方法在真实的开放动态环境中的适
                 应性和泛化能力受限. 因此, 一个理想的开放世界持续学习方法应具备任务敏感的知识学习和知识迁移——既能
                 在已经学习过的任务中的已知类别上保持良好效果, 也能有效地利用来自不同任务的未知样本的知识判别未知类
                 别和已知类别.

                                        任务1                                  任务t
                                        训练集                                  训练集
                                                                                Class n
                                           Class 1
                                   Class 2                 …                               …
                                                                        Class m
                                       测试集                                  测试集
                                                                            …


                     持续学习     为[class 1],  为[class 2],       为[class 1].  …  为[class 1], … ,       为[class m],     为[class 1].
                     开放世界     为[class 1] ,        为[class 2],       为开放样本.  …  为[class 1], … ,        为[class m],      为开放样本.
                     持续学习
                                            图 1 开放世界持续学习问题的简明示意图

                    具体而言, 本文提出了一种面向开放世界持续学习的混合专家模型结构, 引入一种即插即用的任务敏感提示
                 聚合策略, 用于持续地积累、融合来自不同任务的知识, 从而支持开放世界持续学习模型进行知识积累、知识传
                 输甚至知识更新. 同时, 为了更精准地识别开放样本, 本文提出了一种自适应的阈值选择策略, 能够根据新知识的
                 积累更新和旧知识的迁移实现自适应开放决策边界. 具体而言, 本文提出的                         TP-MoE (task-aware prompt-driven
                 mixture of experts) 模型基于混合专家模型改进了专家网络选择门控机制, 通过任务敏感的注意力提示机制编码与
                 聚合任务共性及任务特性, 实现了开放世界持续任务中的知识积累、迁移和更新; 针对开放识别, 我们提出了一种
                 自适应的开放边界阈值机制, 结合理论支撑的自适应阈值选择方法, 使模型能根据新学知识不断调整其开放集识
                 别策略. 并且, 本文在两个公开基准数据集上进行了充分的对比实验, 验证了所提模型在开放世界持续学习任务中
                 的显著优势和稳健性.
                    本文第   2  节分析持续学习和开放世界持续学习的相关方法和研究现状. 第                    3  节介绍本文所需的基础知识, 包
                 括基于提示学习的持续学习和涉及混合专家模型的先验知识和基础架构. 第                          4  节构建本文提出的     TP-MoE  模型.
                 第  5  节通过大量实验验证所提模型的有效性. 最后一节总结全文并提出后续研究方向.

                  2   开放世界持续学习相关研究及现状分析

                    持续学习旨在使模型能够在不需要反复重新训练所有数据的前提下, 持续增量地从数据流中学习新知识, 同
                 时避免遗忘已学到的知识. 现有持续学习方法主要可分为                   3  类  [13,14] : (1) 基于网络结构扩展的方法, (2) 基于正则约
                 束的方法, (3) 基于回放机制的方法. 具体而言, 第          1  类基于网络结构扩展类方法         [15−19] 通过拓展模型结构来适配新
                 任务并保留旧知识, 例如       PackNet [16] 利用参数掩码隔离不同任务的权重, BNS        [17] 利用强化学习构建任务专属学习
                 器. 第  2  类基于正则约束的方法      [20,21] 则通过惩罚关键参数的变化来缓解灾难性遗忘问题, 例如经典的持续学习基
                 准框架   EWC [18,22] 利用费舍尔信息矩阵约束模型重要参数的更新, LwF           [23] 通过正则约束使得模型在学习新任务时
                 保持对旧任务输出的一致性, 实现无需访问旧数据的持续学习. 第                    3  类基于回放机制的方法       [24−27] 则通过保存部分
                 旧任务样本或生成伪样本与新任务数据联合训练, 从而缓解灾难性遗忘, 例如 iCaRL                       [27] 使用的伪样本合并当前任
                 务训练的回放策略.
                    尽管上述持续学习方法在持续地学习新知识和缓解灾难性遗忘方面取得了成效, 然而, 现实世界环境充满不
   87   88   89   90   91   92   93   94   95   96   97