Page 94 - 《软件学报》2026年第4期
P. 94

李昱洁 等: 面向开放世界持续学习的任务敏感提示驱动混合专家模型                                                1535


                 其中,  ∇L old  表示与历史任务保持相关的梯度项, 例如由记忆回放、正则项或结构冻结产生的梯度; 而                         ∇L new  对应
                 于当前任务学习的损失梯度. 由于这两个梯度项往往存在方向冲突, 容易导致灾难性遗忘, 用于衡量其冲突程度的
                 指标通常被如下定义:

                                                             ∇L old ·∇L new
                                                  cos(θ conflict ) =                                  (2)
                                                            |∇L old |·|∇L new |
                    当  cos(θ conflict ) < 0 时, 表明两类梯度方向相悖, 模型更新可能会导致旧知识遗忘.
                    分析发现, 现有基于正则约束的持续学习方法通常使用费舍尔信息矩阵对历史参数进行重要程度加权, 进而
                 显式地构造稳定性约束; 然而, 开放世界持续学习由于未知样本存在造成任务边界难以构建, 需要通过任务敏感选
                 择实现对隐式历史知识的非显式保留. 此外, 相比于使用显式投影的持续学习方法, 开放世界持续学习要求能够自
                 适应地选择适合当前任务的参数子网络, 将历史任务与新任务的梯度分别投射到参数空间的不同子空间中, 实现
                 参数隔离, 降低梯度冲突, 从而在无需显式正交投影的前提下达到知识的平衡稳定性与可塑性.
                  3.2   基于提示的持续学习方法
                    除第  2  节介绍的传统的     3  类持续学习方法, L2P   [28] 提出了基于提示   (prompt-based) 的持续学习方法, 此类方法
                 作为无回放    (rehearsal-free) 持续学习的有效  p ∈ R  L p ×d  策略, 受到了越来越多研究的关注. 此类方法通常利用一个预
                                f θ  进行特征提取, 其中主干网络的模型参数   通常保持冻结状态, 即不参与训练更新. 为提升模
                                                                 θ
                 训练模型主干网络
                 型在新任务上的适应能力, 基于提示的持续学习方法引入提示                     (prompt), 通过训练得到一组小规模、可学习的参
                 数用以调控多头自注意力         (multi-head self-attention, MSA) 模块中的计算更新过程  [29,30] . 不同的模型使用不同的策
                 略将提示融合至多头自注意力的查询矩阵               (query)、键矩阵  (key) 和值矩阵  (value) 中, 从而帮助持续学习模型有效
                 地学习新任务, 不仅不会遗忘学习过的任务, 甚至能够使用过去学习到的知识帮助模型更好地处理新任务.
                    现有的基于提示的持续学习方法, 通常通过为每个新任务学习新的                       (一批) 提示增强样本嵌入, 以缓解灾难性
                 遗忘  (catastrophic forgetting) 问题. 在测试推理阶段, 模型需从已有的提示集合中选择合适的单个或多个提示组合,
                                                 [28]
                 以应对来自各任务的测试样本. 例如, L2P            提出了共享提示池       (prompt pool) 的机制, 即每次训练新的任务后都更
                 新提示池; 在测试时, 使用最新训练得到的提示池, 通过键-值对匹配                  (key-query matching) 机制进行提示检索, 为样
                 本的特征嵌入进行知识增强. DualPrompt       [31] 进一步细分提示池, 引入了任务无关        (G-prompt) 与任务特定  (E-prompt)
                 两类提示, 以分别捕获通用性与特异性信息. S-prompt           [32] 则专注于学习任务特定提示, 采用了与         L2P  类似的提示选
                 择和样本增强策略. CODA-P      [33] 则选择扩展提示池, 并通过引入注意力权重矩阵对提示池中的不同提示进行加权
                 融合, 以提升提示选择的灵活性, 增强样本嵌入信息. 最近的                 HiDe-prompt [34] 进一步提出了持续学习目标的分层分
                 解方法, 通过独立优化每一子目标, 显著提升了整体性能, 达到了当前最优性能水平.
                    具体来说, 在使用提示对样本嵌入进行知识增强时, 提示参数通常被记作                       p, 其中  R 表示嵌入空间,    L p  表示提
                                                           K
                                                              V
                 示序列长度,    d  表示嵌入维度. 提示被划分为两个部分          p , p ∈ R L p/2 ×d , 分别融合合并至样本嵌入的键值向量上.

                                                                (         )
                                                                          p

                                               (         )          p K    V
                                                     K
                                                  Q
                                           f prompt p,X ,X ,X  V  Q                               (3)
                                                                    X  K  ,   V
                                                          ∼= MSA X ,
                                                                          X
                 其中,  X 、X 和X V  分别为输入经过投影后的查询、键和值向量, | |表示向量拼接操作,                  MSA 表示多头自注意力层
                       Q
                           K
                 操作, 其机制具体细节将在第         3.3  节中介绍. 拼接后的提示向量以嵌入增强前缀形式参与注意力计算, 从而引导模
                 型进行任务特定的上下文建模.
                  3.3   注意力机制与混合专家模型
                    Transformer 架构在传统的多序列建模任务中取得了卓越的性能, 其核心能力源于注意力机制                             (attention
                 mechanism) [29,30] , 该机制允许模型在处理输入序列时动态捕捉全局依赖关系. 在近年来的模型扩展中, 专家混合结
                 构  (mixture of experts, MoE) [35–37] 被广泛用于进一步提升模型容量, 其底层数学形式与注意力机制存在结构类似性,
                 为网络模型拓展至开放世界持续学习提供了可能.
                    目前, 最常见且被广泛应用的注意力形式为缩放点积注意力                    (scaled dot-product attention) [38] .
   89   90   91   92   93   94   95   96   97   98   99