Page 97 - 《软件学报》2026年第4期
P. 97
1538 软件学报 2026 年第 37 卷第 4 期
( )
1 ∑ (h )[i]
′
t−1 ∑ ∑
( ) exp f δ t
L 2 f δ t = ∑ −log ∑ (11)
t−1 t ( )
′
|Y i | i=1 c∈Y i h ′ ∈H ′ exp f δ t (h )[i]
i=1 i,c j=1
其中, i 表示任务标识, 给定当前任务为 t, 那么 i = [1,t] h 是通过 f δ t 表示得到的样本的特征嵌入. 为了预测当前样
;
′
′ i 的类别
本的特征嵌入表示 h 所属任务 i 的对数似然损失, 我们通过交叉熵函数优化任务敏感分类头 f δ t , 每个任务
数量将用于进行总损失归一化, 避免不同任务或类别数量影响梯度.
因此, 任务敏感的提示融合策略涉及 (1) 任务敏感的提示学习损失函数 L 1 以及 (2) 任务敏感的任务标识识别
损失函数 L 2 . 该模块的最终优化目标即优化 L 1 +L 2 .
4.2 非线性残差门控机制
本文将 MoE 结构拓展到开放世界持续学习的问题中, 并结合使用任务敏感提示增强后的样本嵌入, 进一步改
进传统的线性门控函数的连接机制, 用于更有效地进行专家网络选择 (expert routing), 提升模型在面对不同任务的
开放样本和已知样本的预测能力.
正如第 3 节中所提及的, MoE 结构引入了门控函数在给定输入的条件下对多个子网络输出进行加权聚合. 被
选中的专家对输入进行独立变换, 其输出经过门控权重加权后求和, 作为该层的最终输出. 该结构允许模型在保持
计算成本不变的情况下显著提升参数规模与表达能力.
具体地, 给定任务 t, 通过优化 L 1 +L 2 得到了任务敏感的提示之后, 通过 MoE 中的注意力模块将提示与样本
嵌入进行融合, 对样本进行知识增强. 在计算专家选择得分函数时, 我们引入了简单有效的非线性残差用以提升传
统的门控函数.
Q
Q
t⊤
x ·W ·W K⊤ · p t ( x ·W ·W K⊤ · p t )
t⊤
expert score = i l √ l +α·σ β· i l √ l (12)
i,m
d v d v
t
其中, x 表示任务 中的第 个样本; W Q l 和 W l K 分别表示注意力层中的第 l 个注意力头对应的查询矩阵和键矩阵,
i
t
i
√
d v 为缩放参数, α 和 β 均为可学习的标量参数. 并且, 我们对激活函数 σ 的选用也尝试了多种不同的激活函数进
行评估, 相应的消融对比结果已展示在第 5 节中.
在训练过程中, MoE 模块的优化目标与主任务分类模块联合进行. 在每一次前向传播中, 模型首先根据公式
(12) 中定义的任务敏感非线性门控函数 expert score 为每个输入分配对应的提示向量及其在注意力空间中的权
i,m
重, 并通过 Top-k 稀疏激活策略来激活前 k 个专家网络. 在训练中, 为确保所有专家在训练过程中被充分利用, 我
们在训练阶段还引入了辅助负载均衡损失 (auxiliary load balancing loss) [35] , 记作 L 3 . 该损失鼓励门控网络在不同
样本间公平分配专家资源, 从而避免部分专家长期未被激活而退化. 辅助负载均衡损失函数可表示为:
(
1 ∑ N 1 ∑ N ) 2
f j − (13)
L 3 = λ load f k
N j=1 N k=1
其中, f j 表示第 j 个专家在当前 batch 中被激活的相对频率, N 为专家总数, λ load 为负载均衡损失的权重超参数.
因此, L 3 本质上是对所有专家激活频率的方差进行最小化, 目标是促使所有专家在训练中被均匀调用, 缓解
稀疏激活机制可能带来的模式坍塌问题.
需要强调的是, 为保证稀疏门控机制的可训练性, 只有被选中的 Top-k 专家网络及其对应的门控路径参与反
向传播, 其余未激活部分在该训练步骤中保持冻结状态. 这种局部反向传播策略确保了在保持高表达容量的同时
显著降低梯度计算成本, 使 TP-MoE 能够在大规模开放世界持续学习任务中实现高效优化与动态泛化能力的统一.
同时, 本文所提出 TP-MoE 模型使用预训练 ViT 作为主干网络, 在此基础上, 我们提出的任务敏感的门控函数
通过直接作用于注意力层来调节提示池中的不同提示对应不同专家网络的权重, 从而帮助模型更好地区分不同任
务中不同提示的语义特征, 从模型架构的角度进一步提升提示融合的效果并显著提升样本使用效率. 通过引入非
线性残差连接改进专家门控机制, 有效提升了模型在持续学习分类任务上的表现, 为模型自适应地确定开放检测
阈值提供了保障, 进而增强了整体的开放世界持续学习能力.

