Page 96 - 《软件学报》2026年第4期
P. 96
李昱洁 等: 面向开放世界持续学习的任务敏感提示驱动混合专家模型 1537
Softmax 权重将多个分
可以发现, 该专家混合门控机制与注意力机制具有高度结构一致性, 二者本质上都通过
支 (键值对或专家) 输出进行加权聚合. 因此, MoE 层可被视为注意力机制在模型容量层面的推广形式. 随着研究
的深入, MoE 层逐渐被确立为扩展模型规模、提升参数利用率的基础模块.
因此, 在本研究中, 我们不仅受到现有的使用提示的持续学习研究的启发, 还通过探索自注意力机制和 MoE
结构的相似性, 在遵循了 MoE 结构提出的基础上, 将任务敏感注意力权重引入提示选择和融合策略, 设计了一个
自适应确定开放阈值的判别策略; 然后, 一并引入至一个统一的预训练 MoE 结构中, 最终提出了一个具备开放类
别检测能力和在动态复杂环境下进行持续学习的开放世界持续学习模型, 即 TP-MoE.
4 面向开放世界持续学习的 TP-MoE 模型
在本节中, 我们对所提出的 TP-MoE 模型进行详细的构建. 该模型以 ViT [39] 为主干网络, 引入任务敏感的提示
融合机制、非线性残差连接的稀疏激活混合专家门控模块, 直接作用于原主干网络注意力层, 来调节提示池中的
不同提示对应不同专家网络的权重, 帮助模型优化分类头. 根据分类头的输出, 模型使用了一种基于 logits 分数的
任务敏感开放决策边界构建方法, 使用当前任务下所有类别的最大 logits 分数作为阈值, 帮助模型能够在测试推
理阶段准确地检测出未知样本.
4.1 任务敏感的提示融合策略
受现有基于提示的持续学习研究的启发, 我们首先通过更有效地融合任务特定的知识来改进单个任务下的分
类效果. 为此, 给定任务 t 我们构建一个任务敏感的提示池 (task-aware prompt pool), 以整合来自不同任务的知识,
并通过交叉熵损失进行训练优化该提示池. 同时, 旧任务学习到的提示都会被储存并冻结, 用以进行知识积累, 缓
解灾难性遗忘问题. 不同于现有的使用提示方法的持续学习模型, 针对任务敏感的提示池, 设计了一种融合旧知识
的提示融合策略, 能够有效地融合任务敏感知识.
为了学习当前任务 t 下的提示 , 我们在初始化时使用 t −1 任务学习到的提示 p t ← p t−1 , 并进一步结合所有
p t
旧任务 1,...,t −1 学习到的提示的加权组合进行迭代优化:
∑
t−1
p t = α p i +(1−α) p t (8)
i=1
其中, α 为用于控制旧任务知识在新任务学习提示时的回放程度的超参数. 然而, 尽管该策略有助于新任务性能,
可能导致与旧任务表示的重叠, 从而影响单个任务下的分类效果表现. 为解决此问题, 我们受到经典正则约束的持
1,...,t −1 表示的特征分布信息作为约束信息, 通过计算类别质心, 进一步设计正
续学习方法的启发, 引入旧任务
则约束项 L regu (p t ):
1 exp(h·µ c /τ)
∑ ∑
t−1 ∑
L regu (p t ) = (9)
∑ log ∑ ∑ ∑
t−1 t−1
′
h∈H t |Y i | i=1 c∈Y i exp(h·h /τ)+ exp(h·µ c /τ)
i=1 h ′ ∈H t 1 c∈Y i
其中, H t 是将当前任务的训练数据集 D 经过通用冻结投影层映射后的嵌入集合, τ 为温度系数超参数, 通常设为
t
tr
0.4–0.8, µ c 表示的是类别质心, 通过均值计算得到.
由此, 单个任务下分类的总损失函数可由分类损失 (用于优化分类头参数) 和正则约束项计算得到:
( ) ( )
, p t +λ·L regu (p t ) (10)
L 1 f θ t , p t = L CE f θ t
其中, λ 为超参数, 用于平衡多个损失超参数.
在开放世界持续学习中, 模型在推理阶段是无法知道任务标识的, 因此, 在保证了单个任务下的分类效果后,
模型需要进一步提升对任务标识识别的能力, 同时帮助开放世界持续学习模型更好地构建已知类别和未知类别的
决策边界.
因此, 接下来为了识别任务标识, 我们构造任务敏感的辅助分类头 f δ t , 用于识别已知样本所属的任务标识, 从
而保证在训练过程中持续适配新任务而不遗忘旧任务.

