Page 102 - 《软件学报》2026年第4期
P. 102
李昱洁 等: 面向开放世界持续学习的任务敏感提示驱动混合专家模型 1543
列中也展现出较强的抗遗忘能力, 进一步表明 TP-MoE 架构在无显式任务标识输入的条件下仍能保持类间区分的
鲁棒性. 值得注意的是, 随着任务数量增加和类别间干扰加剧, 模型的准确率略有波动, 但整体仍保持在相对较高
水平 (最低为 87.13%), 而且 AUC t 并未出现明显下降, 甚至在任务 10 达到了 91.30% 的峰值, 体现出模型后期依然
具备稳定的分类能力和抗干扰性能.
综合来看, 该组消融实验结果验证了 TP-MoE 中残差门控机制对于稳定知识迁移和维持判别能力的积极作
用, 同时也进一步凸显任务敏感提示模块在提升专家动态选择精度与任务适应能力方面的重要价值.
表 4 展示了在保留提示融合、移除非线性残差门控机制的条件下模型的表现. 尽管该机制仍在一定程度上保
留了对任务信息的非线性交互能力, 且在任务 1 的 FPR t 降至 0.095 2, 但前两个指标上整体表现相比表 3 有所下
降. 任务间准确率呈现更明显的下滑趋势, 任务 10 的 ACC t 降至 78.84%, 且 FPR t 略微升高至 0.278 1, 显示出模型
在任务持续推进过程中对新旧知识切换的适应性变差, 容易出现类间混淆, 从而进一步说明非线性残差门控机制
在模型中起到的关键作用.
表 3 TP-MoE 在消融掉任务敏感的提示融合策略后 表 4 TP-MoE 在消融掉非线性残差门控机制后在数
在数据集 Split-CIFAR100 各个任务上的表现 据集 Split-CIFAR100 各个任务上的表现
消融模块1: 任务敏 ACC t (↑) (%) AUC t (↑) (%) FPR t (↓) 消融模块2: 非线性 ACC t (↑) (%) AUC t (↑) (%) FPR t (↓)
感的提示融合 残差门控
任务1 98.70 90.73 0.120 任务1 96.00 86.98 0.095 2
任务2 95.55 87.64 0.152 任务2 92.05 79.43 0.143 5
任务3 93.47 88.67 0.150 任务3 88.57 81.02 0.140 3
任务4 92.18 87.24 0.178 任务4 86.73 79.85 0.167 8
任务5 90.46 87.52 0.211 任务5 84.14 79.93 0.199 6
任务6 89.23 89.17 0.223 任务6 82.75 81.06 0.214 9
任务7 88.61 89.27 0.239 任务7 81.61 81.00 0.237 1
任务8 87.89 89.87 0.248 任务8 80.43 81.82 0.247 8
任务9 88.18 89.69 0.272 任务9 80.33 81.45 0.278 1
任务10 87.13 91.30 0.272 任务10 78.84 82.74 0.278 1
综合两组实验结果可得, 任务敏感的提示融合机制和非线性残差门控机制在 TP-MoE 中起到了至关重要的作
用, 其有效引导了专家模块的动态路由与任务偏好的结构适应, 从而提升了整体学习性能与迁移稳定性. 残差门控
机制对长期学习稳定性的贡献也十分显著. 这进一步验证了我们提出的 TP-MoE 架构在结构设计上的合理性, 即
通过提示驱动的专家激活与非线性交互协同作用, 实现对开放世界持续学习场景中多任务的有效泛化.
5.5 参数敏感性分析
为进一步验证 TP-MoE 模型在不同参数配置下的稳定性与适应能力, 本文在 Split-CIFAR100 与 Open-
CORe25 两个开放世界持续学习数据集上开展了系统性的超参数敏感性分析. 具体而言, 我们考察了 3 类核心超
参数对模型性能的影响: 其一是提示长度与提示个数, 通过调节提示维度和并行提示数量, 分析其对表示能力和任
务间迁移性能的影响; 其二是非线性门控机制中使用的激活函数类型, 包括 ReLU、GELU、Sigmoid 和 tanh 等,
以评估不同激活函数对专家选择稳定性与路由精度的影响; 其三是门控阈值的设定策略, 比较了静态设定与动态
自适应机制在控制专家稀疏激活过程中的表现, 尤其是在任务边界模糊或概念漂移频繁的场景下的鲁棒性. 为此,
在本节中, 我们全面评估了 TP-MoE 在关键结构参数变化下的泛化能力与性能波动, 为后续模型部署与扩展提供
了实证依据. 相关结果如图 3、表 5 和图 4 所示.
图 3 展示了不同提示长度 ( prompt length ∈ {5,10,15,20}) 与提示个数 ( prompt number ∈ {1,3,5,7}) 组合下,
TP-MoE 在两个数据集上的平均准确率表现. 从图 3(a) 的 Split-CIFAR100 数据集上使用不同的提示长度和提示个
数对 TP-MoE 的性能影响可以看出, 模型对提示个数较为敏感, 当提示个数从 1 增加至 3 或 5 时性能迅速提升, 平
均准确率由 84.67% 上升至 87.35% 和 87.50%, 随后在 7 个提示时趋于饱和. 同时, 提示长度的变化对性能略有影

