Page 99 - 《软件学报》2026年第4期
P. 99

1540                                                       软件学报  2026  年第  37  卷第  4  期


                 更新关于开放样本的知识, 从而做出正确的分类.
                    第二, 考虑了分布变化的开放世界持续学习场景, 记作域增量开放世界持续学习                          (domain-incremental OWCL,
                 DI-OWCL). 在此场景中, 我们在一个经典且具有挑战性的目标识别数据集                    Open-CORe50  的基础上, 构建了针对
                 开放世界持续学习的       Open-CORe25  数据集. 该数据集从原有的       50  个已知类别随机地划分出       25  个类别, 作为仅在
                 测试阶段使用的未知类别而不参与训练, 从而保证了开放世界持续学习中最基本的设定; 并且, 同一类别的新训练
                 样本会随着任务的推进按顺序出现, 并伴随分布变化                 (例如不同的拍摄条件和背景). 通过这种设定将分布的变化
                 引入为未知的特征变化, 诸如此类的分布变化会给模型带来分布外知识, 极大地挑战了现有开放世界持续学习模
                 型的能力.
                    最后, 值得一提的是, 我们也考虑了将类增量与域增量相结合的混合型开放世界持续学习场景, 例如在类别不
                 断增长的同时, 特征分布也随环境变化而演化的复杂现实场景. 然而, 为了更清晰地验证本文                            TP-MoE  模型在开放
                 世界持续学习中的核心机制有效性, 并确保与现有所复现方法具备公平的可比性, 后续实验选择聚焦于类增量                                  (CI-
                 OWCL) 和域增量    (DI-OWCL) 这两个基础但具代表性的任务设定, 方便对             TP-MoE  模型的泛化能力和模块组合策
                 略进行系统评估, 也为后续更复杂场景的研究提供基础支撑.
                    如表  1  所示, 在  CI-OWCL  场景下的  Split-CIFAR100  数据集中, 共包含  90  个已知类别和    10  个未知类别, 总
                 计  10  个任务和  55 000  个样本, 每轮训练  (即每个任务下) 包含     5 000  个样本. 验证集包括来自已知类别的         9 000  个
                 样本和来自未知类别的        1 000  个样本. 在  DI-OWCL  场景下所使用的    Open-CORe25  数据集中, 包含  25  个已知类别
                 和  25  个未知类别, 共  5  个任务, 总样本量为    59 936, 每轮训练的样本数分别如表        1  所示. 验证集包含   7 528  个来自
                 已知类别的样本和       7 466  个来自未知类别的样本.

                                                      表 1 数据集描述

                                                                        各个任务下训 验证时使用的 验证时使用的
                    Dataset  已知类别数量 开放类别数量          任务数量       训练样本
                                                                          练样本数     已知样本数量 未知样本数量
                 Split-CIFAR100  90        10         10        55 000     5 000      9 000      1 000
                                                                           14 989
                                                                           14 986
                 Open-CORe25    25         25          5        59 936     14 995     7 528      7 466
                                                                           14 966
                                                                           14 975

                    在实验实现方面, TP-MoE      方法基于    PyTorch  库实现, 所有实验均在单块      NVIDIA RTX 3090 GPU  上进行. 所
                 使用的预训练骨干网络为         ViT-B/16, 该模型采用自监督方式在       ImageNet-21K  上完成预训练, 主干网络的预训练层
                 全部冻结不参与模型优化. 在每个任务的测试阶段, 我们将尚未学习过的类别的测试样本视为开放类. 为了全面地
                 验证所提模型的效果, 本文遵循现有持续学习社区的常用设定并广泛地与基准模型进行对比. 在训练阶段, 对所有
                 数据集均采用了数据预处理操作, 包括随机缩放后裁剪为                  224×224 像素, 并进行随机水平翻转. 在验证推理阶段, 除
                 Split-CIFAR100  外的所有数据集图像均统一缩放其短边至           256  像素, 再中心裁剪为    224×224  像素; Split-CIFAR100
                 数据集的图像从其原始的         32×32  像素上采样至   224×224  像素, 以确保与预训练     ViT-B/16  骨干网络的结构兼容性.
                  5.2   评价指标及基准模型
                    我们使用    3  个关键指标对模型在所有任务上的性能进行全面评估, 分别为                  ACC t 、  AUC t  和  FPR t .
                    具体而言,    ACC t  表示在所有   个任务中已知类别上的平均最终分类准确率, 用于衡量模型在避免遗忘方面的
                                          t
                 表现;  AUC t  表示所有已学的   个任务的     ROC  曲线下的平均面积, 用以评估模型在区分已知与未知实例方面的可
                                       t
                 靠性, 即开放检测能力;      FPR t  (表示所有任务下的平均假阳性率) 用于量化开放集检测中的错误率, 表示模型将未
                 知样本误判为已知类别的频率, 即误拒率.
                    值得注意的是, 由于目前开放世界持续学习模型非常有限, 现有的大多数研究通常将实验验证分为开放检测
                 能力验证和持续学习分类能力验证, 因此, 所使用的对比模型也大多是持续学习模型与开放检测方法的组合. 因
                 此, 我们使用了    5  个大规模预训练与提示调优结合的最新持续学习方法以及                   4  个经典的分布外样本检测算法进行
   94   95   96   97   98   99   100   101   102   103   104