Page 23 - 《软件学报》2026年第4期
P. 23

1464                                                       软件学报  2026  年第  37  卷第  4  期


                 无法为迁移到     S  领域提供足够的多样性支持, 因此其          Q inter  值最低, 仅  9.81. 综上所述, 在以上源领域组合中, D+R
                 源领域组合最适合向       S  领域进行迁移任务的训练.


                           表 9 不同模型在不同源领域组合下向             S  领域迁移的  ABSC  任务的  F1  值比较结果   (%)

                     模型        Data     D       L       R       D+R     D+L      L+R     D+L+R     Avg
                               All     3.67    1.59     2.41    4.98    4.03     4.41     4.32     3.63
                     RNN
                               70%     4.69    3.41     3.08    6.37    4.94     6.07     5.33     4.84
                               All     5.45    3.93     2.38    6.71    5.55     6.14     5.87     5.15
                   Bi-LSTM
                               70%     5.96    5.20     4.18    8.16    6.18     7.84     6.34     6.27
                               All     8.43    7.19    13.84    18.72   10.41   15.31    14.26    12.59
                   Att-LSTM
                               70%    12.68    10.55   17.39    23.64   15.77   19.46    17.88    16.77
                               All     4.94    3.15     2.89    6.58    5.22     6.03     5.47     4.90
                     GAN
                               70%     5.70    4.94     4.44    8.04    6.19     7.63     6.81     6.25
                               All    34.00    31.76   33.63    39.37   35.76   37.14    36.03    35.38
                     BERT
                               70%    35.69    32.47   35.40    41.38   36.57   38.35    37.21    36.72
                               All     9.50    7.97     9.36    13.62   10.45   12.23    11.37    10.64
                     Avg
                               70%    13.06    11.4    13.03    17.66   14.06   16.00    15.02    14.32

                    表  9  的实验结果表明, 多源领域组合在跨领域迁移任务中能够有效提升模型性能. 以全样本训练为例, 5                            种模
                 型在单一源领域      D、L、R   上的平均   F1  值分别为   9.50%、7.97%、9.36%, 而在多源领域组合      D+R、D+L、L+R、
                 D+L+R  上的平均   F1  值分别为  13.62%、10.45%、12.23%、11.37%, 多源领域组合场景平均比单一源领域场景的
                 性能高出   2.98%. 这表明多源领域组合能够通过领域间的互补性提供更丰富的语义信息, 从而提升迁移效果. 同时
                 表中展示了在不同的数据选择策略下             5  种模型在所有源领域组合上的平均性能, 使用              HQSS-CDABSA  方法筛选
                 的  70%  数据进行训练的平均     F1  值为  14.32%, 高出使用全样本训练策略       3.68%. 这表明  HQSS-CDABSA  方法的领
                 域内高质量样本选择方法在单源领域场景和多源领域场景均能有效适用.
                    通过对表    9  中的实验结果进一步分析, D+R        组合在全样本训练策略下的平均            F1  值为  13.62%, 分别比  D+L、
                 L+R、D+L+R  组合高出    3.17%、1.39%、2.25%, 这表明  D+R  源领域组合在迁移到       S  领域时相比其他源领域组合
                 的泛化性能更优. 在通过        HQSS-CDABSA  方法筛选    70%  样本训练的策略下, D+R     组合的平均     F1  值进一步提升
                 至  17.66%, 分别比  D+L、L+R、D+L+R  组合高出    3.60%、1.66%、2.64%. D+R  组合与其他源领域组合的性能差
                 距进一步拉开, 这进一步表明了          D+R  源领域组合的优越性以及        HQSS-CDABSA  方法的有效性. D+R     组合在使用
                 HQSS-CDABSA  方法后平均    F1  值提升了   4.04%, 而  D+L  组合的平均  F1  值提升幅度较小, 仅   3.61%, 表明  L  领域
                 主题单一的局限性限制了         HQSS-CDABSA   方法的作用. L+R    组合的平均    F1  值提升了  3.77%, 虽高于  D+L  组合,
                 但仍低于   D+R  组合, 表明  R  领域的多样性虽能弥补部分不足, 但无法完全抵消               L  领域的局限性. D+L+R   组合的平
                 均  F1  值提升了  3.65%, 低于  D+R  组合, 表明增加  L  领域并未显著提升迁移效果. 综上所述, 多源领域组合能够通
                 过领域间的互补性提升迁移效果, 而           D+R  的源领域组合由于多样化的主题具备更强的泛化性, 更适合向                   S  领域进
                 行迁移模型的训练.
                  4.7   消融实验
                    为了研究框架中每个成分的影响, 本文对完整的                 HQSS-CDABSA   方法与其变体之间进行了比较. 所提出
                 HQSS-CDABSA  方法的变体如下.
                    • w/o C: 在  HQSS-CDABSA  方法的领域间高质量样本选择阶段将联合适应性分数的系数                   β 设置为  0, 在源领
                 域组合的筛选中移除了多源领域之间协同效应的影响.
                    • w/o Gen: 在  HQSS-CDABSA  方法的领域内高质量样本选择阶段将          µ 设置为   0, 在源领域内样本的筛选过程
                 中移除样本领域通用性的影响.
                    • w/o Dis: 在  HQSS-CDABSA  方法的领域内高质量样本选择阶段将          η 设置为   0, 在源领域内样本的筛选过程
                 中移除样本与目标领域相似性的影响.
   18   19   20   21   22   23   24   25   26   27   28