Page 19 - 《软件学报》2026年第4期
P. 19

1460                                                       软件学报  2026  年第  37  卷第  4  期


                    (2) Bi-LSTM [46] : LSTM  的扩展模型, 通过双向结构同时捕捉前后文信息, 有效解决长序列依赖问题, 广泛应用
                 于文本分类和序列标注任务. 实验中            Bi-LSTM  的隐藏层维度为     128, 层数为  1, 采用  CrossEntropyLoss 计算模型
                 损失.
                    (3) Att-LSTM [47] : 在  LSTM  模型基础上加入注意力机制, 动态分配权重以聚焦关键信息, 提升模型对重要特征
                 的捕捉能力, 适用于复杂序列建模. 该模型中             LSTM  部分的参数与    Bi-LSTM  模型保持一致, 注意力机制采用加性
                 注意力, 其隐藏层维度为       64.
                    (4) GAN  [48] : 由生成器和判别器组成, 通过生成对抗训练生成目标领域的伪情感数据, 缓解领域间数据分布差
                 异, 提升模型在目标领域的泛化能力. 本实验中, 生成器和判别器均采用                     RNN  结构, 隐藏层维度设置为       128. GAN
                 训练中采用    BCEWithLogitsLoss 计算损失, 用于判别器对数据真伪的判断和生成器对判别器的欺骗训练. 情感分
                 类器采用   CrossEntropyLoss 进行损失计算.
                    (5) BERT [49] : 基于  Transformer 的预训练语言模型, 通过双向上下文理解文本语义. BERT         通过大规模预训练
                 捕捉通用语言特征, 能够有效缓解领域差异问题, 显著提升数据稀缺的目标领域中的分类性能. 实验采用                                 BERT-
                 base-uncased  作为预训练模型, 将输出向量维度设置为         128, 用于对  BERT  输出特征进行降维.
                    为了验证所提方法相比其他迁移学习方法在性能上的优越性, 使用以下模型作为对比模型.
                    (1) FMIM [50] : 一种采用互信息最大化技术的基于特征的领域自适应方法.
                    (2) CDRG  [51] : 一种跨领域数据增强方法, 通过利用带标注的源领域样本, 基于掩码语言模型来生成带标注的
                 目标领域样本.
                    (3) GCDDA [52] : 一种生成式跨领域数据增强框架, 利用预先训练的            BART  模型来生成具有方面级注释的目标
                 领域数据.
                          2
                    (4) DA LM [34] : 一种基于领域自适应语言模型的跨领域数据增强方法, 通过领域自适应语言模型为未标记的
                 目标领域数据分配伪标签.
                  4.3   预实验
                    为了确定    HQSS-CDABSA  方法最佳的样本选择比例, 针对跨领域             ABSC  任务在  Att-LSTM  及  BERT  模型上
                 进行了预实验, 预实验的实验结果如表            3  所示, 其中粗体数据为不同任务最高的数值.

                            表 3 不同模型在不同样本选择比例下处理跨领域                 ABSC  任务的  F1  值比较结果  (%)

                    模型      Data  D→R    D→S   L→R    L→S   R→D    R→L   R→S    S→D   S→L    S→R    Avg
                            All   42.49  16.30  38.46  11.97  42.59  40.07  19.18  47.98  39.01  32.66  33.07
                            90%   42.86  16.99  39.21  12.44  42.77  40.51  19.73  48.36  39.72  32.94  33.55
                  Att-LSTM  70%   44.43  21.95  41.75  15.41  44.65  43.32  21.12  53.51  41.78  34.66  36.26
                            50%   38.27  12.03  33.24  7.35  37.31  36.22  14.03  40.09  33.28  26.49  27.83
                            30%   21.11  4.65  18.67  4.02  22.49  18.87  10.14  23.88  19.96  14.28  15.81
                            All   60.53  40.96  61.36  36.53  67.71  61.97  38.62  64.40  55.62  61.83  54.95
                            90%   60.82  42.86  61.44  36.54  67.99  62.29  39.47  66.21  56.88  61.97  55.65
                    BERT    70%   62.69  48.49  63.12  36.99  69.70  64.37  42.05  75.53  58.10  62.64  58.37
                            50%   39.27  28.44  39.96  24.33  41.74  37.26  25.11  40.05  36.38  38.97  35.15
                            30%   28.95  24.37  31.22  20.08  25.16  25.48  20.19  30.58  24.46  24.87  25.54

                    表  3  中的实验结果表明, HQSS-CDABSA       方法在不同样本选择比例下对模型性能的影响存在显著差异.
                 Att-LSTM  和  BERT  模型均在  70%  的样本选择比例下取得最佳性能, 平均         F1  值分别为  36.26%  和  58.37%, 显著高
                 于其他比例下的性能. 这源于在          70%  的样本选择比例下, HQSS-CDABSA      方法能够有效筛选出高质量样本, 同时
                 保留足够的训练数据量, 避免了因数据量过少导致的模型欠拟合问题. 高质量样本的筛选减少了噪声数据对模型
                 训练的干扰, 从而提升了模型的泛化能力和性能. 在全样本训练和                    90%  的样本选择比例下, 模型性能虽然较高, 但
                 未达到最佳. 这源于训练数据中的噪声数据过多, 尽管数据量充足, 但噪声数据的存在限制了模型的性能提升. 而
   14   15   16   17   18   19   20   21   22   23   24