Page 27 - 《软件学报》2026年第4期
P. 27

1468                                                       软件学报  2026  年第  37  卷第  4  期



                         1.0                    RNN-all          1.0
                                                RNN-select
                                                Bi-LSTM-all
                         0.8                                     0.8
                                                Bi-LSTM-select
                                                Att-LSTM-all
                        泛化误差  0.6               Att-LSTM-select  泛化误差  0.6
                                                                 0.4
                         0.4
                         0.2                                     0.2  GAN-all
                                                                      GAN-select
                                                                      BERT-all
                          0                                       0   BERT-select
                             1  2  3  4  5  6  7  8  9  10  11  12  13  14  15  16  17  18  19  20  1  2  3  4  5  6  7  8  9  10  11  12  13  14  15  16  17  18  19  20
                                         Epoch                                   Epoch
                                  (a) 循环神经网络的3种模型                        (b) 生成对抗网络及预训练模型
                            图 7 跨领域    ABSC  任务上各模型经     HQSS-CDABSA  方法处理前后的泛化误差曲线

                    图  7  中的实验结果表明, HQSS-CDABSA      方法通过筛选源领域中的高质量样本显著降低了不同模型在跨领
                 域  ABSC  任务中的泛化误差, 从而提升了模型的性能. 具体来说, 图              7(a) 表明  RNN、Bi-LSTM、Att-LSTM  这  3  种
                 循环神经网络类模型在经过样本筛选后模型的泛化误差均有所下降, 且                        3  种模型的性能依次递增. 这种下降趋势
                 表明, HQSS-CDABSA   方法能够有效筛选出高质量样本, 减少噪声数据对模型训练的干扰, 从而提升模型的泛化
                 能力. 此外, 3  种循环神经网络模型中        Att-LSTM  的泛化误差最低, 表明其注意力机制能够更好地捕捉跨领域任务
                 中的关键信息, 筛选出的高质量样本的利用效率最高.
                    图  7(b) 表明  GAN  模型在经过样本筛选后泛化误差有所下降, 但下降幅度不大且总体水平仍然较高. 这源于
                 ABSC  任务的标签复杂性较高, 导致        GAN  模型在生成伪目标领域数据时数据标注可靠性不足, 影响模型的性能.
                 尽管如此, HQSS-CDABSA    方法仍然在一定程度上改善了 GAN            的泛化能力. 而    BERT  模型尽管其泛化误差本身
                 在  5  种模型中已处于最低水平, 但在经过样本筛选后其泛化误差同样得到降低. 这表明, 即使对于预训练语言模型
                 如  BERT, HQSS-CDABSA  方法仍然能够通过筛选高质量样本进一步提升其性能. BERT                  的优异表现得益于其强
                 大的语义表示能力, 而      HQSS-CDABSA  方法则进一步优化了训练数据的质量, 从而降低了模型的泛化误差.
                  5   总 结

                    跨领域   ABSA  任务作为自然语言处理领域的重要研究方向之一, 本文主要考虑其                      3  种子任务: 跨领域    ATE、
                 跨领域   ACD  及跨领域   ABSC  任务. 针对  ABSA  领域中标注样本匮乏及跨领域实例迁移问题, 提出了一种基于高
                 质量样本选择的跨领域        ABSA  方法. 方法兼顾源领域与目标领域间相似性及多源领域间协同性, 设计了领域间和
                 领域内两个层面的高质量样本选择指标, 依次对多源领域数据进行领域层面和样本层面的评估和筛选. 经过在
                 ABSA  数据集上的大量迁移任务实验证明, 所提方法在大部分的迁移任务以及平均性能上显著优于目前的先进方
                 法. 通过所提方法, 实现了源领域样本数量与源领域样本质量上的平衡, 提升了各迁移任务的效果. 本文提出的高
                 质量样本选择策略包含对数据噪声和跨领域分布偏移的处理, 符合高可信机器学习对模型稳定性, 可解释性及动
                 态适应能力的要求, 为解决开放环境下领域迁移问题提供了理论支撑与方法创新.
                    本文提出的基于高质量样本选择的跨领域               ABSA  方法在提升模型迁移性能方面取得了显著成效, 但仍有进一
                 步优化空间, 尤其是在多源领域协同效应和样本选择机制的进一步强化上. 未来研究可探索更加精细的跨领域相似
                 度度量方法, 以实现更高效的数据筛选和特征融合. 在多模态情感分类工作中, 在样本选择与模型训练阶段引入模态
                 一致性检测机制, 对文本、图像、语音等模态的情感输出进行一致性度量, 并结合冲突敏感融合策略, 在检测到跨模
                 态情感冲突时动态调整模态权重或选择性融合, 以降低冲突样本对模型判别性能的干扰. 随着大规模预训练模型的
                 不断进步, 结合高质量样本选择的迁移学习策略有望在多个应用领域中展现更强的适应能力和更优的性能表现.

                 References
                  [1]   Zhang WX, Li X, Deng Y, Bing LD, Lam W. A survey on aspect-based sentiment analysis: Tasks, methods, and challenges. IEEE Trans.
                     on Knowledge and Data Engineering, 2023, 35(11): 11019–11038. [doi: 10.1109/TKDE.2022.3230975]
                  [2]   Zhao CJ, Wu ML, Yang XY, Zhang WY, Zhang SX, Wang SG, Li DY. A systematic review of cross-lingual sentiment analysis: Tasks,
   22   23   24   25   26   27   28   29   30   31   32