Page 13 - 《软件学报》2026年第4期
P. 13

1454                                                       软件学报  2026  年第  37  卷第  4  期



                         Sentence  The screen on thislaptopis brightandclear,butthebattery life isshort,needinga chargeafteraboutthreehours.



                           ATE  O ASP  O O  O O O   O  O  O O  ASP  O O O  O  O O  O   O  O  O

                                  Display
                           ACD  O      O O  O O O   O  O  O O Battery  O O O  O  O O  O  O  O  O
                                  quality
                          ABSC  O T-POS  O O  O O O  O  O  O O T-NEG  O O O  O  O O  O  O  O  O

                                            图 1 ABSA  各子任务示例句子及相应标签

                                                                                                 }
                                                                                               {
                    在跨领域    ABSA  任务中, 源领域带标签样本记为         D S = {X ,Y }  , 目标领域无标签样本记为     D T = X  k N T  . 其中
                                                                  k N S
                                                                k
                                                                S  S k=1                        T k=1
                 X  表示文本,  Y  表示方面级情感标签序列. 目标为在源领域带标签数据集                 D S  上训练一个  ABSA  模型  M S : X S → Y S ,
                 然后将模型迁移至目标领域         D T  得到目标模型   M T : X T → Y T , 预测目标领域中无标签样本   X T  对应的情感标签序列   Y T .
                    为提升跨领域      ABSA  任务的效果, 须关注目标模型在目标领域的性能, 本文通过目标领域分类错误率来对此
                 进行量化. 目标模型可表示为:

                                           M = argminProb(M T (X T ) , Y T |(X T ,Y T ) ∼ D T )       (1)
                                             ∗
                                             T
                                                   M T
                    在跨领域环境下训练迁移模型时, 通常只有目标领域的未标记数据, 目标领域样本的标签对于模型是不可见
                 的. 为了解决上述问题, 将目标转化为通过降低目标模型的泛化误差来优化目标模型的性能. 目标领域的泛化误差
                 可以表示为:

                                            ε T = ε base +λ 1 ·Complexity+λ 2 ·δ base (D S ,D T )     (2)
                 其中,  ε base  为目标模型在源领域上的经验误差,       Complexity 为模型复杂性度量,    δ base (D S ,D T ) 为源领域与目标领域的
                 领域适应性损失,     λ 1 , λ 2  为对应项的系数.
                    显而易见的是, 模型的复杂性对于模型的泛化误差有重要影响. 过于复杂的模型可能会导致过拟合, 即在源领
                 域训练集上表现良好但在目标领域上性能不佳. 因此, 本文讨论固定模型的情况下源领域数据选择对模型泛化误
                 差界的优化效果. 对于同一个模型,          Complexity 相同, 源领域训练数据的选择对于优化源领域经验误差                ε base  和领域
                          δ base (D S ,D T ) 至关重要. 为了探究源领域训练数据的选择对于模型在目标领域泛化误差界的影响, 本文
                 适应性损失
                 引入了样本的数据质量因素          ( Q), 目标模型泛化误差表示为:

                                      ε T = (ε base −k 1 · Q)+λ 1 ·Complexity+λ 2 ·(δ base (D S ,D T )−k 2 · Q)  (3)
                                                                                                Q
                 其中,  ε base −k 1 · Q 为考虑了源领域训练样本的数据质量要素      Q 后目标模型在源领域上的经验误差, 记作            ε ; δ base (D S ,
                                                                                                S
                 D T )−k 2 · Q 为考虑了源领域训练样本的数据质量要素         Q 后源领域训练数据与目标领域数据间的领域适应性误差,
                      Q  −
                 记作  δ (D ,D T ); k 1 , k 2  分别为数据质量  Q 对经验误差和领域适应性误差的影响系数.
                        S
                    因此, 模型结构固定的情况下, 为了降低目标模型的泛化误差并提升模型迁移效果, 训练目标转变为寻找能够
                               Q               Q
                                                                              ∗
                                                  −
                 使模型经验误差      ε  及领域适应性误差      δ (D ,D T ) 最小化的源领域训练数据集      D :
                               S                  S                           S

                                               (                     (    ) )
                                       ∗         Q                 Q  −       −                       (4)
                                      D = argmin ε +λ 1 ·Complexity+λ 2 ·δ D ,D T , D ⊆ D S
                                       S         S                    S       S
                                             D −
                                              S
                  3   基于高质量样本选择的跨领域方面级情感分析方法
                    为了高效筛选源领域训练数据, 提出了一种基于高质量样本选择的跨领域                         ABSA  方法  (HQSS-CDABSA). 方
                 法基本框架如图      2  所示. HQSS-CDABSA  方法包括   3  个部分: 一是领域间选择, 即在多个领域中选择特定领域作
                 为迁移训练的源领域; 二是领域内选择, 即在源领域内选择其子集作为迁移训练的源领域样本; 三是模型训练, 即
                 在被选择源领域样本集合上训练下游任务迁移模型.
   8   9   10   11   12   13   14   15   16   17   18