Page 14 - 《软件学报》2026年第4期
P. 14

赵传君 等: 基于高质量样本选择的跨领域方面级情感分析                                                     1455



                                                    ···
                        领                     目标领域集合
                        域                                   跨领域模式共现相似度
                        间            ···       领域相似性
                        选
                        择            ···                        赋权加和           域间高质量样本选择指标
                                   ···
                                     ···                     域间联合适应性分数
                                             多源领域协同性
                              多源领域集合


                        领                                     领域通用性分数
                        域            ···       样本领域通用性
                        内          ···                          赋权加和           域内高质量样本选择指标
                        选            ···
                        择                                     方面级距离度量
                             被选择源领域组合          样本方面级距离


                                                      机器学习     深度学习     生成对抗          预训练微调
                        模           ···               迁移模型     迁移模型     迁移模型     ···   迁移模型
                        型           ···    迁移模
                        训                  型训练
                        练           ···             下游任务      跨领域方面     跨领域方面    ···  跨领域方面
                                                               术语提取     类别检测          级情感分类
                            被选择源领域样本集合
                                       图 2 基于高质量样本选择的跨领域            ABSA  方法框架图

                  3.1   领域间选择
                    为了从多个领域中选择出最合适进行迁移模型训练的一个或多个源领域, 综合考虑了源领域与目标领域间的

                 相似性和多源领域之间的协同效应, 提出了一种领域选择指标——域间高质量样本选择指标                               Q inter . 对于包含  k 个
                                 2
                              1
                                      k
                 源领域的集合     {D ,D ,...,D }, Q inter  定义为:
                              S  S    S
                                                                      k
                                               α  k ∑ (    )  2·β  k ∑ ∑ (     )
                                                                           i
                                                       i
                                          Q inter =  ·  A D ,D T +  ·   C D ,D  j                     (5)
                                                              2
                                               k       S     k −k          S  S
                                                  i=1              i=1 j=i+1
                                                                               (    )
                            )
                       (
                                                                                 i
                         i
                 其中,   A D ,D T   代表第  i 个源领域与目标领域之间的跨领域模式共现相似度;             C D ,D  j   代表第  i 个源领域与第   j
                         S                                                       S  S
                 个源领域之间的联合适应性分数;           α 和  β 分别代表两部分的权重系数. 具体计算流程如图             3  所示.
                    (1) 跨领域模式共现相似度
                                                                                                  D S  及目
                    为了衡量源领域与目标领域之间的关系, 提出了一种跨领域模式共现相似度. 具体来说, 对于源领域
                                                    {  }         {  }
                                              Text S = X k N S  Text T = X  k N T  X  代表句子样本.
                 标领域   D T  的句子样本集合, 分别记为                 和           , 其中
                                                     S k=1        T k=1
                    对每个领域的句子样本集合进行以下操作.
                    • 特征提取: 将每条句子文本进行分词操作得到词汇列表, 并对词汇进行停用词去除预处理操作. 通过                               BERT
                 预训练模型将词汇转化为高维向量表示, 以捕捉词汇间的语义关系.
                    • 共现图构建: 对源领域和目标领域分别构建其词共现矩阵                  U S  和   U T , 矩阵的元素   u i j  表示词汇  v i  和  v j  在句子
                                                                                    G T = (V T ,E T ), 图中每个节
                 中的共现次数. 分别将两个领域的共现矩阵             U S  和  U T  转换为领域共现图  G S = (V S ,E S ) 和
                 点代表一个词汇, 边代表两词汇存在共现情况, 边的权重代表共现强度.
                    • 图神经网络构建: 以目标领域为例, 将领域共现图              G T = (V T ,E T )、共现矩阵  U T 、词特征矩阵  E ∈ R |V T |×d  作为
                                                                                           (l)
                 图神经网络的输入. 网络包含多个图卷积层和一个池化层, 设第                     l  个图卷积层的节点表示为       H , 则节点更新公
                 式为:
   9   10   11   12   13   14   15   16   17   18   19