Page 12 - 《软件学报》2026年第4期
P. 12
赵传君 等: 基于高质量样本选择的跨领域方面级情感分析 1453
领域样本, 使用主动学习技术对源领域样本进行标注并迁移至目标领域. Wu 等人 [29] 提出了一种知识保存与分布
对齐模型, 通过联合最小化信息损失和最大化领域分布对齐来实现异构领域适应. 另一种思路是通过聚类算法, 将
不同领域数据样本根据特征向量相似性进行聚类后进行样本选择. 平瑞等人 [30] 通过对多数类样本聚类, 并采用弱
平衡准则对集群进行降采样, 将选择的多数类样本与原训练集的少数类样本融合, 使少数类样本得到充分学习.
Li 等人 [31] 提出了一种跨领域自适应聚类方法来解决有标签和无标签目标样本间及无标签目标样本与源领域间的
不一致问题, 实现领域间和领域内适应.
基于样本生成的跨领域实例迁移方法旨在学习源领域和目标领域样本特征并构建统一特征空间, 从而生成尽
可能与目标领域相似的伪目标领域样本. 此类方法通常利用源领域样本训练生成模型以生成伪目标领域新样本来
训练目标领域模型, 从而利用生成的新样本实现跨领域知识迁移, 提升目标领域模型性能. Saito 等人 [32] 提出了一
种非对称的三训练方法来给未标记的样本提供伪标签, 进行无监督领域迁移. Rotman 等人 [33] 提出了一种深度上下
文自训练算法, 利用在序列标记任务上训练的表示模型, 将其应用于未标记数据来获取伪标签. Yu 等人 [34] 提出了
一种基于领域自适应语言模型的跨领域数据增强方法 (cross-domain data augmentation approach based on domain-
2
adaptive language modeling, DA LM), 使用领域自适应语言模型学习跨领域的共享上下文和注释, 为未标记的目标
领域数据分配伪标签. 同时生成对抗训练形式的诞生使得伪标签生成模型的训练具备更强的自主性. Li 等人 [35] 提
出了一种基于选择性对抗学习 (selective adversarial learning, SAL) 的跨领域 ABSA 方法, 可以动态学习每个词的
权重, 使得更重要的词可以具有更高的权重, 从而实现细粒度词语级的领域自适应. Zhou 等人 [36] 在选择性对抗学
习方法基础上提出了一种自适应混合框架 (adaptive hybrid framework, AHF), 利用在目标数据上生成的伪标签来
训练任务分类器, 进一步提升了模型性能.
此外, 随着迁移学习向多源领域情景的扩展, 跨领域实例迁移的研究对多个源领域样本之间的协同性愈发重
视. 例如, He 等人 [37] 提出了一种多源领域自适应的协同样本选择方法, 通过衡量不同源领域样本与目标领域的相
关性和互补性, 构建了一个协同样本选择框架, 旨在解决多源领域数据存在差异时的样本选择问题. Dai 等人 [38] 提
出了一个两阶段的领域适应框架, 在第 1 阶段采用多任务架构为有标签源领域建模领域通用特征和领域特定特
征, 在第 2 阶段采用选择性领域适应方法及协同集成方法从最接近的源领域处进行知识迁移.
综上所述, 现有的基于样本选择的跨领域实例迁移方法在处理新任务或新领域时需要重新设计样本选择机制
或样本聚类算法, 对不同任务及领域的泛化性能比较差; 而基于样本生成的跨领域实例迁移方法通常会选择模型
对无标签数据的高置信度预测作为伪标签, 这会导致模型更偏向于容易处理的样本, 而对于困难样本的处理不足.
同时, 跨领域实例迁移方法大多未考虑样本间的协同性, 且均单独面向实例迁移过程, 并不能同时进行目标领域模
型的训练, 一定程度上影响了训练效率.
2 任务描述
对于 ABSA 任务的 3 种子任务: ATE、ACD 及 ABSC 任务, 本文均将其视为文本序列标记问题. 针对 ATE 任
务, 对于给定的一条输入文本, 目标是预测该文本中的方面术语标签序列, 其中每个方面术语标签来自标签集{O,
ASP}. 标签 O 表示该单词不是方面术语, 标签 ASP 表示该单词为方面术语. 图 1 中给出了一条示例文本及 ABSA
各子任务的标签序列. 在示例文本中, “screen”和“battery”是两个方面术语, 分别被标注为 ASP 标签.
针对 ACD 任务, 对于给定的一条输入文本, 目标是预测该文本对应的方面类别标签序列, 其中每个方面类别
标签来自预先定义的标签集{O, ASP-C-1, ASP-C-2, ASP-C-3,…}. 标签 O 表示该单词未表达方面类别信息, 而
ASP-C-1、ASP-C-2、ASP-C-3 等则分别代表单词表达的不同方面类别信息. 在图 1 示例文本中, “screen”和
“battery”这两个方面术语被进一步识别出属于不同的方面类别, 分别为显示质量 (display quality) 和电池 (battery).
针对 ABSC 任务, 对于给定的一条输入文本 X = {w 1 w 2 ,…, w n }, 任务目标是预测该文本对应的方面级情感标
,
l
,
签序列 Y = {l 1 l 2 ,…, l n }, 其中每个方面级情感标签 来自标签集{O, T-POS, T-NEG, T-NEU}, 标签 O 表示这个单
词未表达出方面级情感, T-POS、T-NEG、T-NEU 分别表示该单词表达积极、消极和中性情感. 在图 1 示例文本
中, “screen”和“battery”是两个方面术语, 它们在句子中表达的情感极性分别是积极和消极.

