Page 16 - 《软件学报》2026年第4期
P. 16
赵传君 等: 基于高质量样本选择的跨领域方面级情感分析 1457
• 领域特征重合性分数计算: 对于两个源领域内的每个句子, 提取其包含的词汇特征, 分别得到两个源领域的
j
i J . 根据公式
词特征集合 J 和 (10) 计算两个源领域的领域特征重合性分数:
S S
i j
J ∩J
S S
Score same = (10)
i j
J ∪J
S S
• 域间联合适应性分数计算: 根据公式 (11) 计算两个源领域的域间联合适应性分数:
( )
i
C D ,D j S = θ 1 ·Score same −θ 2 ·Score diff (11)
S
其中, θ 1 和 θ 2 代表领域特征重合性分数与领域互补性分数的权重.
域间联合适应性分数代表了选择多个源领域时在领域特征重合性与领域互补性之间的权衡. 选择源领域组合
时, 尽量确保特征相似的领域能够互相补充, 而差异较大的领域则可以提供更多样化的信息. 这种选择能够确保模
型在目标领域上具有良好的泛化能力.
3.2 领域内选择
为了从源领域中选择出最合适进行迁移模型训练的源领域样本, 综合考虑了源领域样本的领域通用性、源领
Q intra . 对于选择出
域样本与目标领域之间的方面级距离, 提出了一种样本选择指标——域内高质量样本选择指标
的一个源领域样本数据 X S , Q intra 定义为:
Q intra = µ·Gen(X S )−η· Dis asp (X S ,D T ) (12)
其中, Gen(X S ) 为样本 X S 的领域通用性分数, Dis asp (X S ,D T ) 为样本 X S 与目标领域的方面级距离度量, µ 和 η 分别
为两种分数的权重系数. 具体计算流程如图 4 所示.
领域通用性分数 方面级距离度量
··· ··· Transformer 块 ···
数 ···
源领域词汇列表 据 ···
预 ··· W Q 多 前 ···
滑动窗口 步长 处 目标领域样本集合 输 W K 头 目 归 一 馈 神 归 一 输 目标领域词嵌入集合
理 入 N× 注 化 经 化 出
··· W V 意 层 网 层 ···
上下文语义 力 络 ···
信息捕捉 ··· ···
··· BERT 层
构 建 源领域词嵌入集合
源领域样本集合
平均 聚合
··· E 1 S ···
···
1 2 N S 方面级距离度量计算 E 1 N S
G X G X G X Center E 2 Center E S ···
源领域样本上下文结构图
源领域句嵌入集合
K ···
Dis asp (X S , D T )=∑||E S −E i Center || 2 1
i=1 E T ···
领域通用性分数计算 E 3 Center ···
2×|E X | E K Center E T N T ···
Gen(X S )=
|V X |×(|V X |−1) 方面级聚类中心向量 目标领域句嵌入集合
域内高质量样本 Q intra =μ·Gen(X S )−η·Dis asp (X S , D T )
选择指标计算
域内高质量样本选择指标
图 4 领域内高质量样本选择流程图
(1) 领域通用性分数
为了筛选出在迁移训练过程中泛化性能更强的源领域数据, 提出了一种领域通用性分数来指导数据的选择.
X S , 进行以下操作.
具体来说, 对于一条源领域文本数据
X S 进行分词操作得到其词汇列表, 并对词汇进行停用词去除、词汇去重等预处理
• 数据预处理: 将文本数据
操作.

