Page 26 - 《软件学报》2026年第4期
P. 26
赵传君 等: 基于高质量样本选择的跨领域方面级情感分析 1467
表 14 案例研究表
No. Sentence Q intra Q Select
1 Finding different parts of the site was just as easy. −7.25 2.75 √
2 I had to “marry” each of these eGroup accounts with a Yahoo! −8.66 1.34 √
3 eGroups is a place where people with common interests can join groups that post messages or chat. −10.13 −0.13 √
4 That telephone just rang and rang and rang. −12.15 −2.15 ×
5 Books were community college level or lower. −13.75 −3.75 ×
4.10 统计性分析实验
(1) 数据质量 Q
为了探究所提出 HQSS-CDABSA 方法对源领域训练数据的数据质量的影响, 针对单源领域场景下的 10 对跨
领域迁移任务, 本文对使用 HQSS-CDABSA 方法进行高质量样本选择前后的源领域训练数据的数据质量进行了
Q intra 与 10 的
统计分析. 为了直观展示筛选前后数据质量的差距, 将数据质量 Q 定义为域内高质量样本选择指标
和. 实验结果如图 6 所示.
1.44 Before-select 1.45
1.4 1.37 After-select 1.19 1.39 1.13 1.17
平均数据质量 Q avg 1.0 0.94 0.77 0.82 0.69 0.99 0.96 0.51 0.97 0.91 0.62 0.58
1.2
0.8
0.6
0.4
0.2 0.35 0.21 0.41 0.40
D→R D→S L→R L→S R→D R→L R→S S→D S→L S→R Avg
迁移任务
图 6 不同迁移任务中源领域经 HQSS-CDABSA 方法筛选前后的平均数据质量
Q avg
图 6 中展示了每对迁移任务中经 HQSS-CDABSA 方法筛选前后的源领域数据集的平均数据质量 Q avg 以及所
有迁移任务的 Q avg 的平均值. 其中, 绿色柱体代表经 HQSS-CDABSA 方法筛选前的源领域数据集的平均数据质量
Q avg , 红色柱体代表经 HQSS-CDABSA 方法筛选后的源领域数据集的平均数据质量 Q avg .
图 6 的实验结果表明, 10 组迁移任务中的源领域在经过 HQSS-CDABSA 方法进行高质量样本选择之后, 其
平均数据质量 Q avg 均有明显增长. 综合 10 组迁移任务的平均效果来看, Q avg 由 0.58 增长至 1.17, 提升了 0.59, 表
明 HQSS-CDABSA 方法能够有效提升源领域训练数据的数据质量.
从具体任务来看, D→S 任务的 Q avg 值从 0.77 提升至 1.44, 提升幅度最大, 达到 0.67, 这源于 D 领域与 S 领域
在语义和主题上具有较高的重叠性, 相比于其他迁移任务, HQSS-CDABSA 方法能够更有效地筛选出与目标领域
相关的高质量样本. 类似地, L→S 任务的 Q avg 值从 0.69 提升至 1.37, 提升幅度为 0.68, 进一步验证了 HQSS-CDABSA
方法在筛选高质量样本时的有效性. 相比之下, D→R 任务的 Q avg 值从 0.35 提升至 0.94, 提升幅度为 0.59, 虽然提
升显著, 但由于 D 领域与 R 领域的主题差异较大, 筛选后的 Q avg 值仍低于其他任务.
(2) 模型泛化误差 ε T
为了探究本节所提出 HQSS-CDABSA 方法对不同模型在跨领域任务中泛化误差的影响, 针对单源领域场景
下的跨领域 ABSC 任务, 本节对使用 HQSS-CDABSA 方法进行高质量样本选择前后的不同模型的泛化误差进行
了统计分析. 为了直观展示 HQSS-CDABSA 方法筛选前后模型性能的差距, 通过折线图对不同模型的泛化误差曲
线进行了绘制. 图 7 中展示了每种模型在跨领域 ABSC 任务上的泛化误差曲线, 曲线值为对应模型在 10 组单源领
域场景下跨领域 ABSC 任务上的泛化误差的平均值. 其中图 7(a) 中展示了循环神经网络的 3 种模型的性能, 图 7(b)
中展示了生成对抗网络及预训练模型两类模型的性能.

