Page 20 - 《软件学报》2026年第4期
P. 20
赵传君 等: 基于高质量样本选择的跨领域方面级情感分析 1461
在 50% 和 30% 的样本选择比例下, 由于过少的训练数据量导致模型出现欠拟合现象, 模型性能显著下降.
综上所述, 在上述 5 种样本选择比例中, HQSS-CDABSA 方法在 70% 的样本选择比例下表现最优. 这表明,
70% 的样本选择比例能够在保证筛选出的样本高质量的同时, 提供足够的训练数据量, 从而提升模型的性能. 相比
之下, 更高的样本选择比例由于保留的源领域样本过多, 无法有效筛除其中的噪声数据. 而更低的样本选择比例尽
管筛选出的源领域样本质量更高, 但其训练数据量的不足仍然会限制模型的性能.
4.4 对比实验
为了验证方法的优越性, 本节以跨领域 ATE 任务为下游任务, 将 HQSS-CDABSA 方法与 4 种对比模型进行
了性能对比. 实验结果如表 4 所示, 其中 HQSS-CDABSA 方法的样本选择比例为 70%, 以 BERT 模型为下游模型.
表 4 不同模型处理跨领域 ATE 任务的 F1 值比较结果 (%)
模型 D→R D→S L→R L→S R→D R→L R→S S→D S→L S→R Avg
FMIM 61.64 49.53 68.67 51.68 36.11 50.57 47.60 35.26 39.14 57.43 49.76
CDRG 57.51 43.19 68.63 51.07 34.89 55.50 49.97 38.59 39.49 60.20 49.90
GCDDA 53.70 30.74 58.00 30.31 44.25 64.06 35.69 39.16 43.95 63.53 46.34
2
DA LM 63.86 38.20 68.72 41.06 44.29 54.55 43.41 43.24 44.96 65.78 50.80
HQSS-CDABSA 62.69 48.49 63.12 36.99 69.70 64.37 42.05 75.53 58.10 62.64 58.37
表 4 中的实验结果表明, 所提出 HQSS-CDABSA 方法在 10 组跨领域 ATE 任务中整体表现优越, 平均 F1 值
2
达到 58.37%, 分别较 FMIM、CDRG、GCDDA 和 DA LM 方法提升了 8.61%、8.47%、12.03% 和 7.57%, 充分验
证了 HQSS-CDABSA 方法在跨领域任务中缓解源领域样本负迁移效应的有效性与优越性.
具体来看, HQSS-CDABSA 方法在 S→D、R→D、S→L 和 S→R 迁移任务中取得显著优势, 其中在 S→D 任
务中 F1 值达到 75.53%, 远超其他模型. 这一现象表明, HQSS-CDABSA 方法能够在源领域和目标领域存在较大语
义差异的情境下, 有效筛选出对目标任务真正有利的源领域样本, 提升模型在目标领域的泛化性能. 这是由于
HQSS-CDABSA 方法引入了高质量样本选择机制, 能够从多个角度评估源领域样本与目标任务的匹配度, 有效过
滤掉可能带来负迁移的无关或噪声样本.
传统迁移方法中, 通常默认全部源领域样本都具有迁移价值, 而在实际场景中, 不同领域间存在语义不一致、
风格差异或标签分布偏移等问题, 使得部分源领域样本对目标任务无益, 反而产生负迁移效应, 降低目标领域模型
的性能. HQSS-CDABSA 方法通过融合多角度指标, 构建领域间及领域内的高质量样本选择指标, 识别并迁移对
目标任务有益的源领域样本, 从根本上提升了迁移效果.
而在 L→S、D→S、R→S 等任务中, 由于领域差异较大, 源领域中的高质量样本占比本身较低, HQSS-CDABSA
方法在样本总量受限的条件下未能充分捕获领域共性. 但 HQSS-CDABSA 方法在大多数任务上依旧展现出良好
的迁移稳定性, 表明其所使用的高质量样本选择策略具有良好的通用性和鲁棒性.
综上所述, 所提出的 HQSS-CDABSA 方法通过高质量样本选择, 有效缓解了跨领域迁移中普遍存在的负迁移
问题, 在保证训练数据数量的同时, 较大程度保留了对目标领域有利的信息, 从而显著提升模型的跨领域泛化
能力.
4.5 单源领域场景实验结果
针对跨领域 ATE、跨领域 ACD 及跨领域 ABSC 任务, 在单源领域场景下的具体实验结果分别如表 5–表 7
所示. 表 5–表 7 中展示了在两种不同的训练数据选择策略下不同模型在各子任务上的效果对比. 两种训练数据选
择策略分别为: (1) 使用全样本训练集训练迁移模型; (2) 通过所提出的 HQSS-CDABSA 方法选择 70% 数据量的
训练集样本训练迁移模型.
表 5 中的实验结果表明, 所提出的 HQSS-CDABSA 方法能够有效筛选出适合迁移训练的高质量样本, 从而提
升 5 种模型的性能表现. 5 种模型在 10 组跨领域 ATE 任务上的平均 F1 值均有所提升, 具体表现为: RNN 从
20.08% 提升至 22.57%, Bi-LSTM 从 26.59% 提升至 28.62%, Att-LSTM 从 33.07% 提升至 36.26%, GAN 从

