Page 17 - 《软件学报》2026年第4期
P. 17
1458 软件学报 2026 年第 37 卷第 4 期
X S 采用滑动窗口的方式捕捉文本数据中的上下文语义信息. 为了捕捉更细微
• 上下文信息捕捉: 对文本数据
的上下文语义信息, 将滑动窗口大小设置为 4, 步长为 2.
X S 对应的词汇列表中词汇作为上下文结构图的节点, 对于每个滑动窗口中共现的
• 上下文结构图构建: 将文本
词汇列表元素, 在结构图中添加表示共现关系的边. 构建完成后的文本 X S 对应的上下文结构图记作 G X = (V X ,E X ).
• 领域通用性分数计算: 根据公式 (13) 计算领域通用性分数:
2×|E X |
Gen(X S ) = (13)
|V X |×(|V X |−1)
从公式 (13) 可以发现, 领域通用性分数更高的文本, 其上下文结构图连通性更高, 说明文本中词汇之间的联
系更强. 这导致这些词汇在更多的上下文环境中适用, 从而使文本在多个方面更具领域通用性, 因为它能更全面地
反映出领域内的共同特征和情感信息. 这种具备高连通性结构图的源领域数据为迁移学习提供了更丰富的基础.
(2) 方面级距离度量
由于领域通用性分数更关注的是样本在本领域内的词汇联系程度, 缺乏与目标领域的联系, 提出了一种方面
级距离度量来对域内高质量样本的选择进行补充. 具体来说, 对于一条源领域样本 X S 和目标领域 D T , 进行以下
操作.
• 特征提取: 将目标领域 D T 中每条句子文本进行分词操作得到词汇列表, 并对词汇进行停用词去除预处理操
作. 通过 BERT 预训练模型将词汇转化为高维向量表示, 以捕捉词汇间的语义关系. 对每条句子的词向量矩阵采
D T 的句向量集合
用平均聚合方式得到该条句子的句特征向量, 最终得到源领域样本 X S 的句向量 E S 与目标领域
2
1
{E ,E ,...,E }.
N T
T T T
• 目标领域样本聚类: 将根据目标领域的常见 K 个方面类别, 分别为每个方面类别构造 n 条伪目标领域样本,
K×n 条伪目标
采用半监督聚类及监督聚类方式对目标领域句向量集合进行方面级聚类操作. 具体来说, 从构造的
领域样本中对各个类别分别选取一条样本作为初始聚类中心样本, 同时将剩余的伪目标领域样本用于聚类算法的
监督训练. 最终得到目标领域 K 个方面类别的类中心向量 {E 1 ,E 2 ,...,E K }.
Center Center Center
• 方面级距离度量计算: 根据公式 D T 间的方面级距离度量:
(14) 计算源领域样本 X S 与目标领域
K ∑
Dis asp (X S ,D T ) = E S − E i (14)
Center 2
i=1
方面级距离度量通过量化源领域样本与目标领域方面级类中心之间的距离, 补充了领域通用性分数的不足,
确保所选样本不仅在源领域内具备良好的词汇联系, 还能在目标领域中保持相关性.
3.3 模型训练
经过领域间和领域内两个层面的筛选工作后得到高质量训练样本集合, 记为 Data Select , 并在 Data Select 基础上
进行下游任务迁移模型的训练.
为了全面探究所提方法对不同模型架构在下游任务迁移中的影响, 本文设置了不同类型的模型进行实验: 基
于深度学习的模型、基于生成对抗训练的模型以及基于预训练的模型. 这 3 种类型的模型具有不同的优势: 基于
深度学习的模型能够快速从数据中学习复杂的特征表示; 基于生成对抗训练的模型可以通过生成器和判别器的对
抗学习来挖掘数据的潜在分布; 基于预训练的模型可以借助大规模通用数据上预训练的知识, 快速适应新的任务.
针对基于深度学习的模型, 本文选择了更擅长处理长文本序列数据的循环神经网络作为基本网络架构, 并将
其变体模型——双向循环神经网络模型及基于注意力机制的循环神经网络模型引入实验的讨论范围. 针对基于生
成对抗训练的模型, 构建了生成器和判别器. 生成器生成与源领域样本相似的样本, 判别器负责区分生成的样本和
真实的源领域样本. 通过交替训练生成器和判别器, 使生成器生成更加逼真的样本. 针对基于预训练的模型, 利用
在大规模通用数据集上的预训练 BERT 模型, 后接多层感知机模型, 保留预训练模型的通用知识, 同时让模型能够
适应下游任务.
在训练过程中, 通过调整超参数, 如学习率、批次大小和训练轮数, 以确保模型能够稳定收敛并达到最佳性

