Page 285 - 《软件学报》2026年第2期
P. 285
764 软件学报 2026 年第 37 卷第 2 期
文献 [10] 在推理过程中通过插入和删除操作优化翻译输出. 文献 [9] 提出了掩蔽语言模型, 通过迭代替换被掩蔽
的词元生成新的输出. 文献 [11] 引入了自适应掩蔽策略, 以增强解码器的优化能力, 并简化编码器的优化过程. 文
献 [31] 提出了时间步感知条件掩蔽语言模型, 将离散前向扩散过程与条件掩蔽语言模型相结合. 该方法有效提升
了模型训练的鲁棒性和翻译质量. 文献 [26] 提出了采用轻量级的接合器网络, 对 XLM 预训练语言表征与 NAT 模
型进行深层次 XLM-Fused 特征融合. 此外, 通过结合掩码-预测算法, 实现预训练与下游任务推理的两阶段训练范
式统一. 文献 [27] 提出在 CMLM 的基础上增加两个优化模型的训练策略: N-gram 掩码和一致性学习正则化. 文
献 [32] 提出了一种通过明确引入周围词元信息而改进 NAT 模型局部性能力的方法, 在编码器和解码器两个方向
上引入了混合分组线性变换, 以获得更具局部感知性的表示. 近年来, 文献 [7] 建议增强预测目标词的表示独特性,
并提出了观察邻居方法. 文献 [33] 提出了掩蔽生成序列建模方法, 该方法直接作用于多个音频标记流. 文献 [34]
提出了一种创新且高效的领域自适应方法 Bi-kNN, 专为非自回归模型定制的 k 近邻算法. 尽管这些方法在准确性
上具有明显优势, 但多次解码显著降低了非自回归模型的推理效率.
1.3 源端句法信息增强神经机器翻译
在 NMT 领域, 研究人员探讨了如何有效地将源端依存句法信息融入模型中, 以提升翻译质量. 尽管传统的序
列到序列 (seq2seq) NMT 模型在一定程度上可以从源语言句子中学习依存句法信息, 但这种学习通常是有限的,
难以充分利用依存句法结构来改善翻译效果. 为了解决这一问题, 研究人员提出了多种方法, 旨在将依存句法信息
融入 NMT 模型中 [35] . 文献 [36] 通过图卷积网络在编码器中引入依存树信息, 使得单词的表示能够捕捉其语法邻
域信息, 从而改善神经机器翻译的性能. 文献 [37] 提出了双向树状编码器, 利用句法树增强 NMT 的编码过程, 同
时提出树覆盖注意力机制, 使得模型在解码过程中能更有效地利用句法结构. Recurrent Graph Encoder 模型 [38] 通
过显式建模句法依存关系, 同时保持词序信息, 以提升序列建模能力. 文献 [39] 扩展了局部注意力 (local attention)
机制, 引入句法距离约束, 使得注意力机制能够优先关注与当前目标词依存关系更紧密的源词. 文献 [40] 探讨了
在 Transformer 中引入源句句法信息以提升神经机器翻译的方法, 比较了基于位置编码和输入嵌入的两种方式来
利用源句的依存句法信息, 同时保持 Transformer 结构不变, 从而保证其计算效率. 文献 [41] 提出了一种将句法信
息融入复数值编码器-解码器 (complex-valued encoder-decoder) 架构的方法, 该方法通过注意力机制联合学习从源
端到目标端的词级和句法级注意力分数, 其不依赖于特定的网络架构, 可直接集成到任意序列到序列框架中. 文
献 [35] 将源句的解析树线性化以获得结构标签序列. 在此基础上, 提出了 3 种不同的编码器将源句法信息融入
NMT: 并行 RNN (同步学习单词与标签)、分层 RNN (两级结构处理单词和标签)、混合 RNN (拼接单词与标签序
列). 所提出的 3 个句法编码器都能提高翻译准确度. 文献 [42] 提出利用一个经过充分训练的端到端依存句法解析
器的中间隐藏表示, 称为句法感知词表示 (syntax-aware word representation, SAWR). 然后将 SAWR 直接与标准词
嵌入拼接, 以增强基本 NMT 模型的表示能力. 文献 [43] 尝试同时利用源端和目标端的依存树, 在解码过程中构建
目标端依存结构, 以帮助模型更精确地预测目标词的结构关系. 文献 [44] 基于依存树将源端长距离依赖关系纳入
NMT, 丰富了每个源状态的全局依存结构, 这可以更好地捕捉源句的固有句法结构. 这些研究清楚地表明, 结合依
存句法信息的模型在多个翻译任务上均能显著提高 BLEU 分数, 验证了依存句法信息对 NMT 的有效性.
此外, 少数研究关注通过句法信息增强非自回归翻译 (NAT). 其中, SynST [45] 利用句法结构来增强 NAT. 该方
法首先基于自回归解码器生成结构化的句法树解析块. 然后, 利用这些解析块引导解码器进行目标词的非自回归
生成. 然而, 这种方法降低了解码速度, 失去了纯粹非自回归的优势. SNAT 模型 (syntactic and semantic structure-
aware non-autoregressive Transformer model) [46] 提出了在非自回归 Transformer 中整合词性和命名实体等句法与语
义结构的方法. 与这些方法不同, 文献 [47] 提出了一种基于源语言依存关系的非自回归解码模型. 该模型采用全
局与局部注意力相结合的方式, 对源端依存关系进行显式建模, 赋予核心词权重并结合全局注意力. 文献 [47] 同
时提出融入源语言依存标签的非自回归机器翻译模型. 该模型通过更细粒度的依存关系标签间接融入目标词的上
下文, 从而减少语法结构错误. 在这些启发的基础上, 我们开展了关于使用句法信息来增强非自回归翻译模型的研
究. 与现存模型不同的是, 我们综合考虑依存句法树中节点的输入弧、输出弧和依存关系标签来增强 Fully NAT

