Page 285 - 《软件学报》2026年第2期
P. 285

764                                                        软件学报  2026  年第  37  卷第  2  期


                 文献  [10] 在推理过程中通过插入和删除操作优化翻译输出. 文献                 [9] 提出了掩蔽语言模型, 通过迭代替换被掩蔽
                 的词元生成新的输出. 文献        [11] 引入了自适应掩蔽策略, 以增强解码器的优化能力, 并简化编码器的优化过程. 文
                 献  [31] 提出了时间步感知条件掩蔽语言模型, 将离散前向扩散过程与条件掩蔽语言模型相结合. 该方法有效提升
                 了模型训练的鲁棒性和翻译质量. 文献            [26] 提出了采用轻量级的接合器网络, 对          XLM  预训练语言表征与      NAT  模
                 型进行深层次     XLM-Fused  特征融合. 此外, 通过结合掩码-预测算法, 实现预训练与下游任务推理的两阶段训练范
                 式统一. 文献   [27] 提出在  CMLM  的基础上增加两个优化模型的训练策略: N-gram             掩码和一致性学习正则化. 文
                 献  [32] 提出了一种通过明确引入周围词元信息而改进              NAT  模型局部性能力的方法, 在编码器和解码器两个方向
                 上引入了混合分组线性变换, 以获得更具局部感知性的表示. 近年来, 文献                     [7] 建议增强预测目标词的表示独特性,
                 并提出了观察邻居方法. 文献         [33] 提出了掩蔽生成序列建模方法, 该方法直接作用于多个音频标记流. 文献                      [34]
                 提出了一种创新且高效的领域自适应方法               Bi-kNN, 专为非自回归模型定制的        k 近邻算法. 尽管这些方法在准确性
                 上具有明显优势, 但多次解码显著降低了非自回归模型的推理效率.
                  1.3   源端句法信息增强神经机器翻译
                    在  NMT  领域, 研究人员探讨了如何有效地将源端依存句法信息融入模型中, 以提升翻译质量. 尽管传统的序
                 列到序列    (seq2seq) NMT  模型在一定程度上可以从源语言句子中学习依存句法信息, 但这种学习通常是有限的,
                 难以充分利用依存句法结构来改善翻译效果. 为了解决这一问题, 研究人员提出了多种方法, 旨在将依存句法信息
                 融入  NMT  模型中  [35] . 文献  [36] 通过图卷积网络在编码器中引入依存树信息, 使得单词的表示能够捕捉其语法邻
                 域信息, 从而改善神经机器翻译的性能. 文献             [37] 提出了双向树状编码器, 利用句法树增强            NMT  的编码过程, 同
                 时提出树覆盖注意力机制, 使得模型在解码过程中能更有效地利用句法结构. Recurrent Graph Encoder 模型                      [38] 通
                 过显式建模句法依存关系, 同时保持词序信息, 以提升序列建模能力. 文献                     [39] 扩展了局部注意力      (local attention)
                 机制, 引入句法距离约束, 使得注意力机制能够优先关注与当前目标词依存关系更紧密的源词. 文献                               [40] 探讨了
                 在  Transformer 中引入源句句法信息以提升神经机器翻译的方法, 比较了基于位置编码和输入嵌入的两种方式来
                 利用源句的依存句法信息, 同时保持           Transformer 结构不变, 从而保证其计算效率. 文献        [41] 提出了一种将句法信
                 息融入复数值编码器-解码器         (complex-valued encoder-decoder) 架构的方法, 该方法通过注意力机制联合学习从源
                 端到目标端的词级和句法级注意力分数, 其不依赖于特定的网络架构, 可直接集成到任意序列到序列框架中. 文
                 献  [35] 将源句的解析树线性化以获得结构标签序列. 在此基础上, 提出了                   3  种不同的编码器将源句法信息融入
                 NMT: 并行  RNN (同步学习单词与标签)、分层          RNN (两级结构处理单词和标签)、混合           RNN (拼接单词与标签序
                 列). 所提出的   3  个句法编码器都能提高翻译准确度. 文献           [42] 提出利用一个经过充分训练的端到端依存句法解析
                 器的中间隐藏表示, 称为句法感知词表示             (syntax-aware word representation, SAWR). 然后将  SAWR  直接与标准词
                 嵌入拼接, 以增强基本      NMT  模型的表示能力. 文献       [43] 尝试同时利用源端和目标端的依存树, 在解码过程中构建
                 目标端依存结构, 以帮助模型更精确地预测目标词的结构关系. 文献                     [44] 基于依存树将源端长距离依赖关系纳入
                 NMT, 丰富了每个源状态的全局依存结构, 这可以更好地捕捉源句的固有句法结构. 这些研究清楚地表明, 结合依
                 存句法信息的模型在多个翻译任务上均能显著提高                  BLEU  分数, 验证了依存句法信息对        NMT  的有效性.
                    此外, 少数研究关注通过句法信息增强非自回归翻译                  (NAT). 其中, SynST [45] 利用句法结构来增强   NAT. 该方
                 法首先基于自回归解码器生成结构化的句法树解析块. 然后, 利用这些解析块引导解码器进行目标词的非自回归
                 生成. 然而, 这种方法降低了解码速度, 失去了纯粹非自回归的优势. SNAT                   模型  (syntactic and semantic structure-
                 aware non-autoregressive Transformer model) [46] 提出了在非自回归  Transformer 中整合词性和命名实体等句法与语
                 义结构的方法. 与这些方法不同, 文献           [47] 提出了一种基于源语言依存关系的非自回归解码模型. 该模型采用全
                 局与局部注意力相结合的方式, 对源端依存关系进行显式建模, 赋予核心词权重并结合全局注意力. 文献                                 [47] 同
                 时提出融入源语言依存标签的非自回归机器翻译模型. 该模型通过更细粒度的依存关系标签间接融入目标词的上
                 下文, 从而减少语法结构错误. 在这些启发的基础上, 我们开展了关于使用句法信息来增强非自回归翻译模型的研
                 究. 与现存模型不同的是, 我们综合考虑依存句法树中节点的输入弧、输出弧和依存关系标签来增强                                 Fully NAT
   280   281   282   283   284   285   286   287   288   289   290