Page 284 - 《软件学报》2026年第2期
P. 284

张建新 等: 依存句法信息增强的完全非自回归翻译                                                         763


                 要挑战. 尤其是在需要高效推理的场景中              (如实时翻译、对话机器人). Medusa         框架  [5] 重新审视了非自回归生
                 成  [6] , 并提出在大语言模型中添加少量完全非自回归生成头, 以加速推理过程, 该方案已成为提升大语言模型推理
                 速度的有效且具有代表性的加速技术之一. 鉴于此, 即便在大语言模型的时代, 探索完全非自回归翻译                               (fully non-
                 autoregressive translation, Fully NAT) 的优化方法依然具有重要的研究价值. 由于    Fully NAT  的并行解码特性, 模
                 型依然难以有效捕捉目标语言的内部依赖关系, 导致在翻译质量上的损失. 句法信息增强有助于更好地捕捉语言

                 内部的依赖关系, 进而减少翻译质量上的损失.
                    Fully NAT  方法的性能不如    AT  方法的主要原因在于难以捕捉目标端的内部依赖信息. Fully NAT                 方法通常
                 假设目标词在给定源句子的条件下是独立的, 从而忽略了目标词之间的相互依赖关系. 一些研究尝试通过非自回
                 归翻译   (non-autoregressive translation, NAT) 模型在保持并行解码的同时捕捉目标词之间的依赖关系          [6–8] . 迭代的
                 非自回归翻译     (iterative NAT) 模型  [9–11] 通过多次迭代来优化翻译结果. 尽管   Iterative NAT  模型在翻译质量上具有
                 一定优势, 但其多次解码过程削弱了            NAT  模型的速度优势     [8] . 因此, 在提升翻译质量的同时保持速度优势的核心
                 问题在于如何在保持       Fully NAT  推理效率优势的同时, 利用更多的目标端的依赖信息. 考虑到                NMT  是一项语言对
                 齐任务, 一些现有的      AT  方法通过从源端捕捉依赖信息, 实现了显著的性能提升                [12–14] . 受到  AT  方法成功利用源端
                 依存句法信息的启发       (文献  [15] 也揭示了编码器对最终翻译性能的更直接影响), 我们重新审视了将源端依存句法
                 信息融入    Fully NAT  中的有效性. 具体来说, 使用     SuPar [16] 获取源句子的依存句法信息. GCN     [17] 擅长处理图结构,
                 可以捕捉依存句法结构        [14,18] , 因此本文利用  GCN  编码源句的依存信息. 编码后的依存句法信息随后通过加权求和
                 与句子编码器获得的源句子嵌入相结合. 经过这一过程后, 所得信息将直接输入到解码器中. 通过将源端的句法结
                 构与  NAT  模型的句子编码器输出结合, 我们的方法能够有效地在并行解码过程中利用依赖信息, 从而提升翻译
                 质量.
                    我们工作的贡献包括重新审视了在             Fully NAT  中引入依存句法信息的方法, 进一步拓展了依存句法信息在
                 Fully NAT  中作用的研究. 提出了    SynNAT  模型, 该模型将编码后的依存句法信息与句子信息结合, 作为                  SynNAT
                 编码器的最终隐藏状态. 在多个基准测试上的实验表明, 我们的方法能够超越现有的                           Fully NAT  研究. 具体而言,
                 在  WMTEN→RO   数据集上, 我们的方法在       GLAT+NPD (m=7) 模型上实现了最高      1.47  的  BLEU  分数提升.
                  1   相关工作


                  1.1   Fully NAT  模型
                    为了建模    NAT  中输出词语之间的依赖关系, 许多研究引入了各种形式的潜在变量                     [6,19,20] . 文献  [21] 首先生成
                 可能的翻译输出, 然后对这些结果进行单轮精炼. 此外, 一些研究探讨了从自回归模型向非自回归模型传递知识以
                 提升性能   [22] . 部分研究集中在使用不同的训练目标         [23] 或添加正则化项来提高非自回归模型的有效性            [24,25] . 文献  [26]
                 提出通过预训练短语表将源语言直接映射为目标端短语, 作为解码器输入, 以提供粗粒度的目标端依赖信息. 利用
                 回译策略将解码器内部输出到           Softmax  层之前的隐状态重建为源语言, 增强解码器对源语言语义的传递能力. 文
                 献  [27] 提出通过门控机制动态融合原文本词向量与高层语义特征信息, 以增强解码器输入. 该方法还使用基于课
                 程学习的训练策略, 能够根据模型当前表现动态调整学习任务难度, 从而优化                        Fully NAT. 文献  [28] 提出一种基于
                 课程学习的非自回归翻译方法, 并在此基础上提出一种基于模型蒸馏与增强网络的翻译增强方法. 为保持方法高
                 效性, 通过模型蒸馏训练用于生成初步翻译表征的浅翻译模型, 为使增强网络具备提升翻译表现的能力, 通过预训
                 练向增强网络融入条件上下文知识与错误恢复能力. GLAT                  [29] 在非自回归翻译任务中表现出色, 且推理速度高效.
                 其创新的   glancing sampling  机制有效捕捉源句的依赖关系, 同时通过并行解码提高了翻译效率. 此外, 该模型的设
                 计兼顾了降低计算复杂度并保持翻译质量. 因此, 本文的工作基于                    GLAT  展开.

                  1.2   Iterative NAT  模型
                    迭代优化是一种通过多轮解码来提升输出质量的策略. 文献                    [30] 提出了基于去噪自编码器的迭代优化方法.
   279   280   281   282   283   284   285   286   287   288   289