Page 288 - 《软件学报》2026年第2期
P. 288

张建新 等: 依存句法信息增强的完全非自回归翻译                                                         767


                 其中,  β ∈ [0,1] 是一个超参数, 称为融合因子,     h en  表示来自  SynNAT  编码器的第  i 个词元的最终输出向量. 操作符
                                                     i
                 ∑表示向量的加权求和如图         2  右侧所示.
                  2.5   SynNAT 解码器
                    解码器及其训练策略与         GLAT [29] 所描述的方法一致. NAT   模型基于    Transformer 框架. NAT  模型的目标是学
                 习一个映射函数      f 1 : X→Y, 将源句子映射到目标句子, 从而估计未知的条件分布              P(Y|X;θ), 其中,  θ 表示  NAT  模型
                 的参数集合. 在训练过程中, Fully NAT      模型通过条件独立性分解进行预测, 目标是最大化:

                                                         T ∑
                                                   L NAT =  logP(y t |H ;θ )                          (8)
                                                         t=1
                 其中, T  表示目标句子的长度. 训练过程中, T=M, M         为真实目标句子的长度, 而在推理过程中, T=P L (X), 由长度预
                 测模块   P L 决定. 与自回归模型相比, NAT     模型省略了条件词元        y<t, 从而允许并行翻译, 并加速推理过程. 其中, H
                 的计算方式如下:

                                                       H = f 2 (emb(X))                               (9)
                 其中, f 2 是复制函数, H  是经过   emb( ·) 处理后的词元通过    UniformCopy  或  SoftCopy [22] 获得的嵌入矩阵. 这些嵌入
                 随后作为   SynNAT  模型解码器的输入.
                    我们的   SynNAT  采用与  GLAT [29] 相同的解码器. GLAT  仅改变了训练过程, 推理过程保持完全并行, 并只需一
                 次解码. GLAT  与标准   NAT  的区别在于, GLAT    在训练过程中使用扫视语言模型           (glancing language model, GLM),
                 显式地鼓励词元间的相互依赖. 为了实现自适应扫视采样, GLM                   在训练过程中进行两次解码. 第          1  次解码类似于
                 标准的   NAT, 用于评估预测准确性, 以判断当前参考词是否难以拟合. 在第                  2  次解码时, GLM   基于第   1  次解码进
                 行扫视采样, 以获得采样的参考词元, 并将这些参考词元提前透露给解码器, 学习预测剩余的未采样词元. 需要注
                 意的是, 只有第    2  次解码会更新模型参数. GLAT       只修改训练过程, 其推理过程完全并行, 且仅需             1  次解码. 它的目
                 标是最大化以下目标:

                                                             (    (   )   )
                                                      ∑              ⌢
                                              L GLM =     logP y t |GS Y,Y ,X;θ                      (10)
                                                       (  )
                                                        ⌢
                                                    y t ∈GS Y,Y
                                                               (  )
                           (  ⌢ )                                ⌢
                 其中,  y t ∈ GS Y,Y  表示未被选中的词元, 扫视采样策略       GS Y,Y  通过将初始预测与真实标签进行比较, 从目标句
                 子中选择词元. 如果网络的初始预测不够准确, 它将选择更多的词元, 并在第                      2  次解码时将它们输入解码器. 扫视
                 采样可以分为两个步骤: 首先确定样本的数量              S, 然后从参考句子     Y  中随机选择   S  个词元. 对于给定的输入      X  的预
                                                 (  )
                       ⌢                           ⌢
                 测句子  Y  和参考句子   Y, 扫视采样函数    GS Y,Y  的目标是从    Y  中获得一个子集, 该子集由从       Y  中采样的词元组成:

                                                    (  )        (  (   ))
                                                      ⌢               ⌢
                                                 GS Y,Y = Random Y,S Y,Y                             (11)
                 其中, Random(Y, S) 表示从目标句子    Y  中随机选择   S  个词元, 该  S  值的确定采用了与    GLAT [29] 描述的相同策略, 是
                                                           (  )     (  )
                            ⌢                                ⌢        ⌢
                 通过比较    Y  和  Y  之间的差异来计算得到的, 公式为:      S Y,Y = λ·d Y,Y . 采样比例  λ∈[0, 1] 是一个超参数, 用于灵
                                       (  )
                                         ⌢           ⌢                               [52]
                 活地控制采样词元的数量.         d Y,Y  是衡量  Y  和  Y  之间差异的度量. 我们采用了汉明距离          作为度量方法, 计算公
                       (  )      (    )     (   )
                         ⌢  ∑  T               ⌢
                 式为:  d Y,Y =    y t , ˆy t . 通过  d Y,Y , 可以根据当前训练模型的预测能力自适应地决定采样数量.
                               t=1
                  3   实 验
                  3.1   数据集
                    我们在   5  个常用的机器翻译基准数据集上评估了             SynNAT  模型, 包括  WMT14 EN↔DE、WMT16 En↔RO
                 以及  IWSLT14 DE→EN, 数据集大小及划分见表         1. 在处理  WMT14 EN↔DE   数据集时, 我们遵循了文献        [1] 中详
   283   284   285   286   287   288   289   290   291   292   293