Page 288 - 《软件学报》2026年第2期
P. 288
张建新 等: 依存句法信息增强的完全非自回归翻译 767
其中, β ∈ [0,1] 是一个超参数, 称为融合因子, h en 表示来自 SynNAT 编码器的第 i 个词元的最终输出向量. 操作符
i
∑表示向量的加权求和如图 2 右侧所示.
2.5 SynNAT 解码器
解码器及其训练策略与 GLAT [29] 所描述的方法一致. NAT 模型基于 Transformer 框架. NAT 模型的目标是学
习一个映射函数 f 1 : X→Y, 将源句子映射到目标句子, 从而估计未知的条件分布 P(Y|X;θ), 其中, θ 表示 NAT 模型
的参数集合. 在训练过程中, Fully NAT 模型通过条件独立性分解进行预测, 目标是最大化:
T ∑
L NAT = logP(y t |H ;θ ) (8)
t=1
其中, T 表示目标句子的长度. 训练过程中, T=M, M 为真实目标句子的长度, 而在推理过程中, T=P L (X), 由长度预
测模块 P L 决定. 与自回归模型相比, NAT 模型省略了条件词元 y<t, 从而允许并行翻译, 并加速推理过程. 其中, H
的计算方式如下:
H = f 2 (emb(X)) (9)
其中, f 2 是复制函数, H 是经过 emb( ·) 处理后的词元通过 UniformCopy 或 SoftCopy [22] 获得的嵌入矩阵. 这些嵌入
随后作为 SynNAT 模型解码器的输入.
我们的 SynNAT 采用与 GLAT [29] 相同的解码器. GLAT 仅改变了训练过程, 推理过程保持完全并行, 并只需一
次解码. GLAT 与标准 NAT 的区别在于, GLAT 在训练过程中使用扫视语言模型 (glancing language model, GLM),
显式地鼓励词元间的相互依赖. 为了实现自适应扫视采样, GLM 在训练过程中进行两次解码. 第 1 次解码类似于
标准的 NAT, 用于评估预测准确性, 以判断当前参考词是否难以拟合. 在第 2 次解码时, GLM 基于第 1 次解码进
行扫视采样, 以获得采样的参考词元, 并将这些参考词元提前透露给解码器, 学习预测剩余的未采样词元. 需要注
意的是, 只有第 2 次解码会更新模型参数. GLAT 只修改训练过程, 其推理过程完全并行, 且仅需 1 次解码. 它的目
标是最大化以下目标:
( ( ) )
∑ ⌢
L GLM = logP y t |GS Y,Y ,X;θ (10)
( )
⌢
y t ∈GS Y,Y
( )
( ⌢ ) ⌢
其中, y t ∈ GS Y,Y 表示未被选中的词元, 扫视采样策略 GS Y,Y 通过将初始预测与真实标签进行比较, 从目标句
子中选择词元. 如果网络的初始预测不够准确, 它将选择更多的词元, 并在第 2 次解码时将它们输入解码器. 扫视
采样可以分为两个步骤: 首先确定样本的数量 S, 然后从参考句子 Y 中随机选择 S 个词元. 对于给定的输入 X 的预
( )
⌢ ⌢
测句子 Y 和参考句子 Y, 扫视采样函数 GS Y,Y 的目标是从 Y 中获得一个子集, 该子集由从 Y 中采样的词元组成:
( ) ( ( ))
⌢ ⌢
GS Y,Y = Random Y,S Y,Y (11)
其中, Random(Y, S) 表示从目标句子 Y 中随机选择 S 个词元, 该 S 值的确定采用了与 GLAT [29] 描述的相同策略, 是
( ) ( )
⌢ ⌢ ⌢
通过比较 Y 和 Y 之间的差异来计算得到的, 公式为: S Y,Y = λ·d Y,Y . 采样比例 λ∈[0, 1] 是一个超参数, 用于灵
( )
⌢ ⌢ [52]
活地控制采样词元的数量. d Y,Y 是衡量 Y 和 Y 之间差异的度量. 我们采用了汉明距离 作为度量方法, 计算公
( ) ( ) ( )
⌢ ∑ T ⌢
式为: d Y,Y = y t , ˆy t . 通过 d Y,Y , 可以根据当前训练模型的预测能力自适应地决定采样数量.
t=1
3 实 验
3.1 数据集
我们在 5 个常用的机器翻译基准数据集上评估了 SynNAT 模型, 包括 WMT14 EN↔DE、WMT16 En↔RO
以及 IWSLT14 DE→EN, 数据集大小及划分见表 1. 在处理 WMT14 EN↔DE 数据集时, 我们遵循了文献 [1] 中详

