Page 295 - 《软件学报》2026年第2期
P. 295
774 软件学报 2026 年第 37 卷第 2 期
( )
H sen-syn = SynEnc H , A,e (13)
L 1
( )
H syn-sen = Enc SynEnc(emb(X), A,e) (14)
4.6 融合因子 β 的影响
在我们的方法中, 融合因子 β 用于平衡源句嵌入和依存句法信息嵌入的权重. 在蒸馏的 IWSLT14 DE→EN 验
证集上, 我们对 β 进行了网格搜索 (范围 0.1–0.9, 步长 0.1) 确定 β 的最优值. 实验结果见表 6, β=0.5 时模型在验证
集中达到最优性能 (BLEU=32.96), 显著优于其他设置 (如 β=0.2 时 BLEU=32.04, β=0.7 时 BLEU=30.96). 过低
(β<0.3) 或过高 (β>0.6) 的 β 值均会导致性能下降, 说明句法信息与语义信息的平衡对模型至关重要. 具体而言, β
过低时模型难以捕捉长距离依存关系, 而 β 过高时则可能过度依赖句法结构, 忽略语义上下文.
表 6 蒸馏的 IWSLT14 DE→EN 验证集上 β 对 BLEU 的影响 (beam=5)
β 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9
BLEU 31.97 32.04 32.55 32.87 32.96 32.90 30.96 30.79 30.20
4.7 与自回归模型结合的可行性
我们将 Syntax Encoder 与 AT 模型 (Transformer-base ) 结合, 使用蒸馏的 IWSLT14 DE→EN 训练集训练后,
[1]
发现在测试集上 BLEU 提升幅度 (+0.57) 显著低于其在 NAT 中的表现 (+1.1), 见表 7. 证明句法信息对非自回归场
景增益更显著. 我们猜测原因有: (1) AT 通过自回归生成天然建模了目标端依赖关系, 其性能瓶颈更多在于源端语
义理解而非句法建模. (2) Fully NAT 因完全并行解码, 无法显式捕捉目标端依赖, 因此更依赖源端提供的结构化信
息 (如句法) 补偿这一缺陷. 我们方法在 AR 模型中依然带来了性能提升, 说明其作用机制不仅适用于 NAT 模型,
也从更普适的层面增强了源语言结构的表示与理解能力, 具有较强的通用性.
表 7 蒸馏的 IWSLT14 DE→EN 训练集上 Syntax+AT 对 BLEU 的影响 (beam=5)
模型 BLEU 模型 BLEU
GLAT 31.82 Transformer-base 34.69
SynNAT 32.92 +Syntax Encoder 35.26
4.8 不同距离度量方式的影响
本文使用了与 GLAT 相同距离度量的计算方式, 采用了汉明距离作为评估模型初始输出与参考目标序列之
间差异的度量标准. 此外, 我们也认识到, 除了汉明距离外, 还有其他度量方法也适用于评估序列间的差异, 例如
Levenshtein 距离 (编辑距离) [79] , 计算将一个序列转换为另一个序列所需的最小编辑操作次数, 包括插入、删除和
替换. Damerau-Levenshtein 距离 [80] , 在 Levenshtein 距离的基础上, 增加了交换相邻字符的操作. 因此我们对这 3
种距离度量方式做了相关消融实验, 结果如表 8 所示. 不同的距离度量方式对 BLEU 分数的影响较小, 其中
Damerau-Levenshtein 距离的 BLEU 最高 (32.95), 略高于汉明距离 (32.92), 而 Levenshtein 距离的 BLEU 略低
(32.88). 这一结果表明, 考虑额外的编辑操作 (字符交换) 可能对翻译质量有所帮助, 但整体影响较为有限.
表 8 蒸馏的 IWSLT14 DE→EN 测试集上不同的距离度量方式对 BLEU 的影响 (beam=5)
度量方式 BLEU
汉明距离 32.92
Levenshtein距离 32.88
Damerau-Levenshtein距离 32.95
4.9 对源语言的句法建模深入探讨
本文以具体示例探讨为何对源端句法的建模能够提升目标端句法的正确性. 以蒸馏的 IWSLT14 DE→EN 测

