Page 293 - 《软件学报》2026年第2期
P. 293
772 软件学报 2026 年第 37 卷第 2 期
的比例都减少. 同时, 大模型 (GPT-4o-mini) 和人工 (human) 对译文歧义性的评分也随之降低, 表明在引入语法信
息后, 译文的歧义程度得到一定程度的改善, 但是没有完全消解译文的歧义现象.
表 4 原始 IWSLT14 DE→EN 测试集上 GLAT 及其加入 Syntax 对各指标的影响
原始数据 香农熵 重复率 (%) GPT-4o-mini评估 人工评估
GLAT 3.89 4.39 2.23 2.48
SynNAT 3.72 3.72 2.16 2.35
4.2 邻接矩阵与邻接标签嵌入的影响
我们在蒸馏后的 IWSLT14 DE→EN 数据集上测试了输入邻接矩阵、输出邻接矩阵与邻接标签嵌入对实验结
果的影响, 结果如表 5 所示. 可以看到, 我们的模型在 IWSLT DE→EN 数据集上的 BLEU 分数优于 GLAT. 具体而
言, 仅加入依存标签邻接矩阵 (w/probs) 嵌入的模型相比原始 GLAT 提高了 0.83 个 BLEU 分数; 加入依存输入邻
接矩阵 (in_arc) 和依存输出邻接矩阵 (out_arc) 模型相比原始 GLAT 提高了 0.95 个 BLEU 分数. 结合依存输入邻
接矩阵、依存输出邻接矩阵以及依存标签邻接矩阵的模型, 相较于原始 GLAT, 取得了最高的 BLEU 分数提升.
表 5 邻接矩阵与邻接标签嵌入的影响
模型 BLEU
GLAT 31.82
SynNAT 32.92
w/ in_arc & probs 32.9
w/ out_arc & probs 32.74
w/ probs 32.65
w/ in_arc & out_arc 32.77
4.3 源句子长度的影响
我们还探讨了句子长度对模型的影响, 将蒸馏后的 IWSLT14 DE→EN 测试集中源句子按 BPE 操作后的长度
分为 5 个区间, 并计算每个区间的 BLEU 分数. 如图 4 所示, 我们的模型在每个区间的表现均优于对应的基线模
型. 当源句子长度位于 [0, 10) 范围内时, SynNAT 实现了显著的提升. 因此, 我们的模型在不同句子长度的场景中
均能提升性能.
50
GLAT
SynNAT
45
40
BLEU
35
30
25
[0, 10) [10, 20) [20, 30) [30, 40) [40, inf)
图 4 在 IWSLT14 DE→EN 任务中不同源句子长度在 beam=5 时的 BLEU 分数

