Page 293 - 《软件学报》2026年第2期
P. 293

772                                                        软件学报  2026  年第  37  卷第  2  期


                 的比例都减少. 同时, 大模型       (GPT-4o-mini) 和人工  (human) 对译文歧义性的评分也随之降低, 表明在引入语法信
                 息后, 译文的歧义程度得到一定程度的改善, 但是没有完全消解译文的歧义现象.


                             表 4 原始 IWSLT14 DE→EN    测试集上    GLAT  及其加入   Syntax  对各指标的影响

                             原始数据         香农熵         重复率 (%)       GPT-4o-mini评估     人工评估
                              GLAT         3.89          4.39           2.23            2.48
                             SynNAT        3.72          3.72           2.16            2.35

                  4.2   邻接矩阵与邻接标签嵌入的影响
                    我们在蒸馏后的      IWSLT14 DE→EN  数据集上测试了输入邻接矩阵、输出邻接矩阵与邻接标签嵌入对实验结
                 果的影响, 结果如表      5  所示. 可以看到, 我们的模型在      IWSLT DE→EN  数据集上的    BLEU  分数优于   GLAT. 具体而
                 言, 仅加入依存标签邻接矩阵         (w/probs) 嵌入的模型相比原始     GLAT  提高了   0.83  个  BLEU  分数; 加入依存输入邻
                 接矩阵   (in_arc) 和依存输出邻接矩阵     (out_arc) 模型相比原始  GLAT  提高了   0.95  个  BLEU  分数. 结合依存输入邻
                 接矩阵、依存输出邻接矩阵以及依存标签邻接矩阵的模型, 相较于原始                       GLAT, 取得了最高的     BLEU  分数提升.

                                             表 5 邻接矩阵与邻接标签嵌入的影响

                                                  模型                   BLEU
                                                 GLAT                  31.82
                                                SynNAT                 32.92
                                             w/ in_arc & probs          32.9
                                             w/ out_arc & probs        32.74
                                                w/ probs               32.65
                                             w/ in_arc & out_arc       32.77

                  4.3   源句子长度的影响
                    我们还探讨了句子长度对模型的影响, 将蒸馏后的                 IWSLT14 DE→EN  测试集中源句子按       BPE  操作后的长度
                 分为  5  个区间, 并计算每个区间的       BLEU  分数. 如图  4  所示, 我们的模型在每个区间的表现均优于对应的基线模
                 型. 当源句子长度位于       [0, 10) 范围内时, SynNAT  实现了显著的提升. 因此, 我们的模型在不同句子长度的场景中
                 均能提升性能.


                                             50
                                                                         GLAT
                                                                         SynNAT
                                             45


                                             40
                                            BLEU

                                             35

                                             30



                                             25
                                                [0, 10)  [10, 20)  [20, 30)  [30, 40) [40, inf)
                              图 4 在  IWSLT14 DE→EN  任务中不同源句子长度在         beam=5  时的  BLEU  分数
   288   289   290   291   292   293   294   295   296   297   298