Page 295 - 《软件学报》2026年第2期
P. 295

774                                                        软件学报  2026  年第  37  卷第  2  期


                                                               (      )
                                                   H sen-syn = SynEnc H , A,e                        (13)
                                                                 L 1

                                                         (               )
                                               H syn-sen = Enc SynEnc(emb(X), A,e)                   (14)
                  4.6   融合因子  β  的影响
                    在我们的方法中, 融合因子         β  用于平衡源句嵌入和依存句法信息嵌入的权重. 在蒸馏的                 IWSLT14 DE→EN  验
                 证集上, 我们对    β  进行了网格搜索    (范围  0.1–0.9, 步长  0.1) 确定  β  的最优值. 实验结果见表  6, β=0.5  时模型在验证
                 集中达到最优性能       (BLEU=32.96), 显著优于其他设置      (如  β=0.2  时  BLEU=32.04, β=0.7  时  BLEU=30.96). 过低
                 (β<0.3) 或过高  (β>0.6) 的  β  值均会导致性能下降, 说明句法信息与语义信息的平衡对模型至关重要. 具体而言, β
                 过低时模型难以捕捉长距离依存关系, 而             β 过高时则可能过度依赖句法结构, 忽略语义上下文.

                                 表 6 蒸馏的    IWSLT14 DE→EN  验证集上   β 对  BLEU  的影响  (beam=5)

                             β     0.1    0.2    0.3    0.4    0.5    0.6    0.7    0.8    0.9
                           BLEU    31.97  32.04  32.55  32.87  32.96  32.90  30.96  30.79  30.20

                  4.7   与自回归模型结合的可行性
                    我们将   Syntax Encoder 与  AT  模型  (Transformer-base ) 结合, 使用蒸馏的  IWSLT14 DE→EN  训练集训练后,
                                                             [1]
                 发现在测试集上      BLEU  提升幅度   (+0.57) 显著低于其在   NAT  中的表现  (+1.1), 见表  7. 证明句法信息对非自回归场
                 景增益更显著. 我们猜测原因有: (1) AT       通过自回归生成天然建模了目标端依赖关系, 其性能瓶颈更多在于源端语
                 义理解而非句法建模. (2) Fully NAT    因完全并行解码, 无法显式捕捉目标端依赖, 因此更依赖源端提供的结构化信
                 息  (如句法) 补偿这一缺陷. 我们方法在         AR  模型中依然带来了性能提升, 说明其作用机制不仅适用于                  NAT  模型,
                 也从更普适的层面增强了源语言结构的表示与理解能力, 具有较强的通用性.

                             表 7 蒸馏的    IWSLT14 DE→EN  训练集上    Syntax+AT  对  BLEU  的影响  (beam=5)

                                模型              BLEU                模型                BLEU
                                GLAT             31.82          Transformer-base      34.69
                               SynNAT            32.92          +Syntax Encoder       35.26

                  4.8   不同距离度量方式的影响

                    本文使用了与      GLAT  相同距离度量的计算方式, 采用了汉明距离作为评估模型初始输出与参考目标序列之
                 间差异的度量标准. 此外, 我们也认识到, 除了汉明距离外, 还有其他度量方法也适用于评估序列间的差异, 例如

                 Levenshtein  距离  (编辑距离) [79] , 计算将一个序列转换为另一个序列所需的最小编辑操作次数, 包括插入、删除和
                 替换. Damerau-Levenshtein  距离  [80] , 在  Levenshtein  距离的基础上, 增加了交换相邻字符的操作. 因此我们对这      3
                 种距离度量方式做了相关消融实验, 结果如表                 8  所示. 不同的距离度量方式对        BLEU  分数的影响较小, 其中
                 Damerau-Levenshtein  距离的  BLEU  最高  (32.95), 略高于汉明距离  (32.92), 而  Levenshtein  距离的  BLEU  略低
                 (32.88). 这一结果表明, 考虑额外的编辑操作        (字符交换) 可能对翻译质量有所帮助, 但整体影响较为有限.

                          表 8 蒸馏的    IWSLT14 DE→EN  测试集上不同的距离度量方式对           BLEU  的影响  (beam=5)

                                          度量方式                                BLEU
                                          汉明距离                                 32.92
                                        Levenshtein距离                          32.88
                                     Damerau-Levenshtein距离                     32.95

                  4.9   对源语言的句法建模深入探讨

                    本文以具体示例探讨为何对源端句法的建模能够提升目标端句法的正确性. 以蒸馏的                             IWSLT14 DE→EN  测
   290   291   292   293   294   295   296   297   298   299   300