Page 304 - 《软件学报》2026年第2期
P. 304

张建新 等: 依存句法信息增强的完全非自回归翻译                                                         783


                    我们使用    Fleiss’ Kappa [85] 来评估  3  位标注员对  200  条翻译数据的一致性, 计算结果为    0.64. 这一数值表明标
                 注人员之间具有较高的一致性          [86] , 说明标注质量较为可靠.
                  A.3    LLM 标注歧义方法
                    在本文中, 我们运用了大语言模型           GPT-4o-mini 来评估句子翻译的歧义性, 以缓解人工标注的主观偏差. 与人
                 工标注的区别是, 我们要求        LLM  对源文本充分参考, 此外人工标注给定的是一个综合评分, 而                  LLM  被要求在“词
                 义、结构、指代”这       3  个维度分别进行评估. 我们对原始的          IWSLT14 DE→EN  测试集中的所有句子进行标注, 并
                 向大语言模型提供了提示, 如图          A1  所示. 我们将模型测得的评分首先在句子层面将词义、结构、指代这                      3  个维
                 度的评分求平均, 得到每个句子的综合分数; 随后, 再对所有句子的综合分数进行平均, 得到整份测试集的最终平均
                 评分.

                               LLM-based prompt template for ambiguity detection







































                                                 图 A1 译文歧义性评估提示

                 作者简介
                 张建新, 博士生, 主要研究领域为自然语言处理, 大模型应用, 非自回归生成, 机器翻译.
                 郭沛, 硕士生, 主要研究领域为自然语言处理, 大模型应用, 非自回归生成, 机器翻译.
                 李俊涛, 博士, 副教授, CCF 专业会员, 主要研究领域为自然语言处理, 大语言模型.
                 张民, 博士, 博士生导师, CCF  高级会员, 主要研究领域为自然语言处理, 机器翻译, 人工智能.
   299   300   301   302   303   304   305   306   307   308   309