Page 304 - 《软件学报》2026年第2期
P. 304
张建新 等: 依存句法信息增强的完全非自回归翻译 783
我们使用 Fleiss’ Kappa [85] 来评估 3 位标注员对 200 条翻译数据的一致性, 计算结果为 0.64. 这一数值表明标
注人员之间具有较高的一致性 [86] , 说明标注质量较为可靠.
A.3 LLM 标注歧义方法
在本文中, 我们运用了大语言模型 GPT-4o-mini 来评估句子翻译的歧义性, 以缓解人工标注的主观偏差. 与人
工标注的区别是, 我们要求 LLM 对源文本充分参考, 此外人工标注给定的是一个综合评分, 而 LLM 被要求在“词
义、结构、指代”这 3 个维度分别进行评估. 我们对原始的 IWSLT14 DE→EN 测试集中的所有句子进行标注, 并
向大语言模型提供了提示, 如图 A1 所示. 我们将模型测得的评分首先在句子层面将词义、结构、指代这 3 个维
度的评分求平均, 得到每个句子的综合分数; 随后, 再对所有句子的综合分数进行平均, 得到整份测试集的最终平均
评分.
LLM-based prompt template for ambiguity detection
图 A1 译文歧义性评估提示
作者简介
张建新, 博士生, 主要研究领域为自然语言处理, 大模型应用, 非自回归生成, 机器翻译.
郭沛, 硕士生, 主要研究领域为自然语言处理, 大模型应用, 非自回归生成, 机器翻译.
李俊涛, 博士, 副教授, CCF 专业会员, 主要研究领域为自然语言处理, 大语言模型.
张民, 博士, 博士生导师, CCF 高级会员, 主要研究领域为自然语言处理, 机器翻译, 人工智能.

