Page 196 - 《软件学报》2026年第2期
P. 196
张育博 等: 基于依赖感知分层神经网络的代码注释增强方法 675
Python dataset Java dataset Go dataset
5.0
4.5
人工评估得分 3.5
4.0
3.0
2.5
2.0
DHCS RoBERTa CodeBERT UniXcoder CodeT5 CodeT5+ StarCoder EACS
NeuralCodeSum GPT-3.5-turbo
图 4 3 种数据集上的人工评估结果
Python dataset Java dataset Go dataset Python dataset Java dataset Go dataset
5.0 5.0
4.5 4.5
人工评估得分 3.5 人工评估得分 3.5
4.0
4.0
3.0
3.0
2.5
2.5
2.0
1.5 2.0
1.5
1.0 EACS 1.0 EACS
GPT-3.5-turbo
DHCS
DHCS
NeuralCodeSum RoBERTa CodeBERT UniXcoder CodeT5 CodeT5+ StarCoder NeuralCodeSum RoBERTa CodeBERT UniXcoder CodeT5 GPT-3.5-turbo CodeT5+ StarCoder
(a) 人工评估结果流畅性 (b) 人工评估结果准确性
Python dataset Java dataset Go dataset Python dataset Java dataset Go dataset
5.0 5.5
4.5 5.0
4.5
人工评估得分 3.5 人工评估得分 4.0
4.0
3.5
3.0
3.0
2.5
2.5
2.0
1.5 2.0
1.5
1.0 1.0
NeuralCodeSum RoBERTa CodeBERT UniXcoder CodeT5 CodeT5+ StarCoder EACS DHCS RoBERTa CodeBERT UniXcoder CodeT5 GPT-3.5-turbo CodeT5+ StarCoder EACS
NeuralCodeSum
DHCS
GPT-3.5-turbo
(c) 人工评估结果完整性 (d) 人工评估结果简洁性
Python dataset Java dataset Go dataset
5.5
5.0
4.5
人工评估得分 4.0
3.5
3.0
2.5
2.0
1.5
1.0
NeuralCodeSum GPT-3.5-turbo
DHCS RoBERTa CodeBERT UniXcoder CodeT5 CodeT5+ StarCoder EACS
(e) 人工评估结果风格匹配
图 5 3 种数据集上 5 种指标的人工评估结果
从图 5 中可以观察到, 基于大型语言模型的方法表现不如预期, 与 CodeT5、CodeT5+和 EACS 相比稍有不足,
这是因为生成的注释与参考的注释之间存在不一致的问题. 相比之下, 本文方法在人工评估中获得了最高的分数,

