Page 196 - 《软件学报》2026年第2期
P. 196

张育博 等: 基于依赖感知分层神经网络的代码注释增强方法                                                     675



                                                 Python dataset  Java dataset  Go dataset
                                      5.0
                                      4.5
                                    人工评估得分  3.5
                                      4.0


                                      3.0
                                      2.5
                                      2.0
                                         DHCS    RoBERTa CodeBERT UniXcoder  CodeT5  CodeT5+ StarCoder  EACS
                                         NeuralCodeSum           GPT-3.5-turbo



                                               图 4 3  种数据集上的人工评估结果

                            Python dataset  Java dataset  Go dataset  Python dataset  Java dataset  Go dataset
                      5.0                                       5.0
                      4.5                                       4.5
                     人工评估得分  3.5                               人工评估得分  3.5
                      4.0
                                                                4.0
                      3.0
                                                                3.0
                                                                2.5
                      2.5
                      2.0
                      1.5                                       2.0
                                                                1.5
                      1.0                               EACS    1.0                               EACS
                                           GPT-3.5-turbo
                                                                   DHCS
                          DHCS
                         NeuralCodeSum RoBERTa CodeBERT UniXcoder  CodeT5  CodeT5+ StarCoder  NeuralCodeSum RoBERTa CodeBERT UniXcoder  CodeT5 GPT-3.5-turbo  CodeT5+ StarCoder
                                   (a) 人工评估结果流畅性                             (b) 人工评估结果准确性
                            Python dataset  Java dataset  Go dataset  Python dataset  Java dataset  Go dataset
                      5.0                                       5.5
                      4.5                                       5.0
                                                                4.5
                     人工评估得分  3.5                               人工评估得分  4.0
                      4.0
                                                                3.5
                      3.0
                                                                3.0
                      2.5
                                                                2.5
                      2.0
                      1.5                                       2.0
                                                                1.5
                      1.0                                       1.0
                         NeuralCodeSum RoBERTa CodeBERT UniXcoder  CodeT5  CodeT5+ StarCoder  EACS  DHCS  RoBERTa CodeBERT UniXcoder  CodeT5 GPT-3.5-turbo  CodeT5+ StarCoder  EACS
                                                                   NeuralCodeSum
                          DHCS
                                           GPT-3.5-turbo
                                   (c) 人工评估结果完整性                             (d) 人工评估结果简洁性
                                                 Python dataset  Java dataset  Go dataset
                                           5.5
                                           5.0
                                           4.5
                                          人工评估得分  4.0
                                           3.5
                                           3.0
                                           2.5
                                           2.0
                                           1.5
                                           1.0
                                               NeuralCodeSum    GPT-3.5-turbo
                                               DHCS  RoBERTa CodeBERT UniXcoder  CodeT5  CodeT5+ StarCoder  EACS
                                                       (e) 人工评估结果风格匹配
                                           图 5 3  种数据集上    5  种指标的人工评估结果

                    从图  5  中可以观察到, 基于大型语言模型的方法表现不如预期, 与                CodeT5、CodeT5+和  EACS  相比稍有不足,
                 这是因为生成的注释与参考的注释之间存在不一致的问题. 相比之下, 本文方法在人工评估中获得了最高的分数,
   191   192   193   194   195   196   197   198   199   200   201