Page 263 - 《软件学报》2026年第5期
P. 263

2142                                                       软件学报  2026  年第  37  卷第  5  期


                 原因在于该算法在成本较低时有可能选择次优模型导致性能波动, 而成本充足时能够稳定选择最优解, 致使方差
                 降低. 最后, AutoRAG-HP  与  EcoOptiGen  由于即使成本充足依然有概率选择次优解, 因此性能波动较为明显.

                    60                           85                           90
                                                 80
                    55                                                        85
                                                 75                           80
                    pass@1 (%)  50              pass@4 (%)  70               pass@10 (%)  75
                                                 65
                    45
                    40                           60                           70
                                                 55                           65
                    35                           50                           60
                      0   50  110  150  200  250   0   50  110  150  200  250   0   50  110  150  200  250
                              总成本大小                        总成本大小                        总成本大小
                        (a) pass@1 (HumanEval-70%)   (b) pass@4 (HumanEval-70%)   (c) pass@10 (HumanEval-70%)
                    65                           80                           95
                    60                           75                           90
                                                                              85
                    pass@1 (%)  50              pass@4 (%)  65               pass@10 (%)  80
                                                 70
                    55
                                                                              75
                                                 60
                    45
                    40                           55                           70
                                                                              65
                    35                           50                           60
                      0   50  110  150  200  250   0   50  110  150  200  250   0   50  110  150  200  250
                              总成本大小                        总成本大小                        总成本大小
                        (d) pass@1 (HumanEval-30%)   (e) pass@4 (HumanEval-30%)   (f) pass@10 (HumanEval-30%)
                             DivBO      EcoOptiGen     Transfer learning  AutoRAG-HP      CodeLLMTuner
                          图 7 各基线方法在      HumanEval-70%  和  HumanEval-30%  上所选择的最优模型与参数性能


                                            50
                                                    DivBO          CodeLLMTuner
                                                    EcoOptiGen     AutoRAG-HP
                                            40      Transfer learning
                                           pass@1 (%)  30


                                            20

                                            10

                                             0
                                              20  40   60  80  100  120  140  160
                                                          总成本大小
                                   图 8 各基线方法在      HumanEval-70%  上以  pass@1  为指标时的方差

                    ● 代码摘要任务
                    CodeXGLUE  提供了一个包括      23 007  个代码摘要任务的    Benchmark, 本文从中随机选择      1 000  项作为本实验
                 的  Benchmark、并将其以相同方法拆分为         CodeXGLUE-70%  与  CodeXGLUE-30%, 同时采用相同方法进行测试.
                 其结果如图    9  所示. 其中横轴表示总成本大小, 以采样次数进行衡量, 纵轴表示所选择的模型与参数在                         Benchmark
                 上的代码任务性能, 以      BLEU_i (i = 1, 2) 进行衡量.
                    随着成本增加, 各基线方法性能在           CodeXGLUE-70%  上大多有所提升; 在      CodeXGLUE-30%  上, 随着成本增
                 加, 各方法性能均会出现波动的情况, 其原因在于               CodeXGLUE-30%  与  CodeXGLUE-70%  的性能分布有所差异,
                 在  CodeXGLUE-70%  上性能更优的模型与参数在        CodeXGLUE-30%  上性能可能有所下降; 不管是在         CodeXGLUE-
   258   259   260   261   262   263   264   265   266   267   268