Page 263 - 《软件学报》2026年第5期
P. 263
2142 软件学报 2026 年第 37 卷第 5 期
原因在于该算法在成本较低时有可能选择次优模型导致性能波动, 而成本充足时能够稳定选择最优解, 致使方差
降低. 最后, AutoRAG-HP 与 EcoOptiGen 由于即使成本充足依然有概率选择次优解, 因此性能波动较为明显.
60 85 90
80
55 85
75 80
pass@1 (%) 50 pass@4 (%) 70 pass@10 (%) 75
65
45
40 60 70
55 65
35 50 60
0 50 110 150 200 250 0 50 110 150 200 250 0 50 110 150 200 250
总成本大小 总成本大小 总成本大小
(a) pass@1 (HumanEval-70%) (b) pass@4 (HumanEval-70%) (c) pass@10 (HumanEval-70%)
65 80 95
60 75 90
85
pass@1 (%) 50 pass@4 (%) 65 pass@10 (%) 80
70
55
75
60
45
40 55 70
65
35 50 60
0 50 110 150 200 250 0 50 110 150 200 250 0 50 110 150 200 250
总成本大小 总成本大小 总成本大小
(d) pass@1 (HumanEval-30%) (e) pass@4 (HumanEval-30%) (f) pass@10 (HumanEval-30%)
DivBO EcoOptiGen Transfer learning AutoRAG-HP CodeLLMTuner
图 7 各基线方法在 HumanEval-70% 和 HumanEval-30% 上所选择的最优模型与参数性能
50
DivBO CodeLLMTuner
EcoOptiGen AutoRAG-HP
40 Transfer learning
pass@1 (%) 30
20
10
0
20 40 60 80 100 120 140 160
总成本大小
图 8 各基线方法在 HumanEval-70% 上以 pass@1 为指标时的方差
● 代码摘要任务
CodeXGLUE 提供了一个包括 23 007 个代码摘要任务的 Benchmark, 本文从中随机选择 1 000 项作为本实验
的 Benchmark、并将其以相同方法拆分为 CodeXGLUE-70% 与 CodeXGLUE-30%, 同时采用相同方法进行测试.
其结果如图 9 所示. 其中横轴表示总成本大小, 以采样次数进行衡量, 纵轴表示所选择的模型与参数在 Benchmark
上的代码任务性能, 以 BLEU_i (i = 1, 2) 进行衡量.
随着成本增加, 各基线方法性能在 CodeXGLUE-70% 上大多有所提升; 在 CodeXGLUE-30% 上, 随着成本增
加, 各方法性能均会出现波动的情况, 其原因在于 CodeXGLUE-30% 与 CodeXGLUE-70% 的性能分布有所差异,
在 CodeXGLUE-70% 上性能更优的模型与参数在 CodeXGLUE-30% 上性能可能有所下降; 不管是在 CodeXGLUE-

