Page 268 - 《软件学报》2026年第5期
P. 268
曲慕子 等: CodeLLMTuner: 基于样本重用的代码大模型选择与解码参数调优框架 2147
100
90
80
pass@10 (%) 70
60
50
With random selection
40
With linear regression
30
With Bayes optimization
20
20 40 60 80 100 120 140 160 180 200
总成本大小
图 13 代码生成任务中参数调优方法对 CodeLLMTuner 性能的影响
由于 HumanEval-70% 与 HumanEval-30% 性能分布的差别, 随着成本的增加, 各对比方法均出现一定的性能
波动; 与贝叶斯优化相结合的性能明显优于以随机选择与线性回归作为参数调优方法的性能, 其原因在于贝叶斯
优化能更高效地探索配置空间.
● 模型选择方法对 CodeLLMTuner 性能的影响
考虑到 CodeLLMTuner 通过倾向评分估计方法使用模型间不同分布样本数据计算各模型性能期望来进行模
型选择, 本节对 CodeLLMTuner 进行性能期望预测的准确性进行测试. 本实验以代码生成作为目标任务, HumanEval
作为 Benchmark, pass@10 作为性能评价标准, 以 simple average、without PSM 和 with PSM 这 3 种方法作为对比
方法: 其中 simple average 直接计算样本数据性能平均值作为性能期望; without PSM 使用样本数据直接训练神经
网络, 并由此预测模型性能期望; 而 with PSM 在神经网络训练之前使用倾向评分估计对样本数据进行重加权处
理. 为比较不同方法在预测各代码大模型性能期望上的准确率, 本实验从模型的参数空间中遍历采样并评估
1 875 个参数配置以此计算各模型的真实性能期望, 然后使用性能期望预测准确率 (performance expectation accuracy,
PEA) 与性能期望差值预测准确率 (performance expectation difference accuracy, PEDA) 作为衡量模型选择方法准确
率的指标, 其公式如下所示:
1 ∑ |M| ( ) 2
PEA = Y i true −Y pred ,
|M| i=1 i
1 ∑ ( ) 2
|M|
PEDA = D true − D pred ,
|M|! i,j ij ij
其中, |M|为模型总数; Y pred 表示模型 i 的预测性能期望, D pred 表示模型 i、j 之间的预测性能期望差值, 由各基线算
i i j
法计算得出; Y true 表示模型 i 的真实性能期望, D true 表示模型 i、j 之间的真实性能期望差值, 由遍历采样样本数据
i i j
计算得出. 性能期望预测准确率 (PEA) 表征各基线方法在预测各代码大模型性能期望上的相对误差, 该指标越小
表示预测准确率越高; 而由于模型选择实际上是通过比较模型间性能差距实现的, 本实验还使用性能期望差值预
测准确率 (PEDA) 表征各基线方法在预测不同代码大模型之间性能期望差值上的相对误差, 指标越小表示预测准
确率越高. 本实验在多个模型中使用贝叶斯优化收集不同数量的样本数据, 然后使用各基线方法预测每个模型的
性能期望以计算比较预测准确率, 其结果如图 14 所示, X 轴表示总成本大小, Y 轴表示 PEA 和 PEDA 大小.
首先, 随着样本数据量的增加, 各个方法的性能期望预测准确率和性能期望差值预测准确率都有提升; 其次,
在预测性能期望时, simple average 的效果最差, 而 without PSM 与 with PSM 在部分情况下效果相近, 其原因在于,
CodeLLMTuner 仅是将不同分布的样本数据进行对齐, 但是并不保证对齐后的数据点满足随机分布或均匀分布,
因此在计算单一模型性能期望时难以体现性能优势. 但是在预测性能期望差值时, with PSM 相较其他方法有着明
显的性能优势, 其原因在于 with PSM 通过倾向评分算法对不同模型的样本数据进行了对齐, 此时引入的其他模型
的信息会提高预测的准确率, 即 CodeLLMTuner 相较其他方法更有可能预测出最佳模型.

