Page 269 - 《软件学报》2026年第5期
P. 269
2148 软件学报 2026 年第 37 卷第 5 期
250
0.5 Simple average Simple average
Without PSM 200 Without PSM
0.4 With PSM With PSM
PEA 0.3 PEDA 150
0.2 100
0.1 50
0 0
0 5 10 15 20 25 30 0 5 10 15 20 25 30
总成本大小 总成本大小
(a) 各基线方法性能期望预测准确率对比 (b) 各基线方法性能期望差值预测准确率对比
图 14 代码生成任务中模型选择方法对模型性能期望预测准确率的影响
3.5 有效性威胁
本实验可能存在的有效性威胁包括以下几种.
1) 本文仅在单纯的大模型上进行了实验, CodeLLMTuner 的泛化能力在与 RAG、思维链等技术结合后的模
型上可能有限. 对于会影响参数空间的优化方法, CodeLLMTuner 效果有限, 但该方法可以与任意不会影响参数空
间的优化方法相结合.
2) 本文所使用的性能评价指标仅限于自动化评估指标 (如 BLEU), 当使用人工审查作为性能评估方法时, 参
数调优效果可能因人工干扰而受限.
3) 尽管本文使用的数据集是广泛使用的基准评测集, 但仍可能存在数据泄露的风险, 即大模型在预训练阶段
已经接触过部分数据. 这可能导致实验结果高估模型性能. 然而, 即使存在数据泄露的可能性, CodeLLMTuner 与
基线模型的对比仍然具有意义, 因为所有基线方法都是在相同的候选模型上进行参数调优.
4) 实验结果的复现可能受到实验环境 (如硬件配置、软件版本等) 的影响, 导致不同环境下的性能差异.
3.6 局限性
然而, CodeLLMTuner 依然存在部分局限性, 主要包括以下几点.
1) CodeLLMTuner 采用倾向评分匹配算法筛选最优模型, 该算法的应用前提是候选模型的参数空间必须完全
一致. 鉴于当前主流代码大模型 (如 DeepSeekCoder 等) 的解码参数空间具有一致性, CodeLLMTuner 的模型选择
机制具备良好的泛化能力. 然而, 随着代码大模型的发展, 许多任务的 SOTA 效果往往是通过将基础大模型与 RAG、
Agent 等优化技术相结合实现的, 这种结合可能导致模型参数空间发生变化. 在此情况下, CodeLLMTuner 的适用
性将受到限制. 因此, 本文的研究范围主要聚焦于基础大模型选择, 暂不涉及结合上述大模型优化技术的复合场
景, 未来工作中会考虑在上述结合不同大模型优化方法的场景下进行更全面的对比实验.
2) 模型选择基于期望性能, 无法保证找到最优解. CodeLLMTuner 选择性能期望最优的模型作为最终候选, 但
并不能确保该模型的最优参数在所有情况下都优于其他模型. 尽管本文在多个代码任务和数据集上进行了实验,
并取得了良好的效果, 但在某些性能分布特殊的任务中, 最高期望性能的模型可能无法达到其他模型的最优性能,
导致选择出的模型未必是全局最优的.
3) 采用机器学习方法训练的性能模型存在误差. 本文使用倾向评分匹配方法对齐不同分布的样本数据, 并以
此构建性能预测器, 用于预测各模型性能期望以选择最优模型, 然而性能模型可能难以准确预测模型性能, 导致选
择次优解.
4) 未来强大的通用代码大模型有可能不需要进行模型选择. 目前的实验结果表明, 没有任何单一代码大模型
能够在所有代码任务上全面胜出, 因此基于任务特性的模型选择是必要的. 然而, 如果未来出现一个在所有代码任
务上均表现卓越的通用代码大模型, CodeLLMTuner 的模型选择策略可能会失去其实际价值.

