Page 254 - 《软件学报》2026年第5期
P. 254

曲慕子 等: CodeLLMTuner: 基于样本重用的代码大模型选择与解码参数调优框架                                    2133


                    目前解决此类问题的常用方法是分为模型选择与参数调优两个阶段, 如图                         1  所示. 为了计算模型在整个参数
                 配置空间中的性能期望以表征模型性能, 模型选择策略通常使用梯度采样或随机采样的方式在不同模型上收集分
                 布相同的样本数据; 为尽可能快地确定最优参数, 参数调优策略通常采用如贝叶斯优化的非随机采样策略收集样
                 本数据, 这些样本数据在不同模型上的分布不同. 不同采样策略得到的样本数据概率空间分布不同, 导致模型选择
                 与参数调优两阶段无法实现数据共享, 均需要大量样本并进行模型的性能评估.

                                          参数调优算法                                     获选参数
                                          (如贝叶斯优化)     样本数据

                                                              无法
                                                              重用
                           LLM 1

                                                                       性能期望          获选模型
                                           梯度采样或       样本数据
                                          随机采样策略
                                                     (a) 组合方法流程示意图

                                                                  数据     获选模型
                                       参数调优算法                     重用     样本数据            获选参数
                                      (如贝叶斯优化)       样本数据
                           LLM 1
                                         基于倾向评分
                                         对齐采样数据

                                           性能预测器           性能期望          获选模型

                                                   (b) CodeLLMTuner流程示意图
                                        图 1 组合方法与     CodeLLMTuner 方法的流程示意图

                    当前代码大模型都采用         Transformer 类架构, 因此不同的代码大模型有着基本相同的解码参数空间; 而倾向评
                 分匹配   (propensity score matching, PSM) 算法对有相同参数空间的样本, 可以通过加权调整的方式来对齐不同分
                 布的样本数据. 因此, 本文引入        PSM  算法, 将参数调优策略所收集的跨模型异分布样本数据转化为模型选择策略
                 所需要的跨模型同分布样本数据, 以实现不同阶段之间的样本重用并降低计算成本. 基于此, 本文提出了基于倾向
                 评分匹配   (PSM) 方法的代码大模型选择与参数调优框架              CodeLLMTuner, 该框架将代码大模型选择与参数调优过
                 程分为   3  个阶段: (1) 独立采样阶段, CodeLLMTuner 在每个代码大模型上并行执行解码参数调优                 (如贝叶斯优化)
                 以收集样本数据; (2) 在模型选择阶段, 利用          PSM  技术对齐不同模型的样本数据, 通过多任务学习训练性能预测器
                 以计算每个模型的性能期望, 从中选出性能期望最优的候选模型; (3) 获选模型的解码参数调优阶段, CodeLLMTuner
                 重用获选模型在第       1  阶段的样本数据, 并在其基础上继续进行调优, 不仅充分探索性能空间, 还能显著降低采样成
                 本. CodeLLMTuner 作为一个可扩展的框架, 能够集成多种参数调优策略和模型选择方法, 包括贝叶斯优化和拉丁
                 超立方采样方法.
                    综上所述, 本文的贡献如下.
                    ● 设计了一个可扩展的代码大模型选择与参数调优框架                   CodeLLMTuner, 包括独立采样、模型选择与获选模
                 型解码参数调优这       3  个阶段, 有效复用第    1  阶段样本评估数据, 在有限成本下为性能空间探索分配更多资源, 并支
                 持集成多种参数调优策略和模型选择方法.
                    ● 提出了一种基于倾向评分算法的不同代码大模型不同分布的样本评估数据的对齐方法, 采用多任务学习方
                 法分别对倾向评分预测与性能预测两任务进行训练, 以此构建代码大模型的性能期望预测器, 从而复用第                                  1  阶段
                 样本评估数据选出候选模型.
   249   250   251   252   253   254   255   256   257   258   259