Page 236 - 《软件学报》2026年第6期
P. 236

吴俊儒 等: 基于协作关系的模型动态路由                                                            2555


                 上的表现. 本文利用数据集自带的基于            InternLM-chat-7B  的评分分类器计算相应指标, 第     4.5  节介绍了无害率以及
                 无害分数的具体评分细节.
                    (4) CaLM Lite  [51] : CaLM Lite 用于语言模型因果推理能力评估, 包含   920  个项目, 其建立了一个由      4  个模块组
                 成的基础分类法: 因果目标        (即评估什么)、适应性       (即如何获得结果)、度量        (即如何测量结果) 和错误       (即如何分
                 析不良结果) 来对模型性能进行分析, 其具体形式为选择、判断以及概率计算题. CaLM Lite 的评估指标为准确率,
                 即题目正确回答次数与所有回答次数之比.
                                                                                           N  次寻路”表示除
                    此外, 各数据集实验结果涵盖本方法路由情况分析. “单模型”表示只有特定模型回复任务; “
                 初始模型节点之外, 本方法还需进行           N  次节点的寻找    ( N  跳), 总路径上共有  N +1 个节点.
                  4.2   实验参数
                    本文在互评量化机制中, 设定         3  个等级  (A、B、C), 对  FewCLUE  数据集进行模型互评, 其余数据集则用于测

                 试路由表现. 设置分数区间划分参数           d 1 = 50、候选模型集划分参数      d 2 = 50 以及寻路次数上限   α = 3.
                    参与实验的模型分别为, Baichuan2-7B (Baichuan)、Qwen-Plus (Qwen)、ERNIE-3.5-8K (ERNIE) 以及
                 DeepSeek-R1-Distill-Qwen-7B (DS-Qwen). 不同模型受参数规模、训练数据等因素影响, 性能各不相同. 表             2  展示
                                        {question} 为数据集给定的任务,   {answer} 为模型的回复.
                 了路由算法所用提示词, 其中

                                                      表 2 提示词说明

                   提示词用途                                       提示词内容
                              这是任务:   {question}, 这是某个模型有关分类及其解释的回答:      {answer}. 它的回答可能不正确, 但请你作为
                    模型互评      一个通用领域的专家, 在目前有A, B, C三个评分等级的情况下, 为这个回答评级. 请你仅回答等级, 而不输出
                              其他任何信息.
                 动态协作路由算法 这是问题:       {question}, 这是回答:  {answer}. 请你作为一个通用领域的专家, 告诉我回答是否令你满意. 你只需
                  第1阶段提示词     要回复我认可或者不认可, 不需要输出其他任何内容.
                 动态协作路由算法 这是问题:       {question}, 这是回答:  {answer}. 请你作为一个通用领域的专家, 结合你自己的理解优化该回答. 你
                  第2阶段提示词     只需要按照问题中对回复的格式要求输出并优化回复, 不需要输出其他任何内容.

                  4.3   模型互评结果
                    评分结果如图      3  所示. 高得分模型为: Qwen    和  ERNIE, 高评分模型为: Baichuan  和  DS-Qwen. 进一步可得低
                 评分且高得分的模型为        ERNIE  和  Qwen; 高评分且高得分的模型暂无; 高评分且低得分的模型为                Baichuan  和  DS-

                 Qwen; 低评分且低得分的模型暂无. 如果          d 1  的数值进一步缩小, 则    DS-Qwen  可以归类为低评分且低得分的模型.
                 如果  d 1  的数值进一步增大, 则   Baichuan  可以归类为高评分且高得分模型. 进一步, 可以认为有              4  种模型协作组合:
                 (1) Qwen   → ERNIE; (2) ERNIE  → Qwen; (3) Baichuan  → ERNIE; (4) DS-Qwen  → ERNIE, Qwen.

                                              Qwen        2.4   2.6   1.9
                                                                            2.6

                                                                            2.4
                                            Baichuan  2.6       2.8   2.6
                                           评价模型                             2.2  分数
                                             ERNIE
                                                                      1.7
                                                          2.2
                                                    2.5
                                                                            2.0
                                            DS-Qwen  2.4  2.2   2.5         1.8
                                                    Qwen Baichuan  ERNIE DS-Qwen
                                                          被评价模型
                                                     图 3 模型互评结果
   231   232   233   234   235   236   237   238   239   240   241