Page 240 - 《软件学报》2026年第6期
P. 240

吴俊儒 等: 基于协作关系的模型动态路由                                                            2559


                 动了  DS-Qwen  模型的回复准确率, 其最终值在         61.7%, 呈现出回复质量增益. 在      Route2  中, ERNIE  模型经优化后
                 准确率增长    2.5%, 逐步靠近   Qwen  模型. 通过  Route1  和  Route2  的优化, DS-Qwen  模型与  ERNIE  模型的回复准确
                 率进一步上升, 且两者差距进一步缩小. Route3          未能提高    DS-Qwen  模型的回复准确率, 主要原因在于         Baichuan  模
                 型自身准确率仅为       49.3%, 性能基准偏低. Route4  因采用随机路由方式, 导致路由缺乏针对性. Route4            虽也同时因
                 随机性缓冲了部分负向影响, 仍导致           ERNIE  模型准确率下降. 多个数据集表明, 模型串联存在             3  类性能演化, 即中
                 性态  (串联后性能与所参与单体模型持平), 增益态             (串联后性能超越所参与模型) 和衰减态            (串联后性能劣于所参
                 与单体模型). Route1  与  Route2  大部分处于中性态与增益态, 而       Route3  与  Route4  则主要处于衰减态.
                  4.6.2    路由情况
                    图  9  进一步对无害分数的路由参与情况进行统计, 单模型与                1  次寻路依然占据所有路由的主导地位. 相比于
                 其他数据集, 最大的变化一方面在于           Route3  中  Baichuan  模型参与程度明显上升, 但这一变化未带来正向增益, 反
                 而使得   DS-Qwen  的准确率下降了大约      6%. 另一方面, Route4  中路由组合变得多样化, 3      次寻路首次出现在       Route4
                 中. 由于  Baichuan  模型与  DS-Qwen  模型互不处于对方的可合作模型集中, 因此出现            3  次寻路是比较少见的情况.
                 最大原因可能在于       Baichuan  模型与  DS-Qwen  在该数据集上表现出较大的性能差异, 频繁产生“不认可”意见, 导
                 致路由次数攀升. 多次寻路以及性能差异因素未能弥补模型本身缺乏合作性的缺点, Route4                         的表现依然不理想. 综
                 合图  8  与图  9  的分析结果可知, 并非所有模型组合都能提升回复质量, 只有建立在可靠协作关系之上的组合才能
                 稳定带来能力增益; 反之, 不可靠的协作反而导致能力下降.

                    100

                                                                        单模型     1次寻路    2次寻路     3次寻路
                     80  58.4  61.1  60.0  61.7  60.9            100
                   准确率 (%)  60   49.3            54.6  55.0       80
                     40
                                                                  60
                     20                                          胜率 (%)  40
                      0                                           20
                        ERNIE  Qwen Baichuan DS-Qwen  Route1  Route2  Route3  Route4  0  Route1  Route2  Route3  Route4


                                     模型/路由                                          路由
                      图 8    CaLM Lite 数据集准确率实验结果                     图 9    CaLM Lite 数据集路由情况
                  4.7   寻路次数分析
                    从  3  个数据集的实验结果可以看出, Route1        与  Route2  在大多数情况下均能在     3  次寻路以内完成路由. 然而,
                 当强制设置更少或更多的寻路次数时, 其对性能的具体影响尚不明确, 相较于本文提出的“自收敛机制结合寻路次
                 数上限”策略, 仍需进一步实验验证与分析. 因此, 在不设置自收敛条件的前提下, 进行了寻路次数控制实验: 在无
                 明确拒绝意见时, 随机选择合作模型继续优化, 从而与本文方法进行对比. 实验结果如表                         4 和表  5 所示, 其中  Flames
                 无害率以及    Flames 无害分数为各维度结果求和取平均值.
                    在表  4  所示的  Route1  实验中, 由于初始模型    DS-Qwen  在  OMGEval 上性能起点较低, 随着寻路次数增加, 胜
                 率显著提升. 然而, 在    Flames 指标上表现波动较大, 未表现出明显的提升趋势, 仅在一定范围内上下浮动. 在                      CaLM
                 Lite 上, 准确率随着寻路增加最初提升, 在中等寻路次数时达到峰值, 随后随着寻路次数进一步增加而出现性能退
                 化. 表  5  展示了  Route2  的实验结果. 该结果表明   Route2  整体回复质量较高, 在     OMGEval 上的胜率还能够保持高
                 位稳定. 然而, 其在    Flames 指标上同样表现出不稳定性, 且在         CaLM Lite 准确率上, 也呈现类似于      Route1  的“先升
                 后降”的趋势. 综上所述, 在不引入自收敛机制的条件下, 仅通过控制寻路次数, 部分情况下仍能取得与“自收敛机
                 制结合寻路次数上限”策略相当的性能表现. 例如, 表               4  中某些中间寻路次数配置在        CaLM Lite 上的表现与默认的
                 自收敛寻路次数类似. 然而, 需注意的是, 自收敛策略下通常能在较少寻路次数内达成收敛                           (例如, 3  次寻路以内路
   235   236   237   238   239   240   241   242   243   244   245