Page 240 - 《软件学报》2026年第6期
P. 240
吴俊儒 等: 基于协作关系的模型动态路由 2559
动了 DS-Qwen 模型的回复准确率, 其最终值在 61.7%, 呈现出回复质量增益. 在 Route2 中, ERNIE 模型经优化后
准确率增长 2.5%, 逐步靠近 Qwen 模型. 通过 Route1 和 Route2 的优化, DS-Qwen 模型与 ERNIE 模型的回复准确
率进一步上升, 且两者差距进一步缩小. Route3 未能提高 DS-Qwen 模型的回复准确率, 主要原因在于 Baichuan 模
型自身准确率仅为 49.3%, 性能基准偏低. Route4 因采用随机路由方式, 导致路由缺乏针对性. Route4 虽也同时因
随机性缓冲了部分负向影响, 仍导致 ERNIE 模型准确率下降. 多个数据集表明, 模型串联存在 3 类性能演化, 即中
性态 (串联后性能与所参与单体模型持平), 增益态 (串联后性能超越所参与模型) 和衰减态 (串联后性能劣于所参
与单体模型). Route1 与 Route2 大部分处于中性态与增益态, 而 Route3 与 Route4 则主要处于衰减态.
4.6.2 路由情况
图 9 进一步对无害分数的路由参与情况进行统计, 单模型与 1 次寻路依然占据所有路由的主导地位. 相比于
其他数据集, 最大的变化一方面在于 Route3 中 Baichuan 模型参与程度明显上升, 但这一变化未带来正向增益, 反
而使得 DS-Qwen 的准确率下降了大约 6%. 另一方面, Route4 中路由组合变得多样化, 3 次寻路首次出现在 Route4
中. 由于 Baichuan 模型与 DS-Qwen 模型互不处于对方的可合作模型集中, 因此出现 3 次寻路是比较少见的情况.
最大原因可能在于 Baichuan 模型与 DS-Qwen 在该数据集上表现出较大的性能差异, 频繁产生“不认可”意见, 导
致路由次数攀升. 多次寻路以及性能差异因素未能弥补模型本身缺乏合作性的缺点, Route4 的表现依然不理想. 综
合图 8 与图 9 的分析结果可知, 并非所有模型组合都能提升回复质量, 只有建立在可靠协作关系之上的组合才能
稳定带来能力增益; 反之, 不可靠的协作反而导致能力下降.
100
单模型 1次寻路 2次寻路 3次寻路
80 58.4 61.1 60.0 61.7 60.9 100
准确率 (%) 60 49.3 54.6 55.0 80
40
60
20 胜率 (%) 40
0 20
ERNIE Qwen Baichuan DS-Qwen Route1 Route2 Route3 Route4 0 Route1 Route2 Route3 Route4
模型/路由 路由
图 8 CaLM Lite 数据集准确率实验结果 图 9 CaLM Lite 数据集路由情况
4.7 寻路次数分析
从 3 个数据集的实验结果可以看出, Route1 与 Route2 在大多数情况下均能在 3 次寻路以内完成路由. 然而,
当强制设置更少或更多的寻路次数时, 其对性能的具体影响尚不明确, 相较于本文提出的“自收敛机制结合寻路次
数上限”策略, 仍需进一步实验验证与分析. 因此, 在不设置自收敛条件的前提下, 进行了寻路次数控制实验: 在无
明确拒绝意见时, 随机选择合作模型继续优化, 从而与本文方法进行对比. 实验结果如表 4 和表 5 所示, 其中 Flames
无害率以及 Flames 无害分数为各维度结果求和取平均值.
在表 4 所示的 Route1 实验中, 由于初始模型 DS-Qwen 在 OMGEval 上性能起点较低, 随着寻路次数增加, 胜
率显著提升. 然而, 在 Flames 指标上表现波动较大, 未表现出明显的提升趋势, 仅在一定范围内上下浮动. 在 CaLM
Lite 上, 准确率随着寻路增加最初提升, 在中等寻路次数时达到峰值, 随后随着寻路次数进一步增加而出现性能退
化. 表 5 展示了 Route2 的实验结果. 该结果表明 Route2 整体回复质量较高, 在 OMGEval 上的胜率还能够保持高
位稳定. 然而, 其在 Flames 指标上同样表现出不稳定性, 且在 CaLM Lite 准确率上, 也呈现类似于 Route1 的“先升
后降”的趋势. 综上所述, 在不引入自收敛机制的条件下, 仅通过控制寻路次数, 部分情况下仍能取得与“自收敛机
制结合寻路次数上限”策略相当的性能表现. 例如, 表 4 中某些中间寻路次数配置在 CaLM Lite 上的表现与默认的
自收敛寻路次数类似. 然而, 需注意的是, 自收敛策略下通常能在较少寻路次数内达成收敛 (例如, 3 次寻路以内路

