Page 237 - 《软件学报》2026年第6期
P. 237
2556 软件学报 2026 年第 37 卷第 6 期
除了单个模型的实验结果, 为了进行实验对比, 设置如下路由.
(1) Route1: DS-Qwen → ERNIE, Qwen 路由 (协作组合结合所提出的动态路由算法)
(2) Route2: ERNIE → Qwen 路由 (协作组合结合所提出的动态路由算法)
(3) Route3: DS-Qwen → Baichuan (非协作组合结合所提出的动态路由算法)
(4) Route4: ERNIE → Baichuan, DS-Qwen (非协作组合结合随机路由算法)
随机路由算法指的是下一跳节点选择过程中, 随机选择模型节点进行任务的回复与评价, 其路由终止条件同
样为寻路次数不超过 α.
4.4 OMGEval 实验结果
4.4.1 胜 率
单模型与多模型串联的胜率结果如图 4 所示. Qwen 与 ERNIE 的表现明显优于其他模型, 最高胜率达到 91.3%,
而最差模型胜率仅为 36.8%. 在路由策略的效果对比中, Route1 对 DS-Qwen 模型表现出显著的性能增益, 回复质
量提升约 46%. Route2 未能实现进一步提升, 这是因为 ERNIE 在该数据集上表现较优, 难以再获得其他模型的显
著增益. 对比组中, Route3 对 DS-Qwen 的优化作用极为有限, 仅实现约 1% 的微幅提升; Route4 则呈现负向效果,
其回复质量甚至低于单一 ERNIE 模型基准值. 实验表明, Route3 与 Route4 两种策略对系统性能优化缺乏实质贡
献. 尽管都是对 DS-Qwen 进行增强, Route1 对比 Route3 在胜率表现上提升 45%, 为 3 个基准任务数据集中差距最
大的一组.
100
91.3 89.2 91.3 90.0
80 75.8
胜率 (%) 60 36.8 40.7 41.6
40
20
0
ERNIE Qwen Baichuan DS-Qwen Route1 Route2 Route3 Route4
模型/路由
图 4 OMGEval 数据集胜率结果
4.4.2 路由情况
图 5 通过统计获胜回复的路由情况和寻路次数, 进一步对路由中胜率的贡献进行分析. 在 Route1 中, DS-Qwen
模型独立生成的获胜回复占比不足 30%, 表明动态路由算法对其超 70% 的回复进行了优化. 优化过程表现出强收
敛性, 平均仅需 1 次节点选择即可达成协作共识. 在 Route2 中, 因 ERNIE 单模型性能接近上限, Qwen 参与率低
于 10%, 所以 2 次及 3 次寻路场景几乎不存在. Route3 的协作失效, Baichuan 模型参与次数可忽略不计, 暴露出该
路由存在模型协作不兼容问题, 其对质量提升的贡献微弱. Route4 的随机性算法存在局限性, 尽管随机路由算法触
发大量单次查询 (占 Route4 中约 65%), 但因缺乏定向优化, 最终输出质量未产生实质性改进, 反而呈现约 1% 的
下降. 该结果表明, 所提路由算法能发挥合作模型的纠错能力, 从而提升整体表现. 综合图 4 与图 5 的结果可知, 首
先, 协作关系中的合作模型是“按需触发”的, 这保证了寻路过程具备一定的稳定性, 而被“触发”的模型还能够有效
提升整体表现. 其次, 非协作组合不能达成与协作组合相近的性能. 在非协作组合中, 模型的协作意愿偏低. 最后,
实验中也观察到, 所提方法得到的路由大部分在 3 次寻路以下, 说明该方法在实践中是可控、可收敛的.
4.5 Flames 实验结果
Flames 评分分类器会根据表 3 定义的分类规则 (如安全性、合法性等维度), 对开放回复进行 1–3 分量化评

