Page 237 - 《软件学报》2026年第6期
P. 237

2556                                                       软件学报  2026  年第  37  卷第  6  期


                    除了单个模型的实验结果, 为了进行实验对比, 设置如下路由.

                    (1) Route1: DS-Qwen  → ERNIE, Qwen  路由  (协作组合结合所提出的动态路由算法)
                    (2) Route2: ERNIE  → Qwen  路由  (协作组合结合所提出的动态路由算法)
                    (3) Route3: DS-Qwen  → Baichuan (非协作组合结合所提出的动态路由算法)
                    (4) Route4: ERNIE  → Baichuan, DS-Qwen (非协作组合结合随机路由算法)
                    随机路由算法指的是下一跳节点选择过程中, 随机选择模型节点进行任务的回复与评价, 其路由终止条件同

                 样为寻路次数不超过       α.
                  4.4   OMGEval 实验结果
                  4.4.1    胜 率
                    单模型与多模型串联的胜率结果如图             4 所示. Qwen 与  ERNIE  的表现明显优于其他模型, 最高胜率达到 91.3%,
                 而最差模型胜率仅为        36.8%. 在路由策略的效果对比中, Route1      对  DS-Qwen  模型表现出显著的性能增益, 回复质
                 量提升约   46%. Route2  未能实现进一步提升, 这是因为       ERNIE  在该数据集上表现较优, 难以再获得其他模型的显
                 著增益. 对比组中, Route3   对  DS-Qwen  的优化作用极为有限, 仅实现约        1%  的微幅提升; Route4  则呈现负向效果,
                 其回复质量甚至低于单一         ERNIE  模型基准值. 实验表明, Route3    与  Route4  两种策略对系统性能优化缺乏实质贡
                 献. 尽管都是对    DS-Qwen  进行增强, Route1  对比  Route3  在胜率表现上提升   45%, 为  3  个基准任务数据集中差距最
                 大的一组.


                                           100
                                                91.3  89.2          91.3    90.0
                                            80                  75.8
                                          胜率 (%)  60    36.8  40.7      41.6
                                            40

                                            20
                                            0
                                               ERNIE  Qwen Baichuan DS-Qwen  Route1  Route2  Route3  Route4


                                                            模型/路由
                                                图 4 OMGEval 数据集胜率结果

                  4.4.2    路由情况
                    图  5 通过统计获胜回复的路由情况和寻路次数, 进一步对路由中胜率的贡献进行分析. 在                         Route1 中, DS-Qwen
                 模型独立生成的获胜回复占比不足            30%, 表明动态路由算法对其超         70%  的回复进行了优化. 优化过程表现出强收
                 敛性, 平均仅需    1  次节点选择即可达成协作共识. 在          Route2  中, 因  ERNIE  单模型性能接近上限, Qwen   参与率低
                 于  10%, 所以  2  次及  3  次寻路场景几乎不存在. Route3  的协作失效, Baichuan  模型参与次数可忽略不计, 暴露出该
                 路由存在模型协作不兼容问题, 其对质量提升的贡献微弱. Route4                的随机性算法存在局限性, 尽管随机路由算法触
                 发大量单次查询      (占  Route4  中约  65%), 但因缺乏定向优化, 最终输出质量未产生实质性改进, 反而呈现约                 1%  的
                 下降. 该结果表明, 所提路由算法能发挥合作模型的纠错能力, 从而提升整体表现. 综合图                         4  与图  5  的结果可知, 首
                 先, 协作关系中的合作模型是“按需触发”的, 这保证了寻路过程具备一定的稳定性, 而被“触发”的模型还能够有效
                 提升整体表现. 其次, 非协作组合不能达成与协作组合相近的性能. 在非协作组合中, 模型的协作意愿偏低. 最后,
                 实验中也观察到, 所提方法得到的路由大部分在               3  次寻路以下, 说明该方法在实践中是可控、可收敛的.
                  4.5   Flames 实验结果
                    Flames 评分分类器会根据表       3  定义的分类规则     (如安全性、合法性等维度), 对开放回复进行              1–3  分量化评
   232   233   234   235   236   237   238   239   240   241   242