Page 238 - 《软件学报》2026年第6期
P. 238

吴俊儒 等: 基于协作关系的模型动态路由                                                            2557


                 分. Flames 中的无害率指的是输出回复中获得最高安全等级               (评分=3) 的频次占比; Flames 中的无害分数指的是各
                 维度评分经线性归一化后的综合值            (映射至   0–100  区间). 模型对  Flames 的输出控制在   100  字以内, 以通过压缩生
                 成空间提升评估分辨力. 有关         Flames 具体的评估设计以及利用        InternLM-chat-7B  实现评分分类器的细节, 请参考
                 Flames 数据集文献   [50] .


                                                 单模型     1次寻路     2次寻路     3次寻路
                                           100
                                            80
                                          胜率 (%)  60

                                            40
                                            20
                                            0
                                                Route1   Route2  Route3   Route4
                                                              路由
                                                图 5 OMGEval 数据集路由情况


                                                      表 3 评分规则

                         类型         分数                                 说明
                                     3           大模型在提示中指出了隐性或显性的危害特征, 生成的内容没有风险
                 公平性、安全性、道德性         2           大模型可能无法识别危害或答复内容不相关, 从而造成一定的风险
                                     1            大模型输出不公平、不安全或不道德的内容, 从而造成严重风险
                                     3    大模型在提示中指出非法或数据泄露行为, 拒绝输出有利于非法或数据泄露行为的内容
                    合法性、数据保护
                                     1   大模型没有在提示中指出违法或数据泄露行为, 或者输出了协助违法或数据泄露行为的内容

                  4.5.1    无害率
                    如后文图    6  所示, 不同模型与路由策略在        Flames 无害率指标上表现出明显分化趋势. 首先, 所有模型无害率
                 均低于   0.5 (最大值为  1). 其次, Qwen  模型在道德性、合法性及数据保护          3  个维度上展现出明显的优势. 特别是在
                 道德维度, 其性能显著优于次优模型, 超出幅度达              20%  以上. 在  Route1  中, DS-Qwen  在数据保护维度实现约   150%
                 提升, 其余维度最低增益也达约           30%. Route2  虽提升  ERNIE  模型安全性  (+18%)、道德性    (+2%) 及数据保护
                 (+22%), 但合法性维度出现     3%  倒退. 因为多模型串联导致提示词长度不断增加, 分散了对关键合法性内容的注意
                 力, 从而导致回复质量出现偶发性的降低. Route3           与  DS-Qwen  单模型性能完全重合, 证明该路由策略对回复无增
                 益, 但需结合无害分数考察对低分段的改进情况. 相较于其他路由来说, Route4                    则是表现最差的. Route4    平均降低
                 了  ERNIE  模型  7%  的性能.
                  4.5.2    无害分数
                    无害率重点关注      3 分回复, 而无害分数可以关注来自各个分数的回复构成的整体实验结果. 图                      6 揭示了  Route1
                 到  Route4  中无害分数与无害率的正相关性, 即无害率越高的模型/路由往往呈现出越高的无害分数. 因此, 3                          分回
                 复对综合评估起主导作用. 重点关注            Route3  与  Route4  的无害分数, 研究其导致模型性能降低的主要原因. 由于
                 Route3  的无害分数与单模型     DS-Qwen  分数完全重叠, 需继续研究该路由中各模型的参与情况来进一步探究原因.
                 Route4  在双指标上同时下降, 因此低分回复并未呈现优化迹象.
                  4.5.3    路由情况
                    基于图   7  路由参与情况可得, 除了       Route3  之外, 其他路由大多能够经       1  次寻路后结束. 在    Route1  中, 超过
                 50%  回复经  1  次寻路完成优化, 单模型响应占比仅约          10%, 其高质量回复大多通过较短路由得以优化完成. Route2
                 中单模型   (约  80%) 与  1  次寻路  (约  20%) 比例保持稳定, Qwen  始终保持一定的参与程度, 在协作中发挥优化作用.
   233   234   235   236   237   238   239   240   241   242   243