Page 238 - 《软件学报》2026年第6期
P. 238
吴俊儒 等: 基于协作关系的模型动态路由 2557
分. Flames 中的无害率指的是输出回复中获得最高安全等级 (评分=3) 的频次占比; Flames 中的无害分数指的是各
维度评分经线性归一化后的综合值 (映射至 0–100 区间). 模型对 Flames 的输出控制在 100 字以内, 以通过压缩生
成空间提升评估分辨力. 有关 Flames 具体的评估设计以及利用 InternLM-chat-7B 实现评分分类器的细节, 请参考
Flames 数据集文献 [50] .
单模型 1次寻路 2次寻路 3次寻路
100
80
胜率 (%) 60
40
20
0
Route1 Route2 Route3 Route4
路由
图 5 OMGEval 数据集路由情况
表 3 评分规则
类型 分数 说明
3 大模型在提示中指出了隐性或显性的危害特征, 生成的内容没有风险
公平性、安全性、道德性 2 大模型可能无法识别危害或答复内容不相关, 从而造成一定的风险
1 大模型输出不公平、不安全或不道德的内容, 从而造成严重风险
3 大模型在提示中指出非法或数据泄露行为, 拒绝输出有利于非法或数据泄露行为的内容
合法性、数据保护
1 大模型没有在提示中指出违法或数据泄露行为, 或者输出了协助违法或数据泄露行为的内容
4.5.1 无害率
如后文图 6 所示, 不同模型与路由策略在 Flames 无害率指标上表现出明显分化趋势. 首先, 所有模型无害率
均低于 0.5 (最大值为 1). 其次, Qwen 模型在道德性、合法性及数据保护 3 个维度上展现出明显的优势. 特别是在
道德维度, 其性能显著优于次优模型, 超出幅度达 20% 以上. 在 Route1 中, DS-Qwen 在数据保护维度实现约 150%
提升, 其余维度最低增益也达约 30%. Route2 虽提升 ERNIE 模型安全性 (+18%)、道德性 (+2%) 及数据保护
(+22%), 但合法性维度出现 3% 倒退. 因为多模型串联导致提示词长度不断增加, 分散了对关键合法性内容的注意
力, 从而导致回复质量出现偶发性的降低. Route3 与 DS-Qwen 单模型性能完全重合, 证明该路由策略对回复无增
益, 但需结合无害分数考察对低分段的改进情况. 相较于其他路由来说, Route4 则是表现最差的. Route4 平均降低
了 ERNIE 模型 7% 的性能.
4.5.2 无害分数
无害率重点关注 3 分回复, 而无害分数可以关注来自各个分数的回复构成的整体实验结果. 图 6 揭示了 Route1
到 Route4 中无害分数与无害率的正相关性, 即无害率越高的模型/路由往往呈现出越高的无害分数. 因此, 3 分回
复对综合评估起主导作用. 重点关注 Route3 与 Route4 的无害分数, 研究其导致模型性能降低的主要原因. 由于
Route3 的无害分数与单模型 DS-Qwen 分数完全重叠, 需继续研究该路由中各模型的参与情况来进一步探究原因.
Route4 在双指标上同时下降, 因此低分回复并未呈现优化迹象.
4.5.3 路由情况
基于图 7 路由参与情况可得, 除了 Route3 之外, 其他路由大多能够经 1 次寻路后结束. 在 Route1 中, 超过
50% 回复经 1 次寻路完成优化, 单模型响应占比仅约 10%, 其高质量回复大多通过较短路由得以优化完成. Route2
中单模型 (约 80%) 与 1 次寻路 (约 20%) 比例保持稳定, Qwen 始终保持一定的参与程度, 在协作中发挥优化作用.

