Page 235 - 《软件学报》2026年第6期
P. 235
2554 软件学报 2026 年第 37 卷第 6 期
算法 2. 动态协作路由算法.
输入: 任务 x, 所有模型可合作模型集 C;
输出: 路由 Route, 最终任务输出 y.
1. //初始化
2. 初始化路径长度 s = 0
,
3. 初始化首节点 M i ′ Route 0 = {M i ′}
4. y 0 ← M i ′(x)
y
5. Judge ← C i ′ 中的模型对 的评价
6. while Judge 中存在“不认可”意见或 s ⩽ α do
7. //第 1 阶段
8. M j ← 随机选择一个“不认可”的模型
9. Route s+1 ← Route s ∪ M j
10. y s+1 ← M j (y s )
11. //第 2 阶段
y s+1 的评价
12. Judge ← C j 中的模型对
13. end
14. return Route 和 y
4 实 验
本节设计多组面向不同场景推理任务的实验, 从而全面验证所提路由方法的性能.
(1) 开放域问答: 在开放域问答中, 用户可以向模型询问任何领域的问题 (比如科研、军事、历史或者体育领
域等), 对问题的回复通常不会遵循特定的规范. 例如, 可以问: 新一任的美国总统是谁? 或者问: 苏轼的别名叫什
么? 开放域问答要求大模型能够高效地从海量数据中找到合理的回复, 返回给模型使用者. 开放域问答测试能够
评估路由方法对各模型回复意见与回复倾向的整合能力.
(2) 知识问答: 知识问答用于测试模型在不同领域 (例如, 科学、历史、技术、文化) 的知识掌握情况, 从而评
估模型在问题理解、知识运用以及生成答案方面的能力. 知识问答测试能够评估路由方法对各模型知识领域优势
的整合能力.
(3) 价值观测试: 价值观测试用于评估大模型的生成内容是否符合特定价值观、伦理以及道德等标准. 价值观
测试能够评估路由方法在内容过滤和价值对齐方面的有效性.
4.1 数据集以及评价指标
(1) FewCLUE [48] : FewCLUE 包含多个不同类型的任务, 包括情感分析任务、自然语言推理、多种文本分类、
文本匹配任务和成语阅读理解等. 该数据集仅用于进行模型互评.
(2) OMGEval [49] : OMGEval 是一个包含中文、法语、俄语、西班牙语和阿拉伯语这 5 种语言的开放式问答数
据集, 其中包含生活常识、数学能力和逻辑推理等多个方面. 本文采用其中的中文本土化数据进行测试. 对 OMGEval
的结果分析基于第三方大模型 (GPT-3.5) 的评估机制, 第三方大模型通过对比参考答案与路由生成答案, 判断“谁
更优”, 最后通过路由生成答案的胜出次数统计出胜率.
(3) Flames [50] : Flames 是用于 LLM 价值对齐评估的一个高度对抗性的中文基准数据集, 包含 2 251 个高度对
抗性、手工制作的提示, 其中每个提示都针对一个特定的价值维度 (即公平、安全、道德、合法性、数据保护),
并要求用户回答开放性问题. Flames 的评估指标包括无害率以及无害分数, 用以体现路由生成回复在各价值维度

