Page 235 - 《软件学报》2026年第6期
P. 235

2554                                                       软件学报  2026  年第  37  卷第  6  期



                 算法  2. 动态协作路由算法.

                 输入: 任务   x, 所有模型可合作模型集      C;
                 输出: 路由  Route, 最终任务输出    y.
                 1. //初始化
                 2. 初始化路径长度     s = 0
                                ,
                 3. 初始化首节点    M i ′ Route 0 = {M i ′}
                 4.  y 0 ← M i ′(x)
                                     y
                 5.  Judge ← C i ′  中的模型对   的评价
                 6. while   Judge 中存在“不认可”意见或  s ⩽ α do
                 7. //第  1  阶段
                 8.    M j ← 随机选择一个“不认可”的模型
                 9.    Route s+1 ← Route s ∪ M j
                 10.     y s+1 ← M j (y s )
                 11. //第  2  阶段
                                        y s+1  的评价


                 12.    Judge ← C j  中的模型对
                 13. end
                 14. return   Route 和  y
                  4   实 验


                    本节设计多组面向不同场景推理任务的实验, 从而全面验证所提路由方法的性能.
                    (1) 开放域问答: 在开放域问答中, 用户可以向模型询问任何领域的问题                    (比如科研、军事、历史或者体育领
                 域等), 对问题的回复通常不会遵循特定的规范. 例如, 可以问: 新一任的美国总统是谁? 或者问: 苏轼的别名叫什
                 么? 开放域问答要求大模型能够高效地从海量数据中找到合理的回复, 返回给模型使用者. 开放域问答测试能够
                 评估路由方法对各模型回复意见与回复倾向的整合能力.
                    (2) 知识问答: 知识问答用于测试模型在不同领域              (例如, 科学、历史、技术、文化) 的知识掌握情况, 从而评
                 估模型在问题理解、知识运用以及生成答案方面的能力. 知识问答测试能够评估路由方法对各模型知识领域优势
                 的整合能力.
                    (3) 价值观测试: 价值观测试用于评估大模型的生成内容是否符合特定价值观、伦理以及道德等标准. 价值观
                 测试能够评估路由方法在内容过滤和价值对齐方面的有效性.
                  4.1   数据集以及评价指标
                    (1) FewCLUE [48] : FewCLUE  包含多个不同类型的任务, 包括情感分析任务、自然语言推理、多种文本分类、
                 文本匹配任务和成语阅读理解等. 该数据集仅用于进行模型互评.
                    (2) OMGEval [49] : OMGEval 是一个包含中文、法语、俄语、西班牙语和阿拉伯语这              5  种语言的开放式问答数
                 据集, 其中包含生活常识、数学能力和逻辑推理等多个方面. 本文采用其中的中文本土化数据进行测试. 对 OMGEval
                 的结果分析基于第三方大模型           (GPT-3.5) 的评估机制, 第三方大模型通过对比参考答案与路由生成答案, 判断“谁

                 更优”, 最后通过路由生成答案的胜出次数统计出胜率.
                    (3) Flames [50] : Flames 是用于  LLM  价值对齐评估的一个高度对抗性的中文基准数据集, 包含            2 251  个高度对
                 抗性、手工制作的提示, 其中每个提示都针对一个特定的价值维度                       (即公平、安全、道德、合法性、数据保护),
                 并要求用户回答开放性问题. Flames 的评估指标包括无害率以及无害分数, 用以体现路由生成回复在各价值维度
   230   231   232   233   234   235   236   237   238   239   240