Page 236 - 《软件学报》2026年第6期
P. 236
吴俊儒 等: 基于协作关系的模型动态路由 2555
上的表现. 本文利用数据集自带的基于 InternLM-chat-7B 的评分分类器计算相应指标, 第 4.5 节介绍了无害率以及
无害分数的具体评分细节.
(4) CaLM Lite [51] : CaLM Lite 用于语言模型因果推理能力评估, 包含 920 个项目, 其建立了一个由 4 个模块组
成的基础分类法: 因果目标 (即评估什么)、适应性 (即如何获得结果)、度量 (即如何测量结果) 和错误 (即如何分
析不良结果) 来对模型性能进行分析, 其具体形式为选择、判断以及概率计算题. CaLM Lite 的评估指标为准确率,
即题目正确回答次数与所有回答次数之比.
N 次寻路”表示除
此外, 各数据集实验结果涵盖本方法路由情况分析. “单模型”表示只有特定模型回复任务; “
初始模型节点之外, 本方法还需进行 N 次节点的寻找 ( N 跳), 总路径上共有 N +1 个节点.
4.2 实验参数
本文在互评量化机制中, 设定 3 个等级 (A、B、C), 对 FewCLUE 数据集进行模型互评, 其余数据集则用于测
试路由表现. 设置分数区间划分参数 d 1 = 50、候选模型集划分参数 d 2 = 50 以及寻路次数上限 α = 3.
参与实验的模型分别为, Baichuan2-7B (Baichuan)、Qwen-Plus (Qwen)、ERNIE-3.5-8K (ERNIE) 以及
DeepSeek-R1-Distill-Qwen-7B (DS-Qwen). 不同模型受参数规模、训练数据等因素影响, 性能各不相同. 表 2 展示
{question} 为数据集给定的任务, {answer} 为模型的回复.
了路由算法所用提示词, 其中
表 2 提示词说明
提示词用途 提示词内容
这是任务: {question}, 这是某个模型有关分类及其解释的回答: {answer}. 它的回答可能不正确, 但请你作为
模型互评 一个通用领域的专家, 在目前有A, B, C三个评分等级的情况下, 为这个回答评级. 请你仅回答等级, 而不输出
其他任何信息.
动态协作路由算法 这是问题: {question}, 这是回答: {answer}. 请你作为一个通用领域的专家, 告诉我回答是否令你满意. 你只需
第1阶段提示词 要回复我认可或者不认可, 不需要输出其他任何内容.
动态协作路由算法 这是问题: {question}, 这是回答: {answer}. 请你作为一个通用领域的专家, 结合你自己的理解优化该回答. 你
第2阶段提示词 只需要按照问题中对回复的格式要求输出并优化回复, 不需要输出其他任何内容.
4.3 模型互评结果
评分结果如图 3 所示. 高得分模型为: Qwen 和 ERNIE, 高评分模型为: Baichuan 和 DS-Qwen. 进一步可得低
评分且高得分的模型为 ERNIE 和 Qwen; 高评分且高得分的模型暂无; 高评分且低得分的模型为 Baichuan 和 DS-
Qwen; 低评分且低得分的模型暂无. 如果 d 1 的数值进一步缩小, 则 DS-Qwen 可以归类为低评分且低得分的模型.
如果 d 1 的数值进一步增大, 则 Baichuan 可以归类为高评分且高得分模型. 进一步, 可以认为有 4 种模型协作组合:
(1) Qwen → ERNIE; (2) ERNIE → Qwen; (3) Baichuan → ERNIE; (4) DS-Qwen → ERNIE, Qwen.
Qwen 2.4 2.6 1.9
2.6
2.4
Baichuan 2.6 2.8 2.6
评价模型 2.2 分数
ERNIE
1.7
2.2
2.5
2.0
DS-Qwen 2.4 2.2 2.5 1.8
Qwen Baichuan ERNIE DS-Qwen
被评价模型
图 3 模型互评结果

