Page 234 - 《软件学报》2026年第6期
P. 234

吴俊儒 等: 基于协作关系的模型动态路由                                                            2553


                 度低, 可作为可靠的知识优化锚点.
                    (5) 其他模型: 当模型既打低分又得低分时           (低  Given 且低  Received), 其输出表征独特的知识表达范式      (如特异
                 性风格), 需单独考虑.
                    评分差异与回复质量之间虽存在潜在相关性, 但并非直接联系. 当一个模型对另一个模型的回复给出低分时,
                 本质反映的是模型间认知标准的差异, 可能源于对文本结构、表达规范或评价维度的主观判断. 这些要素与回复
                 本身的客观质量或模型能力之间不存在直接对应关系. 低分评价主要在于揭示模型间差异, 为模型回复提供优化
                 方向参考.
                    针对模型    M i , 有一类对其评分偏低但具有潜在协作增益的候选模型, 即存在一部分模型给                       M i  打低分且属于
                                                                    C = {C 1 ,...,C N }. 该合作模型集筛选机制涵盖两
                 “低评分高得分”的模型. 为此, 构建         M i  的合作模型集  C i ∈ C, 其中
                 个条件: 1) 候选模型对     M i  的评分处于全体模型对      M i  评分的后  d 2 %  区间; 2) 候选模型属于“低评分高得分”模型.
                                                                                       M i  打低分且属于“低评
                 同时, 也存在一类对其评分偏低但具有不确定协作增益的候选模型, 即存在一部分模型给
                                                            ′  ′     C = C ,...,C . 该补充模型集筛选机制涵盖两
                                                                          ′
                                                                      ′
                                                                               ′
                 分低得分”的模型. 因此, 进一步构建         M i  的补充模型集   C ∈ C , 其中
                                                            i             1    N
                 个条件: 1) 候选模型对     M i  的评分处于全体模型对      M i  评分的后  d 2 %  区间; 2) 候选模型属于“低评分低得分”模型.
                      ′                                                      C  构成的协作关系图谱.
                                                                               ′
                 C i  和  C  中的模型是   M i  建立协作关系可能的对象, 最终得到串联架构中由          C  和
                      i
                  3.3   动态协作路由算法
                    静态路由算法在模型迭代与任务场景变化时难以实现最优路径选择, 因而催生了动态路由算法的研究需求.
                 现有方法普遍面临计算成本和选择效率的挑战. 有的方法要求在每个路由节点完成处理后, 所有候选节点生成完
                 整中间结果, 再通过质量评估机制选择最优路径; 有的则要求全候选模型进行回复评价, 再根据评价结果挑选一个
                 模型作为下一节点. 本文提出动态协作路由算法通过利用模型间的协作关系构建路由决策条件, 降低所需计算资
                 源并提高节点选择效率. 具体来说, 该算法在路由过程中实现两个方面的优化, 一方面是运用协作关系图谱信息,
                 动态收缩候选节点规模; 另一方面是建立跨模型的二阶段轮询策略, 通过各模型的统一判断, 实现路由节点的快速
                 选择. “一致同意规则”指的是某一项决策需要全体成员一致认可, 才能够获得通过. 利用该规则, 算法首先进行认
                 可投票   (一阶段), 再进行回复优化      (二阶段), 具体内容如算法       2  所示, 可细分为如下过程.
                    (1) 在串联架构起点, 根据任务确定第          1  跳模型节点   M i ′ (可以根据任务类型、用户倾向以及响应速度等因素
                                                                                                ,
                 确定, 依赖于任务场景先验知识), 生成初始回复             y 0 = M i ′(x), 并加入路由序列  Route. 此时,  Route 0 = {M i ′} Route s  为
                 进行到第   s 跳时的总路径顺序.
                    (2) 第  1  阶段, 假设第   s 跳模型为   M i . 在第   s+1 跳中, 所有  C i  的模型将根据任务和该回复, 生成评价, 评价包含

                 “认可”和“不认可”两个选项. 当前所有模型节点对该回复的评价用于更新评价集                        Judge, 同时以“1”代表“认可”, “0”
                 代表“不认可”.   Judge 为包含模型及其评价的二元组, 即:

                                                Judge = {(m,v) | m ∈ C i ,v ∈ {0,1}}                  (7)
                    (3) 第  2  阶段, 从   Judge 中随机选择一个不认可   M i  回复的模型  M j , 作为下一跳节点, 要求该模型进一步优化
                 回复, 优化结果用于回复的更新. 即:

                                                                                                      (8)
                                                    Route s+1 = Route s ∪ M j

                                                        y s+1 =M j (y s )                             (9)
                    (4) 重复步骤   (2) 和步骤  (3), 直至  (2) 中  Judge 所含二元组只包含“认可”选项   (视为路由选择已收敛).
                            ′                                    Route s ′ . 在不能自行收敛的情况下, 本文假设路由最
                    (5) 经过   s  跳达到收敛条件后, 最终得到回复       y s ′  以及路由
                                        s ⩽ α. 可以认为, 所提路由算法运用的是“自收敛结合寻路次数上限”策略来结束路
                                        ′
                 大寻路次数为     α, 即需要满足
                 由过程.
                          ′
                                                                                                  ′
                      C  与  C  在路由决策中存在本质差异,     C  集合中的模型对回复的优化往往有较大概率提升其质量, 而                  C  集合中
                                                                                 ′
                 的模型存在回复质量波动风险. 因此, 优先考虑集合               C  以保证回复质量. 如何使用      C  是未来研究的内容.
   229   230   231   232   233   234   235   236   237   238   239