Page 228 - 《软件学报》2026年第6期
P. 228

吴俊儒 等: 基于协作关系的模型动态路由                                                            2547


                 Key words:  large language model (LLM); model interconnection; model collaboration; serial architecture; dynamic routing

                    大模型通常指的是具有大规模参数             (通常以“亿”为单位)、复杂网络设计结构、需要大量算力训练的机器学
                 习模型, 其通过海量数据实现在自然语言处理、图像识别、视频生成等领域的应用. 例如, OpenAI 公司研发的
                 ChatGPT  模型  [1] 能够基于在训练阶段所学习的数据, 根据用户的任务需求描述给出处理结果. 深度求索公司研发
                 的  Janus-Pro  模型  [2] , 能够根据用户的背景描述生成相应的图像. 如今, 大模型凭借其强大的任务分析、处理能力
                 已成为企业、高校等机构数字化应用的首选工具.
                    然而, 大模型的发展也面临着诸多挑战. 其一, 随着大模型参数的增加、应用的多样化以及使用规模的扩大,
                 处理任务所需要的算力成本陡增            [3,4] . 其二, 随着对大模型需求的不断增长, 其在模型开发、部署等方面的门槛持
                 续提高, 对技术实现体系提出了更高要求             [5,6] . 其三, 随着大模型技术的发展, 数据可靠传输、结果规范化等问题接
                 踵而至  [7−9] . 为了应对这些挑战, 行业内已经提出了诸多解决方案. 例如, 通过模型微调增强大模型在特定领域的性
                 能表现  [10] ; 通过知识蒸馏实现低成本部署       [11] ; 通过密码学手段实现可靠的数据版权保护等            [12] . 为了应对复杂任务,
                 相关研究进一步推动了模型应用逐步迈入通用化、系统化的新阶段. 但在实践中, 多个模型的系统协同仍面临显
                 著障碍. 不同团队构建的模型往往侧重于特定任务目标或性能指标并采用各异的训练范式、部署方式以及应用标
                 准等. 这种割裂的研究生态不仅限制了模型能力的复用与集成, 还增加了模型系统级整合的工程复杂度.
                    为了解决上述大模型研究的局限性, 实现不同模型之间的互联成为关键. 模型互联不仅依赖于单模型结构与
                 接口的设计兼容性, 还需要在交互协议、资源调度等方面建立能够统一各模型的机制以实现真正意义上的协同工
                 作, 最终推动大模型协同体系向更高效可靠的方向演进. 模型协作是实现模型互联的关键途径之一, 其通过模型间
                 在任务与功能层面上的能力共享、整合和互补, 使各类模型能够发挥各自优势以协同应对复杂任务, 展现出超越
                 单一模型的综合性能与泛化能力. 在技术实现上, 模型串联架构结合相应的模型路由方法是支持模型协作的重要
                 技术. 模型串联架构能够将多个模型有序连接起来, 模型路由算法则可以确定一条优化的连接路径. 两者结合使得
                 任务输出可以被多个模型逐步优化与增强, 达到多个模型协作优化的目标.
                    如何全面评估一条路由的协作质量, 并在多种连接组合中选择合理路径是亟待深入研究的问题. 现有研究多
                 聚焦于模型的个体性能        [13−18] , 通过对特定任务指标的优化来引导路由决策. 例如, Wu          等人  [19] 提出了一种先例增强
                 型法律判决预测框架, 该框架利用大模型结合特定领域模型的方式预测法律判决, 但在多模型的动态选择与多结
                 果整合方面仍显不足. Barbosa 等人      [20] 基于  Autogen  的多智能体系统在任务分解与角色分配方面取得进展, 却难以
                 应对任务重分配与模型替换场景. Lan           等人  [21] 提出的角色化立场检测框架虽实现多维度信息整合, 但其仲裁机制
                 的公平性与角色适配性仍存疑. 这些研究表明, 当前多模型路由相关研究不仅在协作关系建模与路由优化层面稍
                 显薄弱, 还缺乏对协作关系的系统性考量, 难以支撑动态、可调以及面向复杂任务的高效模型互联体系.
                    为此, 本文提出一种基于协作关系的模型动态路由方法, 旨在优化模型间的路径选择与协作效率. 该方法包含
                 两个组成部分: ① 互评量化机制, 用于刻画模型两两之间的协作关系; ② 基于该协作关系的动态路由算法, 用于实
                 现高效的模型组合与调度. 具体而言, 互评量化机制统一串联架构中各模型的梯度评分策略并利用模型对预设问
                 题的回复与评价来构建模型间的协作关系图谱. 在该图谱信息基础上, 动态路由算法借鉴“一致同意规则”, 在每一
                 跳路由决策中轮询可协作模型, 并选取具有“不认可”意见的模型作为下一跳节点. 所提出的路由方法具有良好的
                 泛化能力, 可适配多种应用场景, 如模型替换和多角色协作、多阶段协作等. 本文的主要贡献如下.
                    (1) 提出用于评估模型协作关系的互评量化机制, 该机制利用预设问题统一评估各模型之间的协作质量并依
                 此建立全局协作关系图谱.
                    (2) 基于图谱信息进一步提出动态协作路由算法, 该算法利用“一致同意规则”在任务回复完善过程中动态选
                 择模型路由节点, 进而生成一条优化的模型串联路径.
                    (3) 在多种推理任务数据集上对所提方法进行了评估. 与非协作关系路由和基线算法相比, 本方法在准确率、
                 回复胜率等方面具有明显性能优势. 在            OMGEval 数据集上, 协作关系路由算法对回复胜率的提升可达                 45%.
                    本文第   1  节介绍大模型互联、协作和路由的相关方法与研究现状. 第                  2  节介绍本文所需的有关大模型文本生
   223   224   225   226   227   228   229   230   231   232   233