Page 229 - 《软件学报》2026年第6期
P. 229
2548 软件学报 2026 年第 37 卷第 6 期
成与模型串联架构的基础知识. 第 3 节介绍本文提出的基于协作关系的模型动态路由方法. 第 4 节通过对比实验
验证所提路由方法的有效性. 第 5 节对本文进行总结与展望.
1 相关工作
1.1 模型互联
模型互联指的是多个模型在任务执行过程中通过接口、协议、共享组件以及共享结构等方法实现信息的交
流与功能上的联通, 其是提升系统整体性能和可扩展性的关键手段. 总体来看, 模型互联尚处于起步阶段, 相关研
究主要集中在数据互联、结构互联以及调度与控制互联等方面. 下面对每种模型互联进行具体介绍.
● 数据互联旨在实现模型间的数据整合与转换. 该类互联在文本转换、医疗分析等领域亦有诸多应用 [22−24] .
例如, Tang 等人 [25] 提出了 Any2Point 框架, 通过参数高效微调方法将任何 1D (语言) 或 2D (图像/音频) 大型模型
迁移到 3D 域, 从而为任何模态大型模型提供 3D 理解能力. Jiang 等人 [26] 提出了一种基于大模型的多层次跨模态
融合方法, 通过多次模型间信息融合实现可靠的导航系统环境感知. 数据互联侧重于模型之间的信息流通与语义
对接, 有助于解决模型输入输出格式不一致、表达不统一等问题, 能够实现异构模型之间的高效通信, 为后续的结
构融合与协作奠定基础.
● 结构互联旨在实现模型结构上的共享、连接与组合. 例如, Chen 等人 [27] 提出的 bert2BERT 方法, 通过小模
型参数重用来加速大模型训练过程. Xiao 等人 [28] 提出了几种面向大模型功能模块的操作, 以动态组装模块构建大
模型来应对复杂任务. Wang 等人 [29] 提出一种基于大模型和特征对齐的知识蒸馏算法, 可将大型预训练模型的知
识有效地迁移到轻量级的学生模型中, 从而在保持模型高性能的同时降低计算成本. Ainsworth 等人 [30] 考虑神经网
络隐藏单元的置换对称性, 通过置换神经元权重将一个模型的参数与参考模型对齐, 使两者的权重空间位置接近
以便于模型融合或迁移. Liu 等人 [31] 提出了解码时间重新对齐技术, 用于探索和评估对齐模型中不同正则化强度,
允许用户在未对齐和对齐模型之间过渡, 从而方便模型合作分工. 结构互联关注模型内部架构的兼容与融合问题,
有助于缓解由于模型设计差异所带来的融合障碍, 能够在保持结构独立性的同时, 实现参数共享或模型整合.
● 调度与控制互联旨在实现模型调用的时机、顺序及策略的制定. 例如, Lu 等人 [32] 设计了 Chameleon 框架,
其通过各种模型、工具的组合 (大模型、视觉模型等) 来合成程序, 以完成复杂的推理任务. Aggarwal 等人 [33] 提出
了 AutoMix 框架, 实现将当前查询任务输出策略性地指向到合适大小模型的转变, 从而提高计算成本、优化资源
消耗. Zhang 等人 [34] 设计了 EdgeShard 框架, 用于在边缘环境中部署大模型并实现边缘设备和云服务器之间的协
作. Jiang 等人 [35] 结合第三方评估参考 (ChatGPT) 设计了排名机制, 利用精心挑选的候选模型来优化任务. Brown
等人 [36] 引导模型有目的地输出多种处理方案, 然后以方案验证的方式找到最佳解决方案. 调度与控制互联致力于
模型间的调度控制与流程管理, 有助于提升多模型系统在实际应用中的灵活性与效率. 通过动态调度、模型路由
以及多智能体协同等方法, 该类互联能够根据具体任务需求自动选择合适的模型组合与执行顺序, 从而优化资源
配置并提升复杂任务处理能力.
综上所述, 模型互联强调从系统层面的视角解决多个模型涉及结构兼容、资源分配与调用机制等方面的联通
问题, 是构建多模型系统的技术基础. 鉴于任务场景的复杂性、任务需求的多样性以及部署落地的可行性等, 在模
型互联的基础上还需建立有效的协作机制以适配具体模型、满足任务个性化需求, 实现针对特定场景的多模型能
力提升.
1.2 模型协作
模型协作关注任务中的模型分工与协同, 更加强调功能层面和语义层面的配合. 现有研究已在各类具体任务
下取得一定进展. 部分研究专注于通过模型协作处理长文本任务. 例如, Zhang 等人 [37] 提出了智能体链框架, 其利
用自然语言进行多智能体协作, 从而能够在处理长上下文任务的各个大模型之间进行信息聚合和上下文推理.
Zhao 等人 [38] 提出了一种基于多智能体协作的方法, 利用领导者和成员角色, 结合成员沟通机制, 提升大模型长文
本处理能力. 部分研究则专注于提升大模型的综合判断能力. 例如, Sun 等人 [39] 提出了一个用于情感分析的多模型

