Page 396 - 《软件学报》2026年第3期
P. 396
刘建春 等: 基于块级多输出和知识自蒸馏的高效联邦学习框架 1359
为了应对联邦学习中数据异构和资源受限问题, 本文提出了一个高效的联邦学习框架——FedAlt. 该框架在
FedAvg 基础上引入块级多输出和知识自蒸馏技术, 使得客户端在本地训练时吸收更多的模型表征层信息以缓解
non-IID 数据问题. 具体来说, 首先将模型分为多个连续的模型块. 为了减少通信开销, 服务器在每个全局轮次开始
时仅向客户端发送前面一部分全局模型块. 然后客户端将全局模型和本地模型进行组合, 并使用知识自蒸馏技术
来吸收模型表征层的信息以缓解数据异构带来的负面影响. 由于在知识自蒸馏过程中, 额外的模型表征层输出数
量与客户端接收的全局模型块数量有关, 此技术被称为块级多输出. 此外, 由于通信开销随传输的模型块数量增加
而增加, 而更多的模型块可以使客户端在本地训练时吸收更多的表征层信息, 从而提高全局模型训练性能. 因此,
本文在服务器和客户端分别设计了相应的算法, 即服务器分发模型块算法 (block-wise model distribution, BMD) 和
客户端块级多输出正则化算法 (block-wise multi-output regularization, BMR), 它们通过客户端不同的数据分布、计
算和通信能力来确定其传输的模型块数量. 综上所述, 本文的主要贡献如下.
● 提出了一个高效的联邦学习框架——FedAlt. 它通过仅分发部分全局模型来减少通信开销, 并通过引入知识
自蒸馏和块级多输出技术来吸收更多模型表征层的信息, 从而缓解了 non-IID 数据问题, 提高模型训练性能 (如测
试精度).
● 在服务器和客户端分别设计了高效的算法, 即服务器分发模型块算法 BMD 和客户端块级多输出正则化算
法 BMR. 它们根据客户端之间不同的本地数据分布、计算和通信能力来确定服务器分发给客户端最合适的模型
块数量.
● 通过大量实验评估和验证了 FedAlt 的训练性能. 实验结果表明, 在通信资源有限的边缘场景下, FedAlt 相
对于基线方法在给定通信带宽预算的情况下可以平均提升约 2.64% 的测试精度.
本文第 2 节介绍本文的相关基础知识以及国内外相关工作. 第 3 节系统地介绍 FedAvg 以及 FedAlt 框架的训
练流程, 同时通过例子解释如何基于知识自蒸馏和块级多输出进行正则化, 并给出问题的形式化定义. 针对该问
题, 在第 4 节中提供两个探索性算法. 第 5 节展示实验结果. 第 6 节对本文进行总结.
2 基础知识和相关工作
2.1 知识蒸馏
在传统的深度学习模型训练中, 通常依赖于大量的数据和复杂的模型 [13] . 然而, 随着深度学习技术的不断发
展, 出现了许多参数庞大、性能卓越的大型模型, 如 GPT-3 [14] 等. 这些复杂模型虽然具备出色的性能, 但由于其庞
大的参数量和高计算复杂度, 不适用于资源受限的环境, 如移动设备或嵌入式系统. 此外, 这些模型在部署时可能
面临推理速度慢、存储需求大等问题. 因此, 如何将大型模型的知识有效地转移到小型模型中, 以实现轻量级部署
和高效推理, 成为当前研究的热点之一. 在这一背景下, 知识蒸馏技术 [15] 应运而生. 知识蒸馏是一种模型压缩技术,
旨在通过将一个复杂的模型 (通常被称为教师模型) 的知识转移给一个简化的模型 (通常被称为学生模型) 来提高
学生模型的性能和泛化能力, 其基本思想是利用已经训练好的复杂模型的知识来指导学生模型的训练. 具体而言,
在训练过程中, 将教师模型生成的软目标 (即软标签) 作为额外的监督信号, 同时最小化学生模型的损失函数和学
生模型与教师模型输出之间的差异, 从而将教师模型的知识转移给学生模型. 这种方法使得学生模型在保持性能
的同时, 显著减少了参数量和计算复杂度, 适用于资源受限的环境. 知识蒸馏技术的优势在于, 它能够在性能损失
较小的情况下, 大幅减少模型的规模和计算复杂度, 使得轻量级模型能够在资源有限的设备上运行, 同时保持较高
的推理速度和准确性. 知识蒸馏过程类似于人类教育中的知识传承: 教师将自己的知识和经验传授给学生, 期望学
生能够在较短时间内掌握核心知识和技能. 在实现知识蒸馏时, 通常包含以下几个步骤.
(1) 训练教师模型. 首先, 使用大量数据对一个庞大的神经网络模型进行训练, 使其具备强大的知识表示能力
和深度学习能力.
(2) 知识提取. 在教师模型训练完成后, 通过特定方法提取其中的知识, 这些知识可以包括模型参数、特征表
示、类别概率等.

