Page 397 - 《软件学报》2026年第3期
P. 397
1360 软件学报 2026 年第 37 卷第 3 期
(3) 构建学生模型. 构建一个较小规模的神经网络模型作为学生模型, 该模型通常具有较少的参数和更简单的
结构.
(4) 蒸馏训练. 将教师模型的知识注入学生模型中, 通过优化学生模型的参数, 使其能够模仿教师模型的输出.
这个过程可以通过最小化教师模型和学生模型之间的损失函数来实现.
知识蒸馏技术在计算机视觉、自然语言处理、语音识别、医疗影像分析、智能物联网等领域都有着广泛的
应用前景, 其通过将复杂模型的知识转移给简化模型实现模型的压缩和性能提升, 为实现在资源受限环境下部署
深度学习模型提供了重要的解决方案.
2.2 相关工作
由于边缘设备处于不同的真实环境中, 它们产生的数据分布往往难以与整个边缘网络的数据分布一致, 即这
些设备之间的数据分布通常是非独立同分布的 (non-IID), 也被称为数据异构性 [6] . 这种非独立同分布的数据会导
致联邦学习训练出的全局模型精度下降以及模型收敛速度减慢等. 为了应对这一挑战, 国内外研究人员提出了多
种解决方案, 目前主要集中在两个方向: 提升全局模型的泛化性能和发展个性化联邦学习.
在提升全局模型泛化性能方面, Yang 等人 [16] 提出了一种基于图神经网络的方法, 旨在解决联邦学习中不同参
与方数据之间的异构性问题. 他们通过图神经网络实现了跨模态特征提取和表示学习, 从而统一了数据表示, 增强
了模型的泛化能力. Sattler 等人 [6] 设计了一种新的模型更新策略和参数聚合算法, 以有效应对 non-IID 数据带来的
挑战, 提升模型性能和收敛速度. Caldarola 等人 [17] 提出了一种基于窗口聚合模型的方法, 通过窗口化的模型平均
技术来提高模型在异构环境下的泛化能力. 该方法能够更有效地利用不同设备上的模型参数, 并通过动态调整窗
口大小来适应设备之间的异构性, 从而改善模型的泛化性能. 此外, Zhu 等人 [18] 提出了一种针对数据异构联邦学习
的无数据知识蒸馏方法. 该方法首先在一组与设备上的数据无关的模型上进行训练, 之后利用这个模型来进行设
备上的本地模型训练, 而无须访问设备上的实际数据, 从而提高了模型的泛化性能和学习效率.
在个性化联邦学习方面, 每个设备都维护着自己的本地模型, 模型参数根据本地数据进行更新. 个性化模型可
以根据不同设备的数据特点进行定制, 从而更好地适应数据的异构性. 对于个性化联邦学习而言, Achituve 等人 [19]
利用高斯过程为个性化的本地模型建模, 以适应不同设备上的数据分布. 每个边缘设备都维护一个高斯过程模型,
根据本地数据更新其均值和协方差, 然后通过联邦学习来整合所有边缘设备上的高斯过程模型, 得到一个全局的
模型. Collins 等人 [20] 提出了一种新的联邦学习框架和算法, 用于学习跨客户端的共享数据表示和每个客户端的唯
一本地头. 所提算法利用跨客户端的分布式计算能力, 对表示的每次更新执行许多关于低维局部参数的局部更新.
Zhang 等人 [21] 利用异构模型设置的潜力, 提出了一种新的训练框架, 为不同的客户使用个性化模型. 具体来说, 他
们将原始个性化 FL 中的聚合过程制定为个性化的组知识转移训练算法, 使每个客户端能够在服务器端维护个性
化的软预测, 以指导其他客户端的本地训练. Marfoq 等人 [22] 利用深度神经网络从非表格数据 (如图像和文本) 中提
取高质量矢量表示 (嵌入) 的能力, 提出了一种基于局部记忆的个性化机制. 尽管这些方法在一定程度上缓解了
non-IID 数据带来的影响, 但由于在训练过程中客户端和服务器之间传输的是整个模型, 这些方法在资源受限的边
缘网络中 (如通信资源受限时),性能仍然会显著下降.
为了减少通信开销, 模型压缩技术常常被应用于联邦学习中. 模型压缩通常包括参数稀疏化、梯度量化、模
型压缩算法和联合优化等技术. 参数稀疏化技术通过将模型中的参数稀疏化, 即将一些模型中的参数设置为零或
接近零, 从而减少需要传输的参数数量, 这可以通过稀疏矩阵或截断梯度等技术来实现. 对于联邦学习中的稀疏化
机制, Stich 等人 [23] 通过跟踪内存中积累的误差从而在联邦学习中引入误差补偿机制来提高模型压缩的训练性能.
在联邦学习中, 通常需要传输梯度信息以更新全局模型. 梯度量化技术将高精度的梯度信息量化为低精度的形式,
从而减少传输的数据量, 这种方法可以通过减少梯度的位数或使用更少的比特来实现. Basu 等人 [24] 提出使用量化
器 (随机或确定性 1 位符号) 结合稀疏化和误差补偿来实现进一步的模型压缩并减少通信资源. 模型压缩算法通
过压缩模型的表示形式来减少模型的大小. 典型的方法包括权重剪枝 [25] 、模型量化 [26] 和低秩分解 [27] 等. 通过这些
技术, 可以大幅减少模型参数的数量, 从而降低传输开销. 联合优化方法 [28] 将模型压缩和联邦学习的优化目标结
合起来进行联合优化. 通过在模型训练过程中考虑通信开销, 可以设计出更加高效的模型压缩策略, 从而降低通信

