Page 277 - 《软件学报》2026年第6期
P. 277
2596 软件学报 2026 年第 37 卷第 6 期
5.2.2 深层网络的梯度压缩策略
在深度学习推荐系统中, 深层网络通常由多层非线性全连接层 (如第 3 层及之后的 MLP 层) 构成, 其主要
功能是进一步建模用户和物品之间的高阶非线性交互关系. 深层网络的梯度矩阵因参数规模庞大而成为通信
开销的主要来源. 深度学习模型往往需要传输数百万至数十亿的参数梯度, 尤其在推荐系统中, 用户和物品数
量极为庞大, 嵌入层和神经元层的参数随规模成倍增长, 导致梯度矩阵的数据量进一步膨胀. 在联邦学习场景
中, 客户端每轮需上传本地训练后的完整梯度至服务器进行全局聚合, 这一过程伴随的大量梯度数据传输, 不
仅显著增加了通信延迟, 还对带宽和存储提出了严苛要求. 频繁的梯度更新进一步加剧了通信成本问题, 影响
了模型的收敛速度与整体性能. 因此, 设计高效的梯度压缩策略以缓解通信开销成为联邦学习推荐系统的关
键挑战.
为解决上述问题, 本文提出一种梯度压缩策略, 从优化梯度传输角度全面降低通信开销. 在深度学习模型中,
梯度矩阵往往表现出长尾分布的特性, 即仅少数梯度元素对模型性能优化起到关键作用, 而大部分梯度幅值较小,
其在参数更新中的贡献有限, 甚至可能引入额外的噪声干扰 [46] . 若直接传输完整的梯度矩阵不仅浪费了大量的通
信资源, 还会导致无效梯度信息干扰模型优化过程. 为此, 本文设计了一种两阶段的梯度压缩机制, 分别包括稀疏
化选择与梯度裁剪与扰动. 该机制一方面减少冗余梯度的传输量, 降低通信负担; 另一方面通过控制梯度幅值范围
并注入噪声, 有效实现差分隐私保护. 在稀疏化过程中, 通过动态计算阈值 τ, 筛选出幅值绝对值较大的关键梯度,
其余元素置零. 具体定义如下:
∇w ij , ∇w ij ⩾ τ
′ (12)
i j
∇w =
0,
∇w i j < τ
k
其中, 阈值 τ 可以通过梯度幅值分布的动态统计特性进行调整. 例如, 选择梯度绝对值排名前 的元素, 或者通过
sparsity = k/n 的方式确定, 保留对模型优化贡献最大的梯度. 稀疏化有效减少了传输梯度的数量, 在
设定稀疏比例
降低通信成本的同时保留了模型优化的关键信息. 为了进一步控制梯度幅值范围并提升通信稳定性, 稀疏化后的
梯度矩阵需进行裁剪操作. 梯度裁剪的目标是限制过大梯度对模型训练和传输效率的负面影响. 裁剪操作通过约
束梯度矩阵的 L 2 范数实现, 数学表达为:
( )
C
′
∇W clip = ∇W ×min 1, (13)
′
||∇W || 2
当梯度的 L 2 -范数超过预设值 C 时, 裁剪操作对梯度进行缩放, 使其幅值不会超过预设的上限. 此过程不仅减
少了过大梯度引起的不稳定性, 还为后续的隐私保护提供了计算基础. 其次, 为保障隐私安全并防止通过梯度逆推
∇W clip 进一步进行裁剪并添加高斯噪声实现差分隐私保护. 具体数学表达为:
出用户数据, 本文对
( )
P ( )
∇W = ∇W clip ×min 1, + N 0,σ P 2 (14)
2
g
||∇W clip ||
2
2 2 2 2 σ 为噪声幅度参数. 确保每轮更新中的梯度满
其中, 高斯噪声 N(0,σ P ) 为零均值、方差为 σ P 的正态分布噪声,
足 ϵ -差分隐私保护要求. 即使攻击者获得上传的梯度信息, 也难以准确重构用户的敏感数据.
通过稀疏化、裁剪及高斯噪声保护的结合, 本文的梯度压缩策略显著减少了传输梯度的体积和通信成本, 有
效缓解了联邦学习中通信资源不足的问题, 同时保证了梯度传输的稳定性与隐私保护. 在计算开销方面, 客户端每
轮仅更新子模型对应的浅层网络参数与稀疏梯度, 显著减少了局部计算负担, 避免了深层全模型参与所带来的资
源开销. 该策略在通信效率、隐私保护与计算复杂度之间实现了良好平衡, 为联邦学习推荐系统在大规模场景下
的高效部署提供了理论支持.
5.2.3 Priv-FedNCF-Sub-Compress 算法概述
该算法通过服务器端与客户端的协作, 在保障用户隐私的同时降低通信成本. 具体而言, 服务器端负责选择适
配的子模型与深层网络模型参数, 并分发至客户端进行本地训练; 客户端在训练过程中对梯度和模型更新进行裁
剪并加入差分隐私噪声后, 将扰动后的模型参数上传至服务器端进行聚合更新. 算法引入了 DP-SUB 子模型选择

