Page 240 - 《软件学报》2026年第7期
P. 240
刘子扬 等: 基于个性化联邦学习的跨项目软件缺陷预测方法 2925
8
18 7.4
6.7
15
6 5.3
最佳性能次数 10 平均排名 4 3.0 4.3 4.4 4.6 4.7 4.7
7
6
5
5 2
2 2
0 0 0
0 0
eCPDP
eCPDP
ALMITY
LR
PRIDE-SDP DPDF MNAFM AC-GAN Fed-OLF CodeBERT-PT PRIDE-SDP AC-GAN ALMITY Fed-OLF LR DPDF MNAFM CodeBERT-PT
(a) 各方法获得最佳性能次数统计 (b) 各方法平均排名
图 4 方法性能统计分析图
这一平均排名结果从另一个维度证实了 PRIDE-SDP 不仅在单项指标上表现出色, 更在整体性能稳定性方面
具有显著优势. 与最佳性能次数统计结果相结合, 可以看出 PRIDE-SDP 既能在多个评估场景中达到最优性能, 又
能在其他场景中保持相对较好的排名位置, 体现了良好的泛化能力和鲁棒性. 相比之下, 某些方法虽然在特定场景
下表现突出 (如 MNAFM 在 GitHub-Python 数据集上的优异表现), 但在整体平均排名上并未获得相应的优势, 这
表明这些方法可能存在性能波动较大或适用场景相对有限的问题.
● RQ2: 不同隐私预算对 PRIDE-SDP 有何影响?
为了验证不同隐私预算对方法的精度影响, 实验测试了 5 种不同的隐私预算设置: ε ∈ {0.1, 0.5, 1.0, 5.0, 10.0},
对 应 从 强 隐 私 保 护 到 弱 隐 私 保 护 的 梯 度 . 差 分 隐 私 噪 声 按 照 高 斯 机 制 添 加 , 其 中 , 梯 度 噪 声 尺 度 为 σ =
( √ )/ −5
sensitivity· 2ln(1.25/δ) ε, 参数噪声为梯度噪声的 1%, 数据噪声为梯度噪声的 5%, δ 值固定为 1×10 . 客户端
贡献度评估机制结合模型性能 (权重 0.6) 和参数更新幅度 (权重 0.4), 仅选择贡献度排名前 80% 的客户端参与模
型聚合.
隐私预算 ε 的大小对 PRIDE-SDP 模型的性能有显著影响, 二者之间存在一种非线性的权衡关系. 总体而言,
随着隐私预算 ε 的增加 (即隐私保护强度减弱), 模型的预测性能会相应提升, 但当 ε 达到一定水平后, 性能提升的
幅度会逐渐减小并趋于稳定.
如表 3 所示, 在最严格的隐私预算 (ε = 0.1) 下, 模型的性能受到显著抑制, 所有数据集组的 AUC 指标均在 0.42–
0.56 之间, 接近甚至低于 0.5 的随机猜测水平. F1-score 也普遍较低, 例如在 GitHub-Python 上仅为 0.335 9. 为实现
极强的隐私保护, 模型需要注入大量噪声, 这严重干扰了有效的知识学习和迁移, 从而导致性能的大幅下降.
表 3 ε 在不同取值时各数据集组平均指标
隐私预算 数据集组 项目数 AUC Accuracy Precision Recall F1-score Specificity
AEEEM 5 0.428 3 0.448 1 0.424 0.532 8 0.449 6 0.374 5
GitHub-Python 3 0.459 1 0.498 8 0.496 0.418 0.335 9 0.599 7
0.1 MDP 6 0.441 3 0.494 8 0.392 7 0.548 9 0.406 5 0.440 6
ReLink 3 0.436 4 0.471 8 0.277 0.454 2 0.341 9 0.487 3
PROMISE 10 0.559 8 0.504 7 0.568 5 0.455 4 0.385 9 0.554 8
AEEEM 5 0.582 4 0.511 4 0.509 5 0.558 1 0.492 0.496 5
GitHub-Python 3 0.616 5 0.569 5 0.598 0.249 1 0.292 6 0.856 2
0.5 MDP 6 0.713 3 0.667 6 0.747 1 0.519 9 0.593 7 0.815 4
ReLink 3 0.526 9 0.547 0.509 6 0.353 1 0.362 0.704 5
PROMISE 10 0.607 9 0.559 1 0.564 9 0.577 0.533 2 0.563 7

