Page 242 - 《软件学报》2026年第7期
P. 242
刘子扬 等: 基于个性化联邦学习的跨项目软件缺陷预测方法 2927
进一步增加至 [5.0, 10.0] 时, 边际收益转为显著的负值 (−4.17%). 这一显著的性能回退表明, 模型在 ε = 5.0 处已达
到综合性能峰值, 继续放宽隐私预算反而会引入过拟合或噪声失效风险, 从而验证了 ε 作为性能最优隐私预算设
置的合理性.
为了直观地展示 PRIDE-SDP 在最优隐私预算 (ε = 5.0) 下的性能表现, 图 6 对所有项目的实验结果进行了多
维度可视化分析.
基准线
1.0 AEEEM
MC1
jedit-4.1 GitHub-Python
tomcat
ivy-2.0 MDP
ant-1.3
Lucene 0.8 ReLink
CM1
MW1 PROMISE
EQ
Xalan-2.4
KC1 0.6
synapse-1.2
Safe
Apache 召回率
django
PDE
poi-2.0 0.4
JDT
PC1
prop-6
nova
Zxing 0.2
log4j-1.2
JM1
CoreFX
camel-1.6
Mylyn 0
0 0.1 0.2 0.3 0.4 0.5 0.6 0.7 0.8 0.9 0 0.2 0.4 0.6 0.8 1.0
AUC值 精确率
(a) AUC 性能排序 (b) 精确率-召回率分析
0.8
0.7 精确率 准确率
MC1
0.6 jedit-4.1
tomcat
0.5 ivy-2.0
平均值 0.4 0.6 0.8 1.0
0.3 0.2 0.4
召回率 AUC
0.2
0.1
0
AEEEM GitHub-Python MDP PROMISE ReLink
数据集组
AUC F1值 准确率 几何均值 F1值 几何均值
(c) 数据集组性能对比 (d) 前4名项目对比
图 6 ε = 5 时所有数据集性能表现可视化分析效果图
AUC 性能分布: 图 6(a) 展示了所有 27 个项目的 AUC 性能排序. 可以看出, 模型在绝大多数项目上都取得了
远超随机猜测 (AUC = 0.5) 的性能, 其中多个项目的 AUC 值超过 0.8, 显示了强大的预测能力. 同时, 图中性能的显
著差异也反映了不同软件项目间的固有异构性, PRIDE-SDP 在不同项目上表现出了差异化的适应性.
精确率与召回率平衡: 图 6(b) 进一步揭示了模型的分类特性. 大部分项目 (数据点) 分布在图的右上方区域,
表明模型在保证一定查准率的同时, 能够实现较高的查全率. 许多数据点位于对角线 (y = x) 上方, 说明模型倾向于
优先保证高召回率, 这在缺陷预测任务中通常是期望的特性, 因为它有助于识别出更多的潜在缺陷.
跨数据集组的宏观性能: 图 6(c) 从数据集组的宏观视角对比了平均性能. 结果显示, 模型在 PROMISE、MDP
和 ReLink 等数据集组上取得了更优的综合性能 (以 AUC 和 F1 值为代表), 这可能与这些数据集组内部的项目同
质性更高、联邦学习的协同效应更显著有关.
最优性能剖析: 图 6(d) 通过雷达图展示了性能排名靠前项目在多个评价指标上的表现. 可以看出, 这些表现
优异的项目在 6 项评价指标上均达到了较高水平, 形成了较为饱满且均衡的雷达图轮廓. 这表明 PRIDE-SDP 在最
优情况下能够兼顾查准率、查全率、泛化能力和整体准确性, 而不仅仅是优化单一指标.
● RQ3: PRIDE-SDP 是否能做到保护数据隐私?
本文构建了一个成员推理攻击场景, 其中攻击者试图推断特定数据样本是否参与了联邦学习模型的训练过程.
考虑到攻击者在实际场景中的能力限制, 成员推理攻击模型采用轻量级的 3 层全连接神经网络. 该设计遵循了隐

