Page 246 - 《软件学报》2026年第7期
P. 246

刘子扬 等: 基于个性化联邦学习的跨项目软件缺陷预测方法                                                    2931


                 到工业界更关注实际的工作量节省效果, 本实验采用了                  MCC、Effort@20%  和  Cost-effectiveness 等工作量感知指
                 标进行评估.
                    (1) MCC (Matthews 相关系数)

                                                         TP×TN −FP×FN
                                          MCC = √                                                    (29)
                                                  (TP+FP)(TP+FN)(TN +FP)(TN +FN)
                    (2) Effort@20% (检查  20%  代码发现的缺陷比例)

                                                              缺陷数 top20%
                                                  Effort@20% =                                        (30)
                                                              总缺陷数
                    (3) Cost-effectiveness (成本效益比)

                                                               发现缺陷数
                                             Cost-effectiveness =                                     (31)
                                                            检查代码行数 (千行)
                    如表  8 所示, PRIDE-SDP 在 EnterpriseSDP 数据集上取得了显著性能提升. 与所有基线方法相比, PRIDE-SDP
                 在 MCC  指标上平均提升了 45.2%, 在 Effort@20%      指标上平均提升了 29.5%, 在 F1-score 指标上平均提升了
                 35.4%. 实验结果验证了 PRIDE-SDP 在企业级软件缺陷预测场景下的有效性与可推广性.

                                       表 8 EnterpriseSDP  数据集上不同方法的性能对比结果

                    评估指标       PRIDE-SDP  LR   DPDF   eCPDP  CodeBERT-PT  MNAFM  AC-GAN  Fed-OLF  ALMITY
                      MCC         0.623   0.347  0.389  0.361   0.423     0.408   0.445   0.479   0.581
                    Effort@20%    0.684   0.478  0.495  0.463   0.521     0.506   0.548   0.578   0.635
                  Cost-effectiveness  1.847  1.178  1.234  1.156  1.298   1.267   1.356   1.892   2.150
                     F1-score     0.678   0.431  0.467  0.418   0.489     0.472   0.517   0.589   0.622
                 注: 加粗数字表示各评估指标的最佳性能值

                  6   有效性威胁


                  6.1   构造有效性
                    ● 隐私保护度量的构念效度限制
                    本文采用抵御成员推理攻击的成功率作为评估隐私保护效果的代理指标. 该方法是领域内衡量隐私泄露风险
                 的常用实证手段, 但其构念效度存在一定限制, 因为它主要评估单一攻击类型, 未能完全涵盖 (如模型倒推攻击
                 等) 更广泛的隐私威胁谱系.
                    为应对这一效度威胁并建立更坚实的隐私保障, 本框架的核心设计集成了提供严格数学证明的 (ε, δ)-差分隐
                 私机制. 该机制从理论上保证了在严格定义下的隐私边界, 其保障范围不依赖于对特定攻击的假设. 因此, 本实验
                 中的成员推理攻击评估, 应被视为对理论隐私保障在实际场景中有效性的一个实证检验, 而非对框架整体隐私保
                 护能力的唯一或完备度量. 框架的隐私安全性根本在于其可证明的理论根基.
                    ● 评估指标的构念效度与生态效度平衡
                    为全面衡量框架高性能与实用化的综合效用, 本文采用了差异化评估策略: 在公开数据集上使用                             AUC、F1-score
                 等通用学术指标; 在企业数据集上, 则补充了             MCC、Effort@20% 等工业界更关注的实用性指标. 这种策略虽增强
                 了研究结论的生态效度 (即贴近真实应用场景), 但也可能因指标集不一致而影响不同实验间结果的直接可比性,
                 从而对构念效度构成潜在挑战.
                    为平衡此矛盾, 本文在企业数据集实验中同步报告了                  F1  指标, 确保了与公开数据集实验结果的可比性基础.
                 在此基础上, 引入的工业界专用指标则专门用于评估方法在实际部署环境中的具体价值, 二者结合共同提供了对
                 框架效用更全面、更具层次的测量.
                  6.2   内部有效性
                    内部有效性关注实验过程中的控制变量和潜在偏差是否可能影响因果结论的建立. 为确保对比的公平性, 基
   241   242   243   244   245   246   247   248   249   250   251