Page 239 - 《软件学报》2026年第7期
P. 239
2924 软件学报 2026 年第 37 卷第 7 期
表 2 各个跨项目缺陷基线方法在全部数据集组的对比结果 (续)
数据集组 评估指标 PRIDE-SDP LR DPDF eCPDP CodeBERT-PT MNAFM AC-GAN Fed-OLF ALMITY
AUC 0.712 3 0.679 5 0.710 9 0.689 3 0.604 7 0.576 4 0.693 4 0.678 9 0.678 7
Accuracy 0.656 7 0.642 7 0.620 8 0.646 2 0.608 3 0.572 1 0.637 8 0.624 5 0.660 4
Precision 0.647 1 0.676 3 0.806 9 0.657 9 0.609 8 0.563 9 0.664 5 0.644 5 0.631 5
Recall 0.630 8 0.510 6 0.298 1 0.566 0.593 4 0.525 5 0.582 3 0.574 5 0.572 9
AEEEM
F1-score 0.635 0.574 3 0.398 0.605 2 0.601 5 0.541 4 0.620 7 0.606 7 0.600 7
Specificity 0.675 1 0.760 5 0.908 8 0.710 5 0.615 6 0.606 3 0.683 4 0.673 4 0.756 3
G-mean 0.647 0.615 3 0.487 1 0.629 5 0.604 4 0.559 3 0.630 9 0.622 3 0.658 2
Balance 0.652 9 0.635 5 0.603 4 0.638 3 0.604 5 0.565 9 0.632 8 0.624 0.664 6
AUC 0.741 1 0.739 9 0.740 4 0.424 9 0.609 1 0.704 4 0.718 9 0.715 6 0.671 3
Accuracy 0.677 9 0.679 5 0.684 9 0.454 2 0.609 9 0.664 1 0.673 4 0.663 4 0.652 8
Precision 0.669 0.691 1 0.727 7 0.437 2 0.624 5 0.665 5 0.682 3 0.673 4 0.627 3
Recall 0.682 5 0.603 3 0.544 4 0.573 0.582 3 0.628 8 0.656 7 0.644 5 0.595 1
PROMISE
F1-score 0.661 9 0.638 8 0.612 4 0.486 7 0.602 7 0.636 9 0.669 4 0.658 7 0.610 8
Specificity 0.671 8 0.650 2 0.805 9 0.334 8 0.638 7 0.691 5 0.678 9 0.682 3 0.720 6
G-mean 0.669 2 0.667 8 0.649 1 0.384 8 0.609 8 0.648 0 0.667 7 0.663 2 0.654 9
Balance 0.677 2 0.626 7 0.675 1 0.453 9 0.610 5 0.660 2 0.667 8 0.663 4 0.657 9
注: 加粗数字表示各评估指标在对应数据集上的最佳性能值
实验结果表明, PRIDE-SDP 框架在大多数数据集上展现出优异的综合性能. 在 MDP 数据集上, PRIDE-SDP
在 8 个评估指标中的 7 个指标上取得最佳性能, 表明该框架能够有效处理 MDP 数据集中源项目与目标项目之间
的异构性问题, 实现较为准确的缺陷预测. 在 AEEEM 数据集上, PRIDE-SDP 同样表现出色, 在 AUC (0.712 3)、
F1-score (0.635) 和 Recall (0.630 8) 等关键指标上取得最佳性能. 在 PROMISE 数据集上, PRIDE-SDP 在 AUC (0.741 1)、
Recall (0.682 5)、G-mean (0.669 2) 和 Balance (0.677 2) 这 4 个指标上保持领先, 但 DPDF 在 Accuracy (0.684 9)、
Precision (0.727 7) 和 Specificity (0.805 9) 指标上表现更佳, AC-GAN 则在 F1-score (0.669 4) 指标上取得最优结果.
ReLink 数据集的实验结果呈现出类似的分化特征. PRIDE-SDP 在 AUC (0.711) 和 Recall (0.624 2) 指标上保持最
优, 但在其他指标上面临来自多个强基线的挑战. 其中, DPDF 在 Accuracy (0.666 9) 指标上表现最佳, LR 在
Precision (0.703 1) 和 Specificity (0.808 5) 指标上占据优势, AC-GAN 在 F1-score (0.627 6) 指标上领先, ALMITY
则在 G-mean (0.662 7) 和 Balance (0.666 6) 指标上表现突出. 在 GitHub-Python 数据集上, MNAFM 方法表现尤为
突出, 在 AUC (0.727 8)、Accuracy (0.677 2)、Precision (0.659 9)、Recall (0.601 2)、F1-score (0.628 9) 和 G-mean (0.667 5)
等 6 个指标中均获得最佳性能, 全面超越了 PRIDE-SDP 的对应表现. 这一现象可能与 GitHub-Python 数据集的特
有属性相关, 该数据集中的部分项目具有较高的缺陷密度. 尽管如此, PRIDE-SDP 在该数据集的 Specificity (0.793 3)
指标上仍保持最优性能, 体现了其在特异性识别方面的相对优势.
如图 4 所示, 统计分析结果进一步验证了 PRIDE-SDP 在多数评估场景中的优越性能. 图 4(a) 展示了各方法在
40 个评估场景中获得最佳性能的频次分布. 结果显示, PRIDE-SDP 获得 18 次最佳性能, 占总评估场景的 45%, 远超
其他所有基线方法. DPDF 获得 7 次最佳性能, MNAFM 获得 6 次最佳性能, ALMITY 获得 5 次最佳性能, 展现了在
特定评估指标上的竞争优势. LR 和 AC-GAN 各获得 2 次最佳性能, 而 eCPDP、CodeBERT-PT 和 Fed-OLF 在所有
评估场景中均未能取得最优表现. 这一频次分布清晰地反映了 PRIDE-SDP 在跨项目缺陷预测任务中的整体优势和
稳定性.
图 4(b) 展示了各方法的平均排名情况, 该指标能够更全面地评估方法的综合性能稳定性. 平均排名的计算方
法如下: 首先在每个数据集的每个评估指标上, 将所有 9 种方法按性能从高到低进行排序, 分别赋予 1–9 的排名值;
然后计算每种方法在全部 40 个评估场景中排名的算术平均值, 排名数值越小表示该方法的整体性能越优异. 结果
表明, PRIDE-SDP 以 3.0 的平均排名位居首位, 显著优于其他方法. AC-GAN 和 ALMITY 的平均排名分别为 4.3
和 4.4, 位列第 2 梯队. Fed-OLF 以 4.6 的排名略优于 LR 和 DPDF. eCPDP 和 CodeBERT-PT 的平均排名分别为 6.7 和 7.4.

