Page 239 - 《软件学报》2026年第7期
P. 239

2924                                                       软件学报  2026  年第  37  卷第  7  期


                                    表 2    各个跨项目缺陷基线方法在全部数据集组的对比结果                (续)

                  数据集组    评估指标    PRIDE-SDP  LR    DPDF  eCPDP  CodeBERT-PT  MNAFM  AC-GAN  Fed-OLF  ALMITY
                            AUC     0.712 3  0.679 5  0.710 9  0.689 3  0.604 7  0.576 4  0.693 4  0.678 9  0.678 7
                          Accuracy  0.656 7  0.642 7  0.620 8  0.646 2  0.608 3  0.572 1  0.637 8  0.624 5  0.660 4
                          Precision  0.647 1  0.676 3  0.806 9  0.657 9  0.609 8  0.563 9  0.664 5  0.644 5  0.631 5
                           Recall   0.630 8  0.510 6  0.298 1  0.566  0.593 4  0.525 5  0.582 3  0.574 5  0.572 9
                  AEEEM
                           F1-score  0.635  0.574 3  0.398  0.605 2  0.601 5  0.541 4  0.620 7  0.606 7  0.600 7
                          Specificity  0.675 1  0.760 5  0.908 8  0.710 5  0.615 6  0.606 3  0.683 4  0.673 4  0.756 3
                           G-mean    0.647  0.615 3  0.487 1  0.629 5  0.604 4  0.559 3  0.630 9  0.622 3  0.658 2
                           Balance  0.652 9  0.635 5  0.603 4  0.638 3  0.604 5  0.565 9  0.632 8  0.624  0.664 6
                            AUC     0.741 1  0.739 9  0.740 4  0.424 9  0.609 1  0.704 4  0.718 9  0.715 6  0.671 3
                          Accuracy  0.677 9  0.679 5  0.684 9  0.454 2  0.609 9  0.664 1  0.673 4  0.663 4  0.652 8
                          Precision  0.669  0.691 1  0.727 7  0.437 2  0.624 5  0.665 5  0.682 3  0.673 4  0.627 3
                           Recall   0.682 5  0.603 3  0.544 4  0.573  0.582 3  0.628 8  0.656 7  0.644 5  0.595 1
                  PROMISE
                           F1-score  0.661 9  0.638 8  0.612 4  0.486 7  0.602 7  0.636 9  0.669 4  0.658 7  0.610 8
                          Specificity  0.671 8  0.650 2  0.805 9  0.334 8  0.638 7  0.691 5  0.678 9  0.682 3  0.720 6
                           G-mean   0.669 2  0.667 8  0.649 1  0.384 8  0.609 8  0.648 0  0.667 7  0.663 2  0.654 9
                           Balance  0.677 2  0.626 7  0.675 1  0.453 9  0.610 5  0.660 2  0.667 8  0.663 4  0.657 9
                 注: 加粗数字表示各评估指标在对应数据集上的最佳性能值

                    实验结果表明, PRIDE-SDP     框架在大多数数据集上展现出优异的综合性能. 在                 MDP  数据集上, PRIDE-SDP
                 在  8  个评估指标中的    7  个指标上取得最佳性能, 表明该框架能够有效处理              MDP  数据集中源项目与目标项目之间
                 的异构性问题, 实现较为准确的缺陷预测. 在              AEEEM  数据集上, PRIDE-SDP   同样表现出色, 在     AUC (0.712 3)、
                 F1-score (0.635) 和  Recall (0.630 8) 等关键指标上取得最佳性能. 在  PROMISE  数据集上, PRIDE-SDP  在  AUC (0.741 1)、
                 Recall (0.682 5)、G-mean (0.669 2) 和  Balance (0.677 2) 这  4  个指标上保持领先, 但  DPDF  在  Accuracy (0.684 9)、
                 Precision (0.727 7) 和  Specificity (0.805 9) 指标上表现更佳, AC-GAN  则在  F1-score (0.669 4) 指标上取得最优结果.
                 ReLink  数据集的实验结果呈现出类似的分化特征. PRIDE-SDP            在  AUC (0.711) 和  Recall (0.624 2) 指标上保持最
                 优, 但在其他指标上面临来自多个强基线的挑战. 其中, DPDF                  在  Accuracy (0.666 9) 指标上表现最佳, LR  在
                 Precision (0.703 1) 和  Specificity (0.808 5) 指标上占据优势, AC-GAN  在  F1-score (0.627 6) 指标上领先, ALMITY
                 则在  G-mean (0.662 7) 和  Balance (0.666 6) 指标上表现突出. 在  GitHub-Python  数据集上, MNAFM  方法表现尤为
                 突出, 在  AUC (0.727 8)、Accuracy (0.677 2)、Precision (0.659 9)、Recall (0.601 2)、F1-score (0.628 9) 和  G-mean (0.667 5)
                 等  6  个指标中均获得最佳性能, 全面超越了          PRIDE-SDP  的对应表现. 这一现象可能与        GitHub-Python  数据集的特
                 有属性相关, 该数据集中的部分项目具有较高的缺陷密度. 尽管如此, PRIDE-SDP                   在该数据集的     Specificity (0.793 3)
                 指标上仍保持最优性能, 体现了其在特异性识别方面的相对优势.
                    如图  4  所示, 统计分析结果进一步验证了         PRIDE-SDP  在多数评估场景中的优越性能. 图         4(a) 展示了各方法在
                 40  个评估场景中获得最佳性能的频次分布. 结果显示, PRIDE-SDP             获得  18  次最佳性能, 占总评估场景的       45%, 远超
                 其他所有基线方法. DPDF      获得  7  次最佳性能, MNAFM   获得  6  次最佳性能, ALMITY   获得  5  次最佳性能, 展现了在
                 特定评估指标上的竞争优势. LR         和  AC-GAN  各获得  2  次最佳性能, 而  eCPDP、CodeBERT-PT  和  Fed-OLF  在所有
                 评估场景中均未能取得最优表现. 这一频次分布清晰地反映了                   PRIDE-SDP  在跨项目缺陷预测任务中的整体优势和
                 稳定性.
                    图  4(b) 展示了各方法的平均排名情况, 该指标能够更全面地评估方法的综合性能稳定性. 平均排名的计算方
                 法如下: 首先在每个数据集的每个评估指标上, 将所有                9 种方法按性能从高到低进行排序, 分别赋予            1–9 的排名值;
                 然后计算每种方法在全部         40  个评估场景中排名的算术平均值, 排名数值越小表示该方法的整体性能越优异. 结果
                 表明, PRIDE-SDP  以  3.0  的平均排名位居首位, 显著优于其他方法. AC-GAN          和  ALMITY  的平均排名分别为      4.3
                 和  4.4, 位列第  2 梯队. Fed-OLF 以  4.6 的排名略优于  LR  和  DPDF. eCPDP 和  CodeBERT-PT  的平均排名分别为  6.7 和  7.4.
   234   235   236   237   238   239   240   241   242   243   244