Page 227 - 《软件学报》2026年第7期
P. 227

2912                                                       软件学报  2026  年第  37  卷第  7  期


                 techniques.  First,  a  personalized  federated  learning  paradigm  is  adopted  to  customize  dedicated  prediction  models  for  heterogeneous
                 projects. Second, an (ε, δ)-differential privacy mechanism with rigorous mathematical guarantees is integrated to ensure that data remains local.
                 Third,  a  dedicated  temporal-contextual  fusion  network  (TCFN)  is  designed  to  efficiently  capture  software  metric  features.  Experiments
                 conducted  on  six  dataset  groups  covering  27  open-source  projects  and  3  enterprise  projects  validate  the  effectiveness  of  the  proposed
                 framework. Compared with state-of-the-art cross-project defect prediction baselines, PRIDE-SDP achieves an average improvement of 10.7%
                 in  AUC  and  7.3%  in  F1-score.  More  pronounced  performance  gains  are  observed  on  enterprise  datasets,  where  average  improvements  of
                 45.2%  in  MCC,  29.5%  in  Effort@20%,  and  35.4%  in  F1-score  are  obtained  over  all  advanced  baseline  methods.  Meanwhile,  under  strong
                 privacy  guarantees,  the  framework’s  average  performance  retention  rate  remains  above  98%  of  the  optimal  performance,  and  the  attack
                 accuracy  in  membership  inference  attack  experiments  is  reduced  by  more  than  36%  on  average.  Experimental  results  demonstrate  that
                 PRIDE-SDP effectively balances high predictive performance with privacy protection and personalized adaptation capabilities.
                 Key words:  software defect prediction (SDP); personalized federated learning; differential privacy; cross-project defect prediction

                    软件缺陷预测 (software defect prediction, SDP) 作为软件质量保证的核心技术之一, 旨在通过分析历史代码特
                 征和缺陷模式, 识别潜在的有缺陷模块, 从而指导测试资源的合理分配                      [1] . 在现代软件开发环境中, 软件系统的规
                 模和复杂性呈指数级增长, 手动检测所有可能的缺陷已变得不现实且成本高昂. Ostrand                         等人  [2] 的经典研究表明,
                 软件缺陷通常遵循帕累托分布, 即大部分缺陷集中在少数代码模块中, 该分布特征为缺陷预测技术的发展奠定了
                 重要理论基础, 同时表明, 精准的缺陷预测能够针对性优化测试资源分配, 显著提升测试效率.
                    近年来, 机器学习和深度学习技术在软件缺陷预测领域得到了广泛应用. Nam                        等人  [3] 提出了基于迁移学习的
                 缺陷预测方法, 通过扩展 TCA        显著提升了跨项目预测性能. Wang         等人  [4] 提出的  DeepLearning-based  缺陷预测方
                 法, 通过自动学习代码的抽象语义特征, 在多个基准数据集上达到了                     state-of-the-art 的性能. Li 等人  [5] 的研究进一
                 步验证了深度学习模型在处理高维软件度量特征方面的优势.
                    尽管单项目内的缺陷预测技术已相对成熟, 但跨项目缺陷预测仍面临显著挑战. He 等人                          [6] 的大规模实证研究
                 发现, 传统的跨项目缺陷预测方法的           F1-score 普遍比项目内预测低. 这种性能退化主要源于不同项目间的异构性,
                 包括编程语言差异、开发流程不同、代码风格各异等因素. Turhan                   等人  [7] 的研究通过分析大量开源项目, 证实了
                 项目间数据分布差异是影响跨项目预测性能的关键因素.
                    联邦学习作为一种新兴的分布式机器学习范式, 为解决数据隐私和异构性问题提供了新的途径. McMahan                               等
                 人  [8] 首次系统性地提出了联邦学习的概念和          FedAvg  算法. Li 等人  [9] 进一步提出了  FedProx  算法, 通过引入近端项
                 来处理异构客户端环境下的模型训练问题. Yang              等人  [10] 的综述文章全面总结了联邦学习的发展现状和面临的挑
                 战. Lin  等人  [11] 的反馈式调试方法  Microbat 通过轻量级用户反馈指导调试过程, 这种人机交互的思路对于联邦学
                 习中的模型优化具有借鉴意义.
                    个性化联邦学习 (personalized federated learning) 作为联邦学习的重要发展方向, 旨在为每个参与方提供定制
                 化模型. Dinh  等人  [12] 提出的  pFedMe  算法, 通过双层优化框架实现了全局知识共享与个性化模型训练的平衡.
                 Wang  等人  [13] 提出的  FedNova 算法, 通过归一化聚合机制缓解了异构客户端在本地更新步数不一致条件下引入的
                 优化偏差, 为异构环境下的联邦模型聚合提供了理论保障.
                    在隐私保护方面, 差分隐私 (differential privacy) 已成为机器学习中隐私保护的黄金标准. Dwork              [14] 建立了差
                 分隐私的理论基础. Abadi 等人      [15] 提出了深度学习中的差分隐私训练方法. Wei 等人           [16] 将差分隐私机制引入联邦
                 学习训练过程, 为联邦学习中的隐私保护机制设计提供了重要理论依据.
                    本文旨在填补现有研究的空白, 为跨项目软件缺陷预测提供一个兼顾隐私保护、异构性适应和模型性能的综
                 合性解决方案. 本文的主要贡献总结如下.
                    (1) 提出一个新颖的个性化联邦学习框架. 本文提出了                PRIDE-SDP (personalized privacy-preserving federated
                 software defect prediction) 框架. 该框架专为软件缺陷预测场景设计, 通过个性化联邦学习范式解决跨项目协作中
                 的数据隐私和项目异构性双重挑战, 为工业界实际应用提供新的范式.
                    (2) 设计一个专用的混合模型. 本文设计了一种名为时间-上下文融合网络 (temporal-contextual fusion network,
                 TCFN) 的深度神经网络模型适配         PRIDE-SDP  框架. 该模型融合了 LSTM 的时序编码能力与 Transformer 的全局
   222   223   224   225   226   227   228   229   230   231   232