Page 227 - 《软件学报》2026年第7期
P. 227
2912 软件学报 2026 年第 37 卷第 7 期
techniques. First, a personalized federated learning paradigm is adopted to customize dedicated prediction models for heterogeneous
projects. Second, an (ε, δ)-differential privacy mechanism with rigorous mathematical guarantees is integrated to ensure that data remains local.
Third, a dedicated temporal-contextual fusion network (TCFN) is designed to efficiently capture software metric features. Experiments
conducted on six dataset groups covering 27 open-source projects and 3 enterprise projects validate the effectiveness of the proposed
framework. Compared with state-of-the-art cross-project defect prediction baselines, PRIDE-SDP achieves an average improvement of 10.7%
in AUC and 7.3% in F1-score. More pronounced performance gains are observed on enterprise datasets, where average improvements of
45.2% in MCC, 29.5% in Effort@20%, and 35.4% in F1-score are obtained over all advanced baseline methods. Meanwhile, under strong
privacy guarantees, the framework’s average performance retention rate remains above 98% of the optimal performance, and the attack
accuracy in membership inference attack experiments is reduced by more than 36% on average. Experimental results demonstrate that
PRIDE-SDP effectively balances high predictive performance with privacy protection and personalized adaptation capabilities.
Key words: software defect prediction (SDP); personalized federated learning; differential privacy; cross-project defect prediction
软件缺陷预测 (software defect prediction, SDP) 作为软件质量保证的核心技术之一, 旨在通过分析历史代码特
征和缺陷模式, 识别潜在的有缺陷模块, 从而指导测试资源的合理分配 [1] . 在现代软件开发环境中, 软件系统的规
模和复杂性呈指数级增长, 手动检测所有可能的缺陷已变得不现实且成本高昂. Ostrand 等人 [2] 的经典研究表明,
软件缺陷通常遵循帕累托分布, 即大部分缺陷集中在少数代码模块中, 该分布特征为缺陷预测技术的发展奠定了
重要理论基础, 同时表明, 精准的缺陷预测能够针对性优化测试资源分配, 显著提升测试效率.
近年来, 机器学习和深度学习技术在软件缺陷预测领域得到了广泛应用. Nam 等人 [3] 提出了基于迁移学习的
缺陷预测方法, 通过扩展 TCA 显著提升了跨项目预测性能. Wang 等人 [4] 提出的 DeepLearning-based 缺陷预测方
法, 通过自动学习代码的抽象语义特征, 在多个基准数据集上达到了 state-of-the-art 的性能. Li 等人 [5] 的研究进一
步验证了深度学习模型在处理高维软件度量特征方面的优势.
尽管单项目内的缺陷预测技术已相对成熟, 但跨项目缺陷预测仍面临显著挑战. He 等人 [6] 的大规模实证研究
发现, 传统的跨项目缺陷预测方法的 F1-score 普遍比项目内预测低. 这种性能退化主要源于不同项目间的异构性,
包括编程语言差异、开发流程不同、代码风格各异等因素. Turhan 等人 [7] 的研究通过分析大量开源项目, 证实了
项目间数据分布差异是影响跨项目预测性能的关键因素.
联邦学习作为一种新兴的分布式机器学习范式, 为解决数据隐私和异构性问题提供了新的途径. McMahan 等
人 [8] 首次系统性地提出了联邦学习的概念和 FedAvg 算法. Li 等人 [9] 进一步提出了 FedProx 算法, 通过引入近端项
来处理异构客户端环境下的模型训练问题. Yang 等人 [10] 的综述文章全面总结了联邦学习的发展现状和面临的挑
战. Lin 等人 [11] 的反馈式调试方法 Microbat 通过轻量级用户反馈指导调试过程, 这种人机交互的思路对于联邦学
习中的模型优化具有借鉴意义.
个性化联邦学习 (personalized federated learning) 作为联邦学习的重要发展方向, 旨在为每个参与方提供定制
化模型. Dinh 等人 [12] 提出的 pFedMe 算法, 通过双层优化框架实现了全局知识共享与个性化模型训练的平衡.
Wang 等人 [13] 提出的 FedNova 算法, 通过归一化聚合机制缓解了异构客户端在本地更新步数不一致条件下引入的
优化偏差, 为异构环境下的联邦模型聚合提供了理论保障.
在隐私保护方面, 差分隐私 (differential privacy) 已成为机器学习中隐私保护的黄金标准. Dwork [14] 建立了差
分隐私的理论基础. Abadi 等人 [15] 提出了深度学习中的差分隐私训练方法. Wei 等人 [16] 将差分隐私机制引入联邦
学习训练过程, 为联邦学习中的隐私保护机制设计提供了重要理论依据.
本文旨在填补现有研究的空白, 为跨项目软件缺陷预测提供一个兼顾隐私保护、异构性适应和模型性能的综
合性解决方案. 本文的主要贡献总结如下.
(1) 提出一个新颖的个性化联邦学习框架. 本文提出了 PRIDE-SDP (personalized privacy-preserving federated
software defect prediction) 框架. 该框架专为软件缺陷预测场景设计, 通过个性化联邦学习范式解决跨项目协作中
的数据隐私和项目异构性双重挑战, 为工业界实际应用提供新的范式.
(2) 设计一个专用的混合模型. 本文设计了一种名为时间-上下文融合网络 (temporal-contextual fusion network,
TCFN) 的深度神经网络模型适配 PRIDE-SDP 框架. 该模型融合了 LSTM 的时序编码能力与 Transformer 的全局

