Page 230 - 《软件学报》2026年第7期
P. 230
刘子扬 等: 基于个性化联邦学习的跨项目软件缺陷预测方法 2915
斯学习方法, 通过最大化缺陷类检测概率、最小化假阳性率来优化整体性能.
2.5 集成学习与多源方法
集成学习技术在提高跨项目缺陷预测鲁棒性方面发挥了重要作用. Xia 等人 [40] 提出了 HYDRA 模型, 通过结
合遗传算法和集成学习实现多重分类器组合. 该模型能够通过迭代过程调优多个分类器, 在 29 个数据集上超过了
多种现有方法. Sharma 等人 [41] 提出了基于集成学习的框架 HIEL, 结合自适应加权多数投票策略优化测试资源分
配. Tong 等人 [42] 提出了多源转移加权集成学习方法 MASTER, 通过度量每个源数据集的权重, 有效提取了来自多
个源数据集的可转移知识.
2.6 联邦学习方法
随着数据隐私保护需求的日益增长, 联邦学习技术在软件工程领域受到越来越多的关注. Xia 等人 [43] 提出了
HRFL 框架, 通过单边选择算法和客户端置信度重加权机制处理异构缺陷预测中的标签噪声问题. Wang 等人 [44]
的 FedDPI 框架采用两阶段协同优化机制, 通过继承私有模型和差分感知协作算法解决跨项目数据异构性问题.
Yang 等人 [45] 提出的 ALMITY 框架专门针对学术研究与工业应用之间的鸿沟, 设计了考虑数据规模、数据平衡度
和少数类可学习性的参数聚合策略.
在隐私保护方面, Liu 等人 [46] 构建了联邦软件缺陷预测 (FedSDP) 基准, 并提出采用 Paillier 部分同态加密技
术对模型参数进行加密, 以抵御基于参数的推理攻击.
此外, 基于执行对比与用户反馈的智能调试方法也逐渐应用于软件工程任务中. 例如, ERASE 通过双版本轨
迹对齐实现高精度回归缺陷解释 [47] , 而 CLUSTER 则利用代码依赖传播有限反馈以优化可追溯性恢复 [48] .
2.7 现有方法的局限性分析
尽管跨项目缺陷预测研究已取得显著进展, 但仍存在若干关键局限.
一方面, 数据隐私保护问题尚未得到充分重视. 现有研究大多基于公开的学术数据集进行实验验证, 而缺乏在
工业级真实数据集上的系统性应用与评估. 这种差距限制了相关方法在实际场景中的可推广性与可靠性.
另一方面, 异构性处理仍显不足. 虽然已有方法尝试通过特征变换、域适应等技术缓解项目间差异, 但多数模
型依赖统一的全局策略, 难以针对不同项目的特定特征进行自适应优化. Herbold 等人 [23] 的基准测试研究指出, 现
有 CPDP 方法的整体性能仍未达到可广泛应用于工业实践的水平.
此外, 类不平衡问题的研究深度仍然有限. 现有工作主要集中于采样策略与代价敏感学习, 而缺乏针对软件工
程数据特征的专门化方法. Vescan 等人 [49] 的复现性研究进一步表明, 在不同特征选择策略下, 监督与无监督学习
方法的相对性能存在显著差异.
总体来看, 现有研究缺乏统一的理论框架. 多数方法仅针对特定问题提出局部解决方案, 尚未形成能够综合考
虑隐私保护、异构性适应与性能优化的系统化框架. 这种割裂的研究模式使得实际应用中往往需要组合多种技
术, 增加了系统复杂度与维护成本.
为应对上述挑战, 本文提出 PRIDE-SDP 框架通过个性化联邦学习实现跨项目知识共享, 在保护数据隐私的前
提下提升模型泛化能力. 同时, 引入差分隐私机制以提供严格的隐私保障, 为突破现有方法的局限性提供了一种新
的技术路径.
3 研究方法
本节详细阐述 PRIDE-SDP 框架的技术方案. 该框架通过个性化联邦学习和差分隐私技术的组合, 在保护数据
隐私的前提下实现跨项目软件缺陷预测. 如后文图 2 所示, PRIDE-SDP 框架采用分布式架构设计, 主要包含数据
收集与预处理、客户端模型结构和个性化联邦学习这 3 个核心模块.
3.1 框架总体设计
PRIDE-SDP 框架基于联邦学习范式构建, 旨在解决企业内部多项目组间数据隔离导致的跨项目缺陷预测难

