Page 228 - 《软件学报》2026年第7期
P. 228

刘子扬 等: 基于个性化联邦学习的跨项目软件缺陷预测方法                                                    2913


                 注意力机制, 通过串行级联策略模拟软件缺陷产生的“演化-交互”因果逻辑. 该架构能够捕获高维软件度量数据中
                 复杂的上下文交互关系和时序依赖性.
                    (3) 深度融合差分隐私与个性化算法. 本文将 (ε, δ)-差分隐私机制与个性化联邦学习算法深度结合. 通过引入
                 近端项约束和动态噪声管理策略, 在提供严格数学隐私保障的同时, 实现了全局知识共享与本地模型定制化之间
                 的有效平衡.
                    (4) 在大规模学术界开源数据集进行测试, 并在实际工业项目中进行测试以论证本文所提框架在工业界中实
                 际应用的可能性.

                  1   研究动机

                    在当今企业软件开发环境中, 多项目协同开发已成为常态                   [17] , 但项目间的数据隔离现象却严重阻碍了跨项目
                 软件缺陷预测技术的实际应用. 如图           1  所示, 企业内部的多个项目组虽然面临软件缺陷预测的共同需求, 但由于组
                 织架构、安全策略和合规要求的限制, 各项目组无法直接共享代码和缺陷数据, 形成明显的“数据孤岛”效应. 该现
                 象不仅制约了各项目组对跨项目历史缺陷数据的有效利用, 也导致传统集中式机器学习方法难以在工业实践中部署.

                                                   公司内多个项目组、数据不互通
                                                项目组A      项目组B      项目组C









                                           无法直接用其他项目组的代码进行跨项目软件缺陷预测
                                                    图 1 数据孤岛场景图

                    这一问题的紧迫性在工业界尤为突出. 正如李书缘等人                  [18] 所指出的, 日益严格的隐私安全保护要求, 使得分散
                 异构的多方数据拥有方之间无法直接共享数据, 严重制约了跨组织乃至跨项目的数据协同分析能力. 更为关键的
                 是, 软件开发中普遍存在的强代码所有权文化会形成团队间的数据与知识壁垒                          [19] . 与此同时, 全球数据保护法规
                 的日益严格进一步加剧了这一挑战. 在欧盟《通用数据保护条例》(GDPR)、《网络数据安全管理条例》等条例
                 规定下, 软件源代码及缺陷数据的处理和共享必须满足严格的合规要求. Pasquale 指出, 大规模数据系统中产生的
                 行为数据与元数据在聚合和推断过程中可能暴露高度敏感的隐私信息, 从而引发潜在的法律与合规风险                                   [20] . 该观
                 点表明, 在跨项目软件数据协作场景下, 企业需要更加审慎地评估数据共享与集中处理机制的合规性与风险边界.
                    然而, 跨项目协作的价值却是显而易见的. 文献              [21,22] 研究表明, 直接的跨项目预测存在性能问题, 但如果能
                 够有效融合多项目知识, 缺陷预测的召回率可有一定提升. Herbold                 等人  [23] 提出的  CPDP  方法基准测试研究表明,
                 对于跨项目缺陷预测有必要使用多个数据源和指标. 这些研究结果展示出跨项目协作具有巨大的技术价值和商业
                 价值, 且亟需新的技术范式来突破现有障碍. 更为重要的是, 工业界对此类技术的需求日益迫切, 特别是在人工智
                 能和机器学习技术快速发展的背景下, 数据驱动的软件质量保证方法已成为行业共识, 数据孤岛成为制约跨项目
                 缺陷预测技术实际部署的关键障碍.
                    个性化联邦学习的出现为解决这一困境提供了新的可能性. 联邦学习概念首次被提出时, 就展示出其在保护
                 数据隐私的同时实现协作学习的巨大潜力. 进一步被提出的个性化联邦学习方法, 通过为每个参与方维护个性化
                 模型, 有效解决了异构环境下的模型适配问题. 这种技术路径与软件缺陷预测的实际需求高度契合: 各项目组可以
                 在不暴露敏感数据的前提下参与协作训练, 同时获得适合自身项目特征的定制化预测模型.
                    然而, 将个性化联邦学习直接应用于软件缺陷预测仍面临诸多技术挑战. 软件缺陷数据具有明显的类别不平
                 衡特征, 传统的联邦学习算法往往无法有效处理这种数据分布. 此外, 软件工程数据的高维稀疏特性也对模型设计
   223   224   225   226   227   228   229   230   231   232   233