Page 233 - 《软件学报》2026年第7期
P. 233

2918                                                       软件学报  2026  年第  37  卷第  7  期


                 和  Dropout 层, 以增强训练的稳定性和泛化能力. 随后, 数据被送入一个               LSTM  层, 该层专门用于捕获特征序列中
                 可能存在的时序依赖关系. 经过         LSTM  初步处理后, 特征向量通过一个线性变换映射到高维表示空间:

                                                     H (0)  = xW input +b input                       (2)
                 其中,  W  input  ∈ R d×d model  为权重矩阵,  d model  为模型隐藏维度. 该映射将原始特征投影到更适合  Transformer 处理的表示
                 空间中. Transformer 的核心组件是多头自注意力机制, 其数学表达为:

                                                                    (   )
                                                                    QK  T
                                               Attention(Q,K,V) = Softmax √  V                        (3)
                                                                      d 2
                            Q
                                   K
                 其中,  Q = HW ,K = HW ,V = HW  V   分别为查询、键和值矩阵. 通过多头注意力机制, 模型能够从不同子空间并行
                 捕获度量指标间复杂的非欧几里得上下文交互. 为了缓解梯度消失问题, 每个 Transformer 块均引入了残差连接和
                 层归一化机制. 最后, 经过特征对齐的全连接层               (采用  LeakyReLU  激活) 进一步提取高阶非线性特征, 并通过
                 Sigmoid 函数输出预测概率:

                                                   p = σ(h (final) W output  +b output )              (4)

                 输入x


                   ...    ...    ...   ...  ...  ...  ...  ...   ...     ...  ...    ...  ...      ...
                     [0, 1]                         [0, 1]                      [0, 1]

                   BatchNorm1d  Dropout  LSTM  Linear  BatchNorm1d LeakyReLU(0.1)  Dropout  Linear BatchNorm1d  Linear







                                                        ...    ...      ...    输出y
                                          ...
                                                          [0, 1]

                                                    Linear  BatchNorm1d LeakyReLU(0.1)

                                Transformer block�× Number of layers
                                             图 3 时间-上下文融合网络数据流转图

                    本文采用焦点损失来解决类不平衡问题, 其表达式为:

                                                                γ
                                                   L Focal = −α(1− p t ) log(p t )                    (5)
                 其中,  p t  为真实类别的预测概率,     α 和  γ  为调节参数. 焦点损失通过降低易分类样本的权重, 使模型更专注于难分
                 类的样本, 从而提升对少数类的识别能力. 同时, 引入近端正则化项约束个性化模型参数与全局模型参数之间的
                 L2 距离, 在保持全局一致性的同时实现个性化学习:

                                                         ∑
                                                    L prox =  |θ local −θ global | 2                  (6)
                    总损失函数为:

                                                                                                      (7)
                                                     L total = L Focal +β· L prox
                 其中, β  为平衡系数, 控制个性化程度与全局一致性的权衡.
                  3.4   个性化联邦学习算法
                    个性化联邦学习是       PRIDE-SDP  框架的核心技术. 传统的联邦学习方法采用统一的全局模型, 在面对异构数据
                 分布时往往性能不佳. 本框架受          pFedMe 算法启发设计了适用于软件缺陷预测的个性化联邦学习方案, 通过近端
   228   229   230   231   232   233   234   235   236   237   238