Page 233 - 《软件学报》2026年第7期
P. 233
2918 软件学报 2026 年第 37 卷第 7 期
和 Dropout 层, 以增强训练的稳定性和泛化能力. 随后, 数据被送入一个 LSTM 层, 该层专门用于捕获特征序列中
可能存在的时序依赖关系. 经过 LSTM 初步处理后, 特征向量通过一个线性变换映射到高维表示空间:
H (0) = xW input +b input (2)
其中, W input ∈ R d×d model 为权重矩阵, d model 为模型隐藏维度. 该映射将原始特征投影到更适合 Transformer 处理的表示
空间中. Transformer 的核心组件是多头自注意力机制, 其数学表达为:
( )
QK T
Attention(Q,K,V) = Softmax √ V (3)
d 2
Q
K
其中, Q = HW ,K = HW ,V = HW V 分别为查询、键和值矩阵. 通过多头注意力机制, 模型能够从不同子空间并行
捕获度量指标间复杂的非欧几里得上下文交互. 为了缓解梯度消失问题, 每个 Transformer 块均引入了残差连接和
层归一化机制. 最后, 经过特征对齐的全连接层 (采用 LeakyReLU 激活) 进一步提取高阶非线性特征, 并通过
Sigmoid 函数输出预测概率:
p = σ(h (final) W output +b output ) (4)
输入x
... ... ... ... ... ... ... ... ... ... ... ... ... ...
[0, 1] [0, 1] [0, 1]
BatchNorm1d Dropout LSTM Linear BatchNorm1d LeakyReLU(0.1) Dropout Linear BatchNorm1d Linear
... ... ... 输出y
...
[0, 1]
Linear BatchNorm1d LeakyReLU(0.1)
Transformer block�× Number of layers
图 3 时间-上下文融合网络数据流转图
本文采用焦点损失来解决类不平衡问题, 其表达式为:
γ
L Focal = −α(1− p t ) log(p t ) (5)
其中, p t 为真实类别的预测概率, α 和 γ 为调节参数. 焦点损失通过降低易分类样本的权重, 使模型更专注于难分
类的样本, 从而提升对少数类的识别能力. 同时, 引入近端正则化项约束个性化模型参数与全局模型参数之间的
L2 距离, 在保持全局一致性的同时实现个性化学习:
∑
L prox = |θ local −θ global | 2 (6)
总损失函数为:
(7)
L total = L Focal +β· L prox
其中, β 为平衡系数, 控制个性化程度与全局一致性的权衡.
3.4 个性化联邦学习算法
个性化联邦学习是 PRIDE-SDP 框架的核心技术. 传统的联邦学习方法采用统一的全局模型, 在面对异构数据
分布时往往性能不佳. 本框架受 pFedMe 算法启发设计了适用于软件缺陷预测的个性化联邦学习方案, 通过近端

