Page 95 - 《软件学报》2026年第4期
P. 95
1536 软件学报 2026 年第 37 卷第 4 期
Q ∈ R M×d Q K ∈ R N×d K V ∈ R N×d V N 表示键-值对数量, M 表示查询向量数量. 那
设查询矩阵 , 键矩阵 , 值矩阵 , 其中
么, 缩放点积注意力计算为:
( )
Q· K ⊤
Attention(Q,K,V) = Softmax √ (4)
d K
其中, Softmax 函数对 Q· K ∈ R M×N 的每一行进行归一化, 输出为查询对值的加权聚合.
⊤
该注意力机制被应用于组成 Transformer 基本框架的多头自注意力层 MSA(·) 中, 每个头独立学习不同的注意
K
V
Q
⊤
力子空间. 令输入序列为 X = [x 1 ,..., x N ] ∈ R N×d , 查询、键、值分别记为 X 、X 、X . 设 l 为注意力头的数量, 那
么 MSA 输出结构为:
( )
Q
K
MSA X ,X ,X V = Concat(h 1 ,...,h i ,...,h l )W (5)
( )
K
K
Q
Q
V
h i = Attention X ·W ,X ·W ,X ·W i V , i ∈ [1,l] (6)
i
i
d
Q
其中, W ∈ R md V ×d , W , W , W ∈ R d K ×d 均表示可训练投影矩阵, 通常设置 d K = d V = m .
V
K
i
i
i
为进一步提升模型容量与计算效率, 专家混合结构 (MoE 结构) [35] 被提出用于对不同专家网络进行稀疏激活.
该结构引入了门控函数 (gating function), 在给定输入的条件下对多个子网络输出进行加权聚合. 如图 2 所示,
MoE 架构中所使用的专家混合层 (MoE 层) 通过引入多个子网络 (称为专家) 与一个门控网络实现稀疏激活机制.
在每个 MoE 层中, 输入首先经过门控网络进行评分, 动态选择其中一小部分专家 (如 Top-k) 参与前向计算. 被选
中的专家对输入进行独立变换, 其输出经过门控权重加权后求和, 作为该层的最终输出. 该结构允许模型在保持计
算成本不变的情况下显著提升参数规模与表达能力, 被广泛用于构建高效的大规模神经网络. 因此, MoE 层可以
被看作是嵌入在循环神经网络结构 (recurrent neural network, RNN) 中的一种特殊编码层. 在 MoE 层中, 稀疏门控
函数选择两个专家参与计算, 它们的输出将根据门控网络的输出进行调制.
Task 1 Task t
. . . . . .
p t−1 p t Pre-trained projection layer max η t
Iterative
aggregation
Prompt-tuning
vectors Classifier
update
...
Logit scores
p 1
MLP
. . .
Non-linear residual connection
forward
p t−1
Score function for pre-trained experts
Prompt forward Score function for prompt-tuning
pool p t Value Experts scores
vectors Score function for expert gate
图 2 TP-MoE 模型架构简要示意图.
{ } N
d
N
d
具体来说, MoE 层由给定的 N 个专家网络 f j : R → R d V 和一个门控函数 {G : R → R } 组成. 当给定输入
j=1
h ∈ R , MoE 层的输出为:
d
( )
exp s j (h)
N ∑ N ∑
y = G(h) j · f j (h) = ∑ N · f j (h) (7)
j=1 j=1 exp(s i (h))
i=1
其中, s j (h) 为门控网络对第 个专家的打分, G(h) j 为第 j 个专家的 Softmax 输出的权重分布.
j

